浏览笔记
概率论是从模型出发,推导可能出现的观测结果;统计学则是从观测数据入手,反向推断背后的过程、参数或做出决策。
核心学习路径
事件、计数、条件概率与独立性;
随机变量、分布、期望、方差与协方差;
大数定律与中心极限定理 ;
抽样、估计量、不确定性与置信区间 ;
假设检验、效应量与决策错误;
实验设计与样本量规划 。
下面的速查涵盖初等概率模型和重复抽样下的推断,不展开回归、因果推断或完整的检验流程。Harvard Statistics 110 提供更完整的概率课程。
事件、条件概率与独立性
概率模型要指定可能的结果、事件(结果的集合)以及概率。概率非负,整个样本空间的概率为 1,互斥事件的概率可以相加。只有基本结果等可能时,才能使用“有利结果数除以总结果数”。
当 P ( B ) > 0 P(B)>0 P ( B ) > 0 时,条件概率为 P ( A ∣ B ) = P ( A ∩ B ) / P ( B ) P(A\mid B)=P(A\cap B)/P(B) P ( A ∣ B ) = P ( A ∩ B ) / P ( B ) 。若 P ( A ∩ B ) = P ( A ) P ( B ) P(A\cap B)=P(A)P(B) P ( A ∩ B ) = P ( A ) P ( B ) ,两个事件就独立。概率均为正的互斥事件并不独立:一个发生就排除了另一个。贝叶斯更新 利用条件概率,从先验和似然求出后验;P ( A ∣ B ) P(A\mid B) P ( A ∣ B ) 与 P ( B ∣ A ) P(B\mid A) P ( B ∣ A ) 通常不同。
随机变量与分布
随机变量为每个结果赋一个数,分布描述这些数出现的概率。离散变量的概率质量函数 p ( x ) p(x) p ( x ) 之和为 1。若连续变量有密度 f f f ,则概率由积分给出:P ( a ≤ X ≤ b ) = ∫ a b f ( x ) d x P(a\le X\le b)=\int_a^b f(x)\,dx P ( a ≤ X ≤ b ) = ∫ a b f ( x ) d x 。密度值不是点概率;此时 P ( X = x ) = 0 P(X=x)=0 P ( X = x ) = 0 ,而密度值可以大于 1。
模型 含义与假设 均值与方差 Bernoulli( p ) (p) ( p ) 单个指示变量,成功取 1,否则取 0,0 ≤ p ≤ 1 0\le p\le1 0 ≤ p ≤ 1 p p p ;p ( 1 − p ) p(1-p) p ( 1 − p ) Binomial( n , p ) (n,p) ( n , p ) n n n 次独立、成功概率同为 p p p 的伯努利试验中成功的次数n p np n p ;n p ( 1 − p ) np(1-p) n p ( 1 − p ) Normal( μ , σ 2 ) (\mu,\sigma^2) ( μ , σ 2 ) 连续钟形模型,σ > 0 \sigma>0 σ > 0 μ \mu μ ;σ 2 \sigma^2 σ 2 Exponential( λ ) (\lambda) ( λ ) 速率恒为 λ > 0 \lambda>0 λ > 0 的非负等待时间 1 / λ 1/\lambda 1/ λ ;1 / λ 2 1/\lambda^2 1/ λ 2
模型是假设,需要检验是否适合,不能仅凭直方图贴标签。从较小有限总体中不放回抽样,不会得到独立的伯努利试验。
期望与波动
期望是按概率加权的平均:离散情形为 E [ X ] = ∑ x x p ( x ) E[X]=\sum_x xp(x) E [ X ] = ∑ x x p ( x ) ,有密度时为 ∫ x f ( x ) d x \int x f(x)\,dx ∫ x f ( x ) d x ,前提是 E [ ∣ X ∣ ] E[|X|] E [ ∣ X ∣ ] 有限。二阶矩有限时,方差为 Var ( X ) = E [ ( X − E [ X ] ) 2 ] \operatorname{Var}(X)=E[(X-E[X])^2] Var ( X ) = E [( X − E [ X ] ) 2 ] 。标准差是方差的平方根,单位与 X X X 相同。
公平骰子满足 E [ X ] = 3.5 E[X]=3.5 E [ X ] = 3.5 、E [ X 2 ] = 91 / 6 E[X^2]=91/6 E [ X 2 ] = 91/6 ,因此 Var ( X ) = 91 / 6 − 3.5 2 = 35 / 12 \operatorname{Var}(X)=91/6-3.5^2=35/12 Var ( X ) = 91/6 − 3. 5 2 = 35/12 。期望本身未必是可能出现的结果。期望的线性性质 E [ X + Y ] = E [ X ] + E [ Y ] E[X+Y]=E[X]+E[Y] E [ X + Y ] = E [ X ] + E [ Y ] 不需要独立性,但方差满足:
Var ( X + Y ) = Var ( X ) + Var ( Y ) + 2 Cov ( X , Y ) . \operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)+2\operatorname{Cov}(X,Y). Var ( X + Y ) = Var ( X ) + Var ( Y ) + 2 Cov ( X , Y ) .
协方差是 E [ ( X − E [ X ] ) ( Y − E [ Y ] ) ] E[(X-E[X])(Y-E[Y])] E [( X − E [ X ]) ( Y − E [ Y ])] 。二阶矩存在时,独立可推出协方差为零,反过来一般不成立。
从样本到估计
若观测独立同分布,均值为 μ \mu μ 、有限方差为 σ 2 \sigma^2 σ 2 ,样本均值就是无偏估计:E [ X ˉ ] = μ E[\bar X]=\mu E [ X ˉ ] = μ 。它的方差为 σ 2 / n \sigma^2/n σ 2 / n ,标准误 为 σ / n \sigma/\sqrt n σ / n 。标准差描述单个观测的波动,标准误描述重复抽样时估计量的波动。
例如做 100 次独立的伯努利试验,若 p = 0.5 p=0.5 p = 0.5 ,样本比例的标准误为 0.05 0.05 0.05 。取约两倍标准误,可得到近似 95% 正态置信区间的半宽 0.10 0.10 0.10 。在假设成立时,95% 置信区间程序在重复抽样中有 95% 的区间覆盖固定的真实参数;它不是给某次观测所得区间赋予“参数落在其中的后验概率为 95%”。
大数定律说明平均值趋近期望;中心极限定理 描述标准化波动的极限形状。两者都不能消除抽样偏差。如果抽样系统性地遗漏某些人,或受访者自行选择是否参加,更多回答可能只是让有偏估计更精确。使用样本量公式 前,应先说明目标总体与抽样机制;随机分配处理与随机抽取样本解决的是不同问题。
从观测数据计算置信区间
假设测量值独立地来自同一个正态总体,均值和方差均未知。NIST 的均值区间 使用观测到的样本均值 x ˉ \bar x x ˉ 和样本标准差 s s s ,后者计算方差时以 n − 1 n-1 n − 1 为分母:
x ˉ ± t 0.975 , n − 1 s n . \bar x\pm t_{0.975,n-1}\frac{s}{\sqrt n}. x ˉ ± t 0.975 , n − 1 n s .
t 0.975 , n − 1 t_{0.975,n-1} t 0.975 , n − 1 是自由度为 n − 1 n-1 n − 1 的 Student t 分布的 97.5% 分位数。取示例观测 [8, 9, 10, 11, 12],有 x ˉ = 10 \bar x=10 x ˉ = 10 、s 2 = 10 / 4 = 2.5 s^2=10/4=2.5 s 2 = 10/4 = 2.5 、s / 5 ≈ 0.7071 s/\sqrt5\approx0.7071 s / 5 ≈ 0.7071 。使用 t 0.975 , 4 ≈ 2.7764 t_{0.975,4}\approx2.7764 t 0.975 , 4 ≈ 2.7764 ,得到约为 [ 8.037 , 11.963 ] [8.037,11.963] [ 8.037 , 11.963 ] 的 95% 置信区间。这里的精确覆盖率依赖正态性与独立性,仅有五个观测无法证明这些假设成立。这是总体均值的区间,不是包含 95% 未来个体观测的范围。
Bootstrap 与配对模型比较
没有合适的解析区间时,可以用非参数 bootstrap 近似重复抽样:从已有样本中有放回地抽取 n n n 个观测,重新计算统计量,重复多次。百分位区间取这些统计量的 2.5% 与 97.5% 分位数。它是近似方法,不保证精确覆盖;偏斜、偏差、稀有事件或退化样本都可能让结果不可靠。SciPy 的 bootstrap 文档 介绍了百分位、basic 和偏差校正加速(BCa)区间。
在同一批独立测试案例上比较两个固定模型时,先计算逐例损失差 d i = ℓ A ( i ) − ℓ B ( i ) d_i=\ell_A(i)-\ell_B(i) d i = ℓ A ( i ) − ℓ B ( i ) 。若损失越小越好,平均差为正就有利于 B。重采样时抽取案例索引,始终保留每个案例的 A/B 配对;分别抽取 A 和 B 会丢掉这种依赖。平均差的百分位区间包含零,不等于已经证明两模型等效,还要看差异大小对实际决策是否有意义。
重采样单位必须符合抽样设计。同一个人的重复观测需要考虑群组依赖;时间相关数据可能需要合适的时间块,以及关于时间稳定性的假设。对固定预测重采样,只衡量测试样本的不确定性,不包含重新训练模型的变化或未来分布迁移。增加 bootstrap 次数能减少模拟噪声,不能消除原始样本的偏差。分布迁移下的模型评估 需要据此区分不同的不确定性。