跳到主要内容

统计与概率

概率论是从模型出发,推导可能出现的观测结果;统计学则是从观测数据入手,反向推断背后的过程、参数或做出决策。

核心学习路径

  1. 事件、计数、条件概率与独立性;
  2. 随机变量、分布、期望、方差与协方差;
  3. 大数定律与中心极限定理
  4. 抽样、估计量、不确定性与置信区间
  5. 假设检验、效应量与决策错误;
  6. 实验设计与样本量规划

下面的速查涵盖初等概率模型和重复抽样下的推断,不展开回归、因果推断或完整的检验流程。Harvard Statistics 110 提供更完整的概率课程。

事件、条件概率与独立性

概率模型要指定可能的结果、事件(结果的集合)以及概率。概率非负,整个样本空间的概率为 1,互斥事件的概率可以相加。只有基本结果等可能时,才能使用“有利结果数除以总结果数”。

P(B)>0P(B)>0 时,条件概率为 P(AB)=P(AB)/P(B)P(A\mid B)=P(A\cap B)/P(B)。若 P(AB)=P(A)P(B)P(A\cap B)=P(A)P(B),两个事件就独立。概率均为正的互斥事件并不独立:一个发生就排除了另一个。贝叶斯更新利用条件概率,从先验和似然求出后验;P(AB)P(A\mid B)P(BA)P(B\mid A) 通常不同。

随机变量与分布

随机变量为每个结果赋一个数,分布描述这些数出现的概率。离散变量的概率质量函数 p(x)p(x) 之和为 1。若连续变量有密度 ff,则概率由积分给出:P(aXb)=abf(x)dxP(a\le X\le b)=\int_a^b f(x)\,dx。密度值不是点概率;此时 P(X=x)=0P(X=x)=0,而密度值可以大于 1。

模型含义与假设均值与方差
Bernoulli(p)(p)单个指示变量,成功取 1,否则取 0,0p10\le p\le1ppp(1p)p(1-p)
Binomial(n,p)(n,p)nn 次独立、成功概率同为 pp 的伯努利试验中成功的次数npnpnp(1p)np(1-p)
Normal(μ,σ2)(\mu,\sigma^2)连续钟形模型,σ>0\sigma>0μ\muσ2\sigma^2
Exponential(λ)(\lambda)速率恒为 λ>0\lambda>0 的非负等待时间1/λ1/\lambda1/λ21/\lambda^2

模型是假设,需要检验是否适合,不能仅凭直方图贴标签。从较小有限总体中不放回抽样,不会得到独立的伯努利试验。

期望与波动

期望是按概率加权的平均:离散情形为 E[X]=xxp(x)E[X]=\sum_x xp(x),有密度时为 xf(x)dx\int x f(x)\,dx,前提是 E[X]E[|X|] 有限。二阶矩有限时,方差为 Var(X)=E[(XE[X])2]\operatorname{Var}(X)=E[(X-E[X])^2]。标准差是方差的平方根,单位与 XX 相同。

公平骰子满足 E[X]=3.5E[X]=3.5E[X2]=91/6E[X^2]=91/6,因此 Var(X)=91/63.52=35/12\operatorname{Var}(X)=91/6-3.5^2=35/12。期望本身未必是可能出现的结果。期望的线性性质 E[X+Y]=E[X]+E[Y]E[X+Y]=E[X]+E[Y] 不需要独立性,但方差满足:

Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y).\operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)+2\operatorname{Cov}(X,Y).

协方差是 E[(XE[X])(YE[Y])]E[(X-E[X])(Y-E[Y])]。二阶矩存在时,独立可推出协方差为零,反过来一般不成立。

从样本到估计

若观测独立同分布,均值为 μ\mu、有限方差为 σ2\sigma^2,样本均值就是无偏估计:E[Xˉ]=μE[\bar X]=\mu。它的方差为 σ2/n\sigma^2/n标准误σ/n\sigma/\sqrt n。标准差描述单个观测的波动,标准误描述重复抽样时估计量的波动。

例如做 100 次独立的伯努利试验,若 p=0.5p=0.5,样本比例的标准误为 0.050.05。取约两倍标准误,可得到近似 95% 正态置信区间的半宽 0.100.10。在假设成立时,95% 置信区间程序在重复抽样中有 95% 的区间覆盖固定的真实参数;它不是给某次观测所得区间赋予“参数落在其中的后验概率为 95%”。

大数定律说明平均值趋近期望;中心极限定理描述标准化波动的极限形状。两者都不能消除抽样偏差。如果抽样系统性地遗漏某些人,或受访者自行选择是否参加,更多回答可能只是让有偏估计更精确。使用样本量公式前,应先说明目标总体与抽样机制;随机分配处理与随机抽取样本解决的是不同问题。

从观测数据计算置信区间

假设测量值独立地来自同一个正态总体,均值和方差均未知。NIST 的均值区间使用观测到的样本均值 xˉ\bar x 和样本标准差 ss,后者计算方差时以 n1n-1 为分母:

xˉ±t0.975,n1sn.\bar x\pm t_{0.975,n-1}\frac{s}{\sqrt n}.

t0.975,n1t_{0.975,n-1} 是自由度为 n1n-1 的 Student t 分布的 97.5% 分位数。取示例观测 [8, 9, 10, 11, 12],有 xˉ=10\bar x=10s2=10/4=2.5s^2=10/4=2.5s/50.7071s/\sqrt5\approx0.7071。使用 t0.975,42.7764t_{0.975,4}\approx2.7764,得到约为 [8.037,11.963][8.037,11.963] 的 95% 置信区间。这里的精确覆盖率依赖正态性与独立性,仅有五个观测无法证明这些假设成立。这是总体均值的区间,不是包含 95% 未来个体观测的范围。

Bootstrap 与配对模型比较

没有合适的解析区间时,可以用非参数 bootstrap 近似重复抽样:从已有样本中有放回地抽取 nn 个观测,重新计算统计量,重复多次。百分位区间取这些统计量的 2.5% 与 97.5% 分位数。它是近似方法,不保证精确覆盖;偏斜、偏差、稀有事件或退化样本都可能让结果不可靠。SciPy 的 bootstrap 文档介绍了百分位、basic 和偏差校正加速(BCa)区间。

在同一批独立测试案例上比较两个固定模型时,先计算逐例损失差 di=A(i)B(i)d_i=\ell_A(i)-\ell_B(i)。若损失越小越好,平均差为正就有利于 B。重采样时抽取案例索引,始终保留每个案例的 A/B 配对;分别抽取 A 和 B 会丢掉这种依赖。平均差的百分位区间包含零,不等于已经证明两模型等效,还要看差异大小对实际决策是否有意义。

重采样单位必须符合抽样设计。同一个人的重复观测需要考虑群组依赖;时间相关数据可能需要合适的时间块,以及关于时间稳定性的假设。对固定预测重采样,只衡量测试样本的不确定性,不包含重新训练模型的变化或未来分布迁移。增加 bootstrap 次数能减少模拟噪声,不能消除原始样本的偏差。分布迁移下的模型评估需要据此区分不同的不确定性。

探索关联打开关联网络