跳到主要内容

中心极限定理

中心极限定理(CLT)描述独立同分布观测的标准化样本均值如何趋近正态分布。下面讨论的是均值有限、方差有限且非零的经典版本,而不是任意数据分布。

定义

X1,X2,X_1,X_2,\ldots 为独立同分布(i.i.d.)的随机变量,具有有限均值 μ\mu 和有限非零方差 σ2\sigma^2。经典 CLT 指出,标准化后的样本均值依分布收敛于标准正态分布:

n(Xˉnμ)σdN(0,1).\frac{\sqrt{n}(\bar X_n-\mu)}{\sigma}\xrightarrow{d}N(0,1).

在实际工程应用中,当 nn 足够大时,我们通常使用以下近似:

XˉnN(μ,σ2n).\bar{X}_n \approx N\left(\mu, \frac{\sigma^2}{n}\right).

变量说明:

  • Xˉn\bar{X}_nnn 个样本的均值。
  • μ\mu:总体均值。
  • σ2\sigma^2:总体方差。
  • nn:样本量。

用途

  • 正态近似:在上述假设下,样本量足够大时均值的分布近似正态;所需样本量取决于总体分布。
  • 推断基础:允许我们通过样本均值对总体均值进行统计推断(如置信区间、假设检验)。
  • 精度提升:随着 nn 增加,标准误(SE)按 1n\frac{1}{\sqrt{n}} 的速度下降,估计值更稳定。

典型应用场景

  • 抽样调查:从少量样本估计投票意向、用户偏好等总体参数。
  • 质量控制:监控生产线上的重量、体积等指标,判断过程是否受控。
  • 金融分析:在假设适用时估计平均收益,而非据此认定单期收益或尾部风险服从正态分布。

局限与陷阱

  • 小样本失效:当 nn 较小时,若总体分布严重偏斜(如长尾分布),正态近似可能偏差较大。
  • 独立性假设:CLT 严格要求观测值独立。若数据存在自相关(如时间序列),标准 CLT 不适用,需使用其他变体。

Python 示例

以下代码通过模拟指数分布(强右偏)的样本均值,直观展示 CLT 的效果:

import numpy as np
import matplotlib.pyplot as plt

rng = np.random.default_rng(42)
sample_size = 30
num_samples = 5000

# 指数分布数据严重右偏,非正态
sample_means = [rng.exponential(scale=1, size=sample_size).mean()
for _ in range(num_samples)]

# 绘制样本均值的分布直方图
plt.hist(sample_means, bins=30, color='blue', edgecolor='black', alpha=0.7)
plt.title('Distribution of Sample Means')
plt.xlabel('Sample Mean')
plt.ylabel('Frequency')
plt.show()

尽管原始数据来自右偏的指数分布,但重复抽样得到的样本均值直方图呈现出明显的钟形曲线。这正是 CLT 提供的正态近似效果。

为什么要乘以根号 n?

独立性使和的方差等于各方差之和。再把和除以 nn,得到 Var(Xˉn)=nσ2/n2=σ2/n\operatorname{Var}(\bar X_n)=n\sigma^2/n^2=\sigma^2/n,所以均值波动的尺度是 σ/n\sigma/\sqrt n。在假设成立时,这个方差恒等式是精确的;正态分布才是定理中的渐近部分。概率速查区分了标准差与标准误。

代码中的指数总体满足 μ=σ=1\mu=\sigma=1。当 n=30n=30 时,均值的标准误为 1/300.1831/\sqrt{30}\approx0.183;当 n=100n=100 时为 0.1,可作正态近似 P(0.804Xˉ1001.196)0.95P(0.804\le\bar X_{100}\le1.196)\approx0.95。这里给的是已知总体均值周围,重复抽样均值落入的范围,不是从某次数据算出的置信区间。样本量增至四倍,标准误减半,而不是减至四分之一。

样本再大也未必够

不存在普遍适用的“n=30n=30 就足够”规则。稀有事件和强偏斜可能需要大得多的样本量,才能给出有用的尾部概率。标准柯西分布没有均值和方差;其独立样本的平均值仍服从标准柯西分布,不会集中或趋于正态。若所有观测都等于同一个随机变量 YY,则任意 nn 都有 Xˉn=Y\bar X_n=Y,依赖性使平均无法带来通常的降噪收益。

大数定律描述均值附近的集中,CLT 描述中心化、缩放后的形状,观测值本身不会因此变成正态分布。若 σ\sigma 未知,以样本标准差代替会引入估计不确定性:精确的 Student t 区间要求观测独立且正态,渐近的学生化推断则依赖额外的大样本论证。两种定理都不能修复有偏抽样,也不能证明金融尾部风险服从正态分布。

参考资料

探索关联打开关联网络