中心极限定理
中心极限定理(CLT)描述独立同分布观测的标准化样本均值如何趋近正态分布。下面讨论的是均值有限、方差有限且非零的经典版本,而不是任意数据分布。
定义
设 为独立同分布(i.i.d.)的随机变量,具有有限均值 和有限非零方差 。经典 CLT 指出,标准化后的样本均值依分布收敛于标准正态分布:
在实际工程应用中,当 足够大时,我们通常使用以下近似:
变量说明:
- : 个样本的均值。
- :总体均值。
- :总体方差。
- :样本量。
用途
- 正态近似:在上述假设下,样本量足够大时均值的分布近似正态;所需样本量取决于总体分布。
- 推断基础:允许我们通过样本均值对总体均值进行统计推断(如置信区间、假设检验)。
- 精度提升:随着 增加,标准误(SE)按 的速度下降,估计值更稳定。
典型应用场景
- 抽样调查:从少量样本估计投票意向、用户偏好等总体参数。
- 质量控制:监控生产线上的重量、体积等指标,判断过程是否受控。
- 金融分析:在假设适用时估计平均收益,而非据此认定单期收益或尾部风险服从正态分布。
局限与陷阱
- 小样本失效:当 较小时,若总体分布严重偏斜(如长尾分布),正态近似可能偏差较大。
- 独立性假设:CLT 严格要求观测值独立。若数据存在自相关(如时间序列),标准 CLT 不适用,需使用其他变体。
Python 示例
以下代码通过模拟指数分布(强右偏)的样本均值,直观展示 CLT 的效果:
import numpy as np
import matplotlib.pyplot as plt
rng = np.random.default_rng(42)
sample_size = 30
num_samples = 5000
# 指数分布数据严重右偏,非正态
sample_means = [rng.exponential(scale=1, size=sample_size).mean()
for _ in range(num_samples)]
# 绘制样本均值的分布直方图
plt.hist(sample_means, bins=30, color='blue', edgecolor='black', alpha=0.7)
plt.title('Distribution of Sample Means')
plt.xlabel('Sample Mean')
plt.ylabel('Frequency')
plt.show()
尽管原始数据来自右偏的指数分布,但重复抽样得到的样本均值直方图呈现出明显的钟形曲线。这正是 CLT 提供的正态近似效果。
为什么要乘以根号 n?
独立性使和的方差等于各方差之和。再把和除以 ,得到 ,所以均值波动的尺度是 。在假设成立时,这个方差恒等式是精确的;正态分布才是定理中的渐近部分。概率速查区分了标准差与标准误。
代码中的指数总体满足 。当 时,均值的标准误为 ;当 时为 0.1,可作正态近似 。这里给的是已知总体均值周围,重复抽样均值落入的范围,不是从某次数据算出的置信区间。样本量增至四倍,标准误减半,而不是减至四分之一。
样本再大也未必够
不存在普遍适用的“ 就足够”规则。稀有事件和强偏斜可能需要大得多的样本量,才能给出有用的尾部概率。标准柯西分布没有均值和方差;其独立样本的平均值仍服从标准柯西分布,不会集中或趋于正态。若所有观测都等于同一个随机变量 ,则任意 都有 ,依赖性使平均无法带来通常的降噪收益。
大数定律描述均值附近的集中,CLT 描述中心化、缩放后的形状,观测值本身不会因此变成正态分布。若 未知,以样本标准差代替会引入估计不确定性:精确的 Student t 区间要求观测独立且正态,渐近的学生化推断则依赖额外的大样本论证。两种定理都不能修复有偏抽样,也不能证明金融尾部风险服从正态分布。