Théorème central limite
Le théorème central limite est un principe statistique fondamental qui décrit le comportement de la moyenne d’un grand nombre de variables aléatoires indépendantes et identiquement distribuées.
Définition
Soient des variables aléatoires indépendantes et identiquement distribuées, de moyenne finie et de variance finie non nulle . Le TCL classique affirme que la moyenne d’échantillon standardisée converge en loi vers une variable normale centrée réduite :
Pour un fini grand, on utilise souvent l’approximation :
avec :
- : moyenne des observations de l’échantillon ;
- : moyenne de la population ;
- : variance de la population ;
- : taille de l’échantillon.
Importance
- Normalisation : sous les hypothèses indiquées, la distribution de la moyenne devient approximativement normale pour un échantillon assez grand ; la taille nécessaire dépend de la population.
- Prédictibilité : il permet d’inférer les moyennes de population à partir de moyennes d’échantillon.
- Réduction d’erreur : lorsque la taille augmente, l’erreur standard (SE) diminue et les estimations gagnent en précision.
Applications
- Sondages et enquêtes : estimation de paramètres de population, tels que les intentions de vote ou préférences de consommation.
- Contrôle qualité : suivi de procédés de fabrication mesurant poids, volume et autres paramètres.
- Finance : estimation des rendements moyens d’instruments financiers afin d’optimiser les portefeuilles.
Limites
- Petits échantillons : le TCL peut mal s’appliquer, surtout si la population est très asymétrique.
- Observations dépendantes : le théorème suppose l’indépendance des échantillons ; sans elle, il peut ne pas s’appliquer.
Exemple de code Python
Pour illustrer le TCL, le code suivant simule la distribution de la moyenne d’échantillon :
import numpy as np
import matplotlib.pyplot as plt
rng = np.random.default_rng(42)
sample_size = 30
num_samples = 5000
# Exponential data are strongly right-skewed, not normally distributed.
sample_means = [rng.exponential(scale=1, size=sample_size).mean()
for _ in range(num_samples)]
# Plot distribution of sample means
plt.hist(sample_means, bins=30, color='blue', edgecolor='black', alpha=0.7)
plt.title('Distribution of Sample Means')
plt.xlabel('Sample Mean')
plt.ylabel('Frequency')
plt.show()
Cet exemple part d’une population exponentielle asymétrique. L’histogramme des moyennes répétées devient bien plus en cloche que la distribution source, ce qui illustre l’approximation du TCL.
Pourquoi une échelle en racine de n ?
L'indépendance rend la variance d'une somme égale à la somme des variances. Diviser cette somme par donne . La moyenne fluctue donc à l'échelle . Cette identité de variance est exacte sous les hypothèses ; la normalité est la partie asymptotique du théorème. La référence de probabilités distingue écart-type et erreur standard.
Pour la population exponentielle du code, . Avec , l'erreur standard de la moyenne est . Avec , elle vaut 0.1, d'où l'approximation normale . Ce sont des bornes pour des moyennes répétées autour d'une moyenne de population connue, pas un intervalle de confiance calculé sur un jeu de données observé. Quadrupler divise l'erreur standard par deux, pas par quatre.
Quand un grand échantillon ne suffit pas
Il n'existe pas de règle universelle « suffit ». Des événements rares ou une forte asymétrie peuvent demander bien davantage pour estimer correctement des probabilités de queue. Une population de Cauchy standard n'a ni moyenne ni variance, et la moyenne de ses observations indépendantes reste de Cauchy standard : elle ne se concentre pas et ne devient pas normale. Si toutes les observations égalent la même variable , alors pour tout ; la dépendance empêche le gain habituel.
La loi des grands nombres décrit la concentration autour de la moyenne ; le TCL décrit la forme après centrage et changement d'échelle. Les observations elles-mêmes ne deviennent pas normales. Remplacer un inconnu par l'écart-type empirique ajoute de l'incertitude : un intervalle exact de Student exige des observations normales indépendantes, tandis que l'inférence studentisée asymptotique demande un raisonnement supplémentaire à grand échantillon. Aucun théorème ne corrige un échantillonnage biaisé ni ne prouve la normalité du risque financier extrême.