Aller au contenu principal

Formule de taille d’échantillon

Ces formules donnent des approximations de planification pour des échantillons aléatoires simples, lorsque l’objectif est un intervalle de confiance pour une moyenne ou une proportion. Elles ne garantissent pas à elles seules la significativité statistique ni la généralisabilité ; les plans en grappes, populations finies, non-réponses attendues et tests d’hypothèse exigent d’autres ajustements ou des ajustements supplémentaires.

1. Estimer une moyenne de population​

Pour déterminer la taille nécessaire afin d’estimer une moyenne de population avec un niveau de confiance et une précision voulus :

n=(Zα/2×σE)2n = \left(\frac{Z_{\alpha/2} \times \sigma}{E}\right)^2
  • nn : taille d’échantillon requise
  • Zα/2Z_{\alpha/2} : valeur critique positive de queue supérieure, définie par P(Z>Zα/2)=α/2P(Z>Z_{\alpha/2})=\alpha/2 pour Z∼N(0,1)Z\sim N(0,1) ; soit le quantile 1−α/21-\alpha/2 (environ 1.96 pour 95 %)
  • σ\sigma : écart-type estimé de la population
  • EE : demi-largeur cible de l’intervalle, dans les unités de la moyenne ; pas une borne garantie de l’erreur réalisée

Exemple : calcul pour une moyenne​

Pour une étude à 95 % de confiance, avec un écart-type de population estimé à 10 et une marge d’erreur de 2 :

import math
from statistics import NormalDist

confidence_level = 0.95
sigma = 10
E = 2
Z = NormalDist().inv_cdf((1 + confidence_level) / 2)
n = math.ceil((Z * sigma / E)**2)
print(n) # 97

2. Estimer une proportion de population​

Pour calculer la taille nécessaire afin d’estimer une proportion dans une marge d’erreur donnée :

n=Zα/22×p×(1−p)E2n = \frac{Z_{\alpha/2}^2 \times p \times (1 - p)}{E^2}
  • pp : proportion estimée de l’attribut dans la population
  • EE : marge d’erreur

Exemple : calcul pour une proportion​

Pour une enquête où environ 50 % de la population devrait répondre positivement, avec 95 % de confiance et une marge d’erreur de 5 % :

import math
from statistics import NormalDist

confidence_level = 0.95
p = 0.5
E = 0.05
Z = NormalDist().inv_cdf((1 + confidence_level) / 2)
n = math.ceil(Z**2 * p * (1 - p) / E**2)
print(n) # 385

Arrondissez toujours au supérieur : un arrondi inférieur peut manquer la marge d’erreur demandée. La formule de moyenne suppose aussi une valeur de planification raisonnable pour σ\sigma ; celle de proportion utilise p=0.5p=0.5 sans estimation antérieure, car ce choix est conservateur. Majorez le résultat pour la non-réponse attendue et tenez compte des effets de plan lorsque les observations sont pondérées ou groupées.

Dérivation et interprétation​

Au niveau de confiance 1−α1-\alpha, un intervalle normal pour une moyenne a une demi-largeur Zα/2σ/nZ_{\alpha/2}\sigma/\sqrt n. Imposer qu'elle ne dépasse pas E>0E>0 et résoudre pour nn donne la première formule. Une observation de Bernoulli a une variance p(1−p)p(1-p) : la substituer donne la formule de proportion. Puisque p(1−p)=1/4−(p−1/2)2p(1-p)=1/4-(p-1/2)^2, choisir p=0.5p=0.5 maximise le besoin lorsque pp est inconnu.

Les exemples demandent 97 observations complètes pour la moyenne et 385 pour la proportion. Ce dernier utilise une marge absolue de 0.05, soit cinq points de pourcentage, et non 5 % de la proportion estimée. Chaque bloc s'exécute indépendamment avec la bibliothèque standard de Python. Diviser EE par deux multiplie approximativement l'effectif par quatre.

Ce sont des formules de planification par approximation normale. L'intervalle de moyenne à σ\sigma connu est exact pour des observations normales indépendantes ; sinon, il dépend d'une approximation centrale limite appropriée. Avec σ\sigma inconnu et un petit échantillon, il peut falloir un calcul itératif fondé sur Student et une marge pour l'incertitude de l'écart-type pilote. Pour une proportion proche de zéro ou un, l'approximation normale peut être mauvaise ; ne remplacez pas pp par 0 ou 1 pour conclure qu'aucune donnée n'est nécessaire. Choisissez une méthode d'intervalle binomial et planifiez sa largeur.

Population finie et taux de réponse​

Pour un échantillonnage aléatoire simple sans remise dans une population de taille NN, la variance de la proportion reçoit le facteur (N−n)/(N−1)(N-n)/(N-1). Si n0n_0 est l'effectif non arrondi calculé ci-dessus pour une proportion, résoudre pour nn donne

nfinite=⌈Nn0N+n0−1⌉.n_{\mathrm{finite}}=\left\lceil\frac{Nn_0}{N+n_0-1}\right\rceil.

Avec N=1000N=1000, 95 % de confiance, p=0.5p=0.5 et E=0.05E=0.05, n0≈384.146n_0\approx384.146 et la cible corrigée vaut 278 réponses complètes. Pour un taux de réponse attendu de 0.8, inviter ⌈278/0.8⌉=348\lceil278/0.8\rceil=348 personnes donne un effectif attendu, pas garanti. Ce calcul ne préserve pas l'échantillonnage aléatoire simple si la non-réponse dépend du résultat étudié. Augmenter les invitations ne supprime pas à lui seul le biais de non-réponse.

L'analyse de puissance pour détecter une différence demande aussi une taille d'effet, une puissance cible, un test et une répartition entre groupes. C'est une autre question que l'estimation d'une moyenne ou proportion avec une largeur d'intervalle donnée.

Pour détecter un changement, les exemples de taille d’échantillon du NIST font aussi intervenir l’amplitude à détecter et la puissance souhaitée. Comparez ces entrées aux formules de précision de cette page avant de choisir votre méthode de planification.

Référence et liens utiles​

Explorer les liensOuvrir le réseau