Quand on conçoit un sondage, la première question qui se pose est : « combien de personnes faut-il interroger ? ». Trop peu, et l'erreur des résultats est trop grande pour qu'ils servent à quelque chose ; trop, et l'on gaspille du temps et de l'argent. Pour un sondage qui estime une proportion, la taille d'échantillon s'obtient par une formule simple dès que l'on a fixé la marge d'erreur et le niveau de confiance souhaités.
La formule de base
Pour estimer une proportion p de la population avec une marge d'erreur d'au plus E, la taille d'échantillon nécessaire est :
n = z² × p(1−p) / E²
La signification de chaque symbole est la suivante.
z: valeur critique de la loi normale centrée réduite correspondant au niveau de confiance (environ 1.645 à 90 %, environ 1.960 à 95 %, environ 2.576 à 99 %)p: proportion de réponses attendueE: marge d'erreur tolérée (en décimal : 0.03 pour ±3 pts)
Cette formule s'obtient en posant la marge d'erreur de l'intervalle de confiance d'une proportion p̂ ± z × √(p̂(1−p̂)/n) égale à E, puis en résolvant en n. Le résultat s'arrondit toujours à l'entier supérieur. Arrondir vers le bas ne permettrait pas d'atteindre la marge d'erreur visée.
Pourquoi utiliser p = 0.5
Avant l'enquête, on ne connaît pas la vraie proportion, alors que la formule contient p. On utilise alors généralement p = 0.5, car p(1−p) atteint sa valeur maximale de 0.25 lorsque p vaut 0.5.
| p | p(1−p) |
|---|---|
| 0.1 ou 0.9 | 0.09 |
| 0.2 ou 0.8 | 0.16 |
| 0.3 ou 0.7 | 0.21 |
| 0.5 | 0.25 |
Autrement dit, la taille d'échantillon calculée avec p=0.5 est la valeur la plus prudente, qui garantit la marge d'erreur quelle que soit la vraie proportion. Lorsqu'un même questionnaire pose plusieurs questions, elle convient aussi à toutes les questions. Si une enquête précédente fournit une information fiable indiquant une proportion d'environ 20 %, on peut calculer avec p=0.2 et réduire l'échantillon. À 95 % et ±5 pts, il faut 385 personnes avec p=0.5, mais 246 avec p=0.2.
Exemple : niveau de confiance de 95 %, marge d'erreur de ±5 pts
z = 1.96,p = 0.5,E = 0.05n = 1.96² × 0.25 / 0.05² = 3.8415 × 0.25 / 0.0025 ≈ 384.15- Arrondi à l'entier supérieur : 385 personnes
La mention « ±3.1 pts au niveau de confiance de 95 % » que l'on voit souvent dans les sondages électoraux correspond à un échantillon d'environ 1,000 personnes.
Taille d'échantillon nécessaire selon le niveau de confiance et la marge d'erreur
Valeurs pour une population suffisamment grande et p=0.5 (toutes arrondies à l'entier supérieur).
| Niveau de confiance | ±1 pt | ±3 pts | ±5 pts |
|---|---|---|---|
| 90 % | 6,764 | 752 | 271 |
| 95 % | 9,604 | 1,068 | 385 |
| 99 % | 16,588 | 1,844 | 664 |
Ce tableau fait apparaître deux tendances.
- Pour diviser la marge d'erreur par deux, il faut environ 4 fois plus d'échantillon, car n est inversement proportionnel à E². Pour être 5 fois plus précis, en passant de ±5 pts à ±1 pt, il en faut 25 fois plus.
- Passer d'un niveau de confiance de 95 % à 99 % demande environ 1.73 fois plus d'échantillon, puisque
(2.576/1.960)² ≈ 1.73.
À l'inverse : trouver la marge d'erreur à partir de la taille d'échantillon
Si la taille d'échantillon est déjà fixée, on utilise la formule à l'envers pour obtenir la marge d'erreur.
E = z × √(p(1−p) / n)
À 95 % et avec p=0.5, 200 répondants donnent 1.96 × √(0.25/200) ≈ 0.0693 (environ ±6.9 pts), 500 répondants environ ±4.4 pts et 2,000 répondants environ ±2.2 pts. Connaître cette valeur quand on lit les résultats d'une enquête dont le nombre de réponses est donné permet d'estimer si l'écart entre deux options reste dans la marge d'erreur.
Correction pour population finie
La formule ci-dessus suppose une population très grande. Si la population N est petite et que l'échantillon en représente une part importante, l'échantillon nécessaire diminue. C'est ce qu'on appelle la correction pour population finie (FPC).
n = n₀ / (1 + (n₀ − 1) / N)
Ici, n₀ est la valeur obtenue avec la formule précédente (avant arrondi). Certains manuels écrivent le dénominateur 1 + n₀/N ; dès que N atteint quelques centaines, la différence de résultat est négligeable.
Pour une enquête à 95 % et ±5 pts dans une entreprise de 2,000 salariés :
n₀ ≈ 384.15n = 384.15 / (1 + 383.15 / 2000) = 384.15 / 1.1916 ≈ 322.39- Arrondi à l'entier supérieur : 323 personnes
L'évolution selon la taille de la population montre l'effet de la correction (95 %, ±5 pts).
| Population N | Échantillon nécessaire |
|---|---|
| 500 | 218 |
| 2,000 | 323 |
| 10,000 | 370 |
| 100,000 | 383 |
| Très grande | 385 |
Au-delà de quelques dizaines de milliers de personnes, l'échantillon nécessaire est presque indépendant de la taille de la population. C'est pourquoi il faut un échantillon comparable pour sonder avec la même précision un pays de 50 millions d'habitants et une ville de 500,000 habitants. La règle usuelle consiste à appliquer la correction lorsque le taux de sondage (n/N) dépasse 5 %.
Tenir compte du taux de réponse
La formule donne le nombre final de réponses. Le nombre de personnes à solliciter ou à contacter s'obtient en divisant par le taux de réponse attendu.
nombre d'envois = réponses nécessaires / taux de réponse attendu
Pour 385 réponses nécessaires et un taux de réponse attendu de 30 %, 385 / 0.30 ≈ 1,283.3 → il faut solliciter 1,284 personnes. Dans l'exemple de l'entreprise précédent (323 personnes), un taux de réponse de 30 % impose 1,077 envois, soit plus de la moitié de l'effectif.
Cependant, plus le taux de réponse est faible, plus il est probable que les non-répondants diffèrent des répondants (biais de non-réponse). Augmenter l'échantillon ne réduit que l'erreur aléatoire, pas ce biais.
Si vous prévoyez des analyses par sous-groupe
Si vous comptez publier non seulement le résultat global mais aussi des résultats par tranche d'âge ou par région, il faut prévoir l'échantillon nécessaire au sein de chaque sous-groupe. Répartir 385 personnes en 5 tranches d'âge donne environ 77 personnes par groupe, et la marge d'erreur au sein de chaque groupe grimpe à environ ±11 pts (à 95 %). Pour obtenir ±5 pts dans chaque sous-groupe, il faut près de 385 personnes par groupe.
Hypothèses de la formule
- Elle suppose un échantillonnage aléatoire simple. Avec un échantillonnage stratifié ou en grappes, il faut corriger en multipliant par l'effet de plan (design effect).
- Elle sert à estimer une proportion. L'estimation d'une moyenne ou les tests de comparaison de deux groupes utilisent d'autres formules (qui font intervenir l'écart type, la taille d'effet et la puissance).
- Pour un échantillon de convenance (lien public en ligne, etc.), la notion même de marge d'erreur ne s'applique pas rigoureusement.
Entrez le niveau de confiance, la marge d'erreur, la taille de la population et le taux de réponse dans la calculatrice de taille d'échantillon de ce site pour obtenir à la fois le nombre de réponses nécessaires et le nombre d'envois.
À retenir
- L'échantillon nécessaire est
n = z² × p(1−p) / E², et le résultat s'arrondit toujours à l'entier supérieur. - Si p est inconnu, on utilise 0.5, qui maximise
p(1−p), pour un calcul prudent. - À 95 %, il faut 385 personnes pour ±5 pts, 1,068 pour ±3 pts et 9,604 pour ±1 pt.
- Si la population est petite, on corrige avec
n₀ / (1 + (n₀−1)/N): pour N=2,000, il faut 323 personnes. - Le nombre d'envois s'obtient en divisant les réponses nécessaires par le taux de réponse ; gardez en tête qu'augmenter l'échantillon ne réduit pas le biais de non-réponse.