GUIDE 01

Écart type : la différence entre échantillon (n−1) et population (n)

Pourquoi divise-t-on par n−1 ? Correction de Bessel, STDEV.S et STDEV.P d'Excel, et un exemple calculé à la main.

L'écart type est l'indicateur le plus utilisé pour mesurer à quel point les données sont dispersées autour de la moyenne. Pourtant, lorsqu'on calcule un écart type avec une calculatrice ou avec Excel, on obtient parfois deux valeurs différentes. L'une divise la somme des carrés des écarts par n, l'autre par n−1. Cet article explique, exemples à l'appui, ce que signifient ces deux formules, pourquoi on utilise n−1 pour un échantillon et laquelle choisir en pratique.

La différence entre les deux formules

Lorsque l'on connaît toute la population, l'écart type (écart type de la population) s'écrit :

  • Écart type de la population : σ = √(Σ(x−μ)² / N)

Lorsque l'on estime la dispersion d'une population à partir d'un échantillon qui n'en représente qu'une partie, on utilise la formule suivante :

  • Écart type de l'échantillon : s = √(Σ(x−x̄)² / (n−1))

Les différences sont au nombre de deux. D'abord, le centre n'est pas la moyenne de la population μ mais la moyenne de l'échantillon . Ensuite, on divise par n−1 et non par n. Cette seconde différence s'appelle la correction de Bessel (Bessel's correction).

Pourquoi diviser par n−1

La moyenne de l'échantillon est calculée à partir de ce même échantillon ; elle se place donc au plus près des données de l'échantillon. De fait, la somme des carrés des écarts Σ(x−c)² est minimale lorsque c est la moyenne de l'échantillon. Mesurer les écarts par rapport à au lieu de la vraie moyenne μ donne donc une somme des carrés systématiquement trop petite.

Mathématiquement, l'espérance de la variance divisée par n vaut (n−1)/n × σ². Par exemple, avec un échantillon de taille 5, la variance divisée par n ne vaut en moyenne que 4/5 = 80% de la vraie variance. Pour corriger cette sous-estimation, on multiplie par n/(n−1), ce qui revient à diviser par n−1. Ainsi, devient un estimateur sans biais de la variance de la population σ².

Une autre façon de l'expliquer passe par les degrés de liberté. Les n écarts (x−x̄) sont soumis à une contrainte : leur somme vaut toujours 0. Dès que n−1 écarts sont fixés, le dernier est donc déterminé automatiquement. Comme seules n−1 informations peuvent varier librement, on divise par n−1.

Attention : est un estimateur sans biais de σ², mais sa racine carrée s n'est pas un estimateur sans biais de σ. La racine carrée étant une fonction concave, s est en moyenne légèrement inférieur à σ. Cet écart devient toutefois négligeable quand l'échantillon grandit, si bien qu'en pratique on utilise s tel quel.

Exemple calculé à la main

Prenons les 8 valeurs suivantes.

2, 4, 4, 4, 5, 5, 7, 9

Étape 1 : la moyenne

x̄ = (2+4+4+4+5+5+7+9) / 8 = 40 / 8 = 5

Étape 2 : écarts et carrés des écarts

Valeur xÉcart x−x̄Carré de l'écart
2−39
4−11
4−11
4−11
500
500
724
9416

La somme des écarts vaut −3−1−1−1+0+0+2+4 = 0, ce qui confirme la contrainte évoquée plus haut. La somme des carrés des écarts vaut 9+1+1+1+0+0+4+16 = 32.

Étape 3 : les deux variances et écarts types

CasVarianceÉcart type
Population (÷n)32 / 8 = 4√4 = 2
Échantillon (÷(n−1))32 / 7 ≈ 4.5714√4.5714 ≈ 2.1381

Si ces 8 valeurs constituent l'intégralité de ce qui vous intéresse, l'écart type vaut 2. Si, au contraire, ces 8 valeurs ont été tirées d'un ensemble plus grand dont vous voulez estimer la dispersion, il faut rapporter environ 2.1381. Quand n est petit comme ici (8), l'écart entre les deux valeurs est d'environ 7 %, ce qui se remarque. Pour n = 100, il tombe à environ 0.5 %, et pour n = 1,000 à environ 0.05 %.

Quand utiliser quelle formule

Le critère est simple : « les données dont je dispose représentent-elles la totalité de ce que je veux décrire, ou seulement une partie ? »

  • Population (÷n) : les données couvrent l'ensemble étudié, par exemple quand on décrit la dispersion des notes des 30 élèves d'une classe pour cette classe seulement, ou la distribution des salaires de tous les employés d'une entreprise.
  • Échantillon (÷(n−1)) : les données sont une partie d'un ensemble plus grand, par exemple quand on estime l'opinion de toute la population à partir de 500 répondants, ou la variabilité d'un procédé entier à partir de 20 pièces prélevées sur la ligne de production.

En pratique, la plupart des données sont des échantillons. Les calculs qui mènent à une inférence, comme les intervalles de confiance, le test t ou le calcul de la taille d'échantillon, supposent tous l'écart type de l'échantillon s. En cas de doute, la formule de l'échantillon est le choix prudent.

Correspondance avec Excel et les outils de programmation

OutilÉchantillon (÷(n−1))Population (÷n)
Excel · Google SheetsSTDEV.S, VAR.S (anciennes versions STDEV)STDEV.P, VAR.P (anciennes versions STDEVP)
Rsd(), var()correction manuelle nécessaire
Python pandasSeries.std() par défaut ddof=1std(ddof=0)
Python NumPynp.std(x, ddof=1)np.std(x) par défaut ddof=0

NumPy et pandas ont notamment des valeurs par défaut opposées : il arrive souvent qu'on obtienne des résultats différents à partir des mêmes données. Avant de comparer des résultats, vérifiez d'abord quelle formule a été utilisée.

Comment lire un écart type

L'écart type s'exprime dans la même unité que les données d'origine : des « points » pour des notes, des « cm » pour des tailles. La variance, elle, a une unité au carré et se lit mal intuitivement ; c'est pourquoi on rapporte généralement l'écart type. Si les données suivent à peu près une loi normale, on peut considérer qu'environ 68 % des valeurs se trouvent dans l'intervalle moyenne ± 1 écart type et environ 95 % dans moyenne ± 2 écarts types. Pour comparer la dispersion de deux groupes dont les moyennes sont très différentes, on regarde parfois aussi le coefficient de variation (CV), c'est-à-dire l'écart type divisé par la moyenne.

Erreurs fréquentes

  1. Ne pas préciser la formule utilisée dans un rapport : sur un petit échantillon, les valeurs diffèrent nettement ; indiquez le symbole s ou σ, ou l'expression « écart type de l'échantillon ».
  2. Confondre écart type et erreur type : l'erreur type SE = s / √n mesure la dispersion de la moyenne de l'échantillon, pas celle des données individuelles. C'est l'erreur type qui intervient dans les intervalles de confiance.
  3. Calculer un écart type d'échantillon avec n = 1 : n−1 vaut alors 0, et la quantité n'est pas définie. Il est normal que la calculatrice renvoie une erreur.
  4. Ne pas vérifier les valeurs aberrantes : comme l'écart type utilise des carrés, une seule valeur extrême peut le faire varier fortement. Si vous soupçonnez des valeurs aberrantes, regardez aussi l'écart interquartile (IQR).

Collez vos données dans la calculatrice de statistiques descriptives de ce site pour voir côte à côte l'écart type de l'échantillon et celui de la population.

À retenir

  • Divisez par n si les données couvrent tout l'ensemble étudié, par n−1 si elles ne sont qu'une partie d'un ensemble plus grand.
  • La variance d'échantillon divisée par n a pour espérance (n−1)/n × σ² et sous-estime donc la variance ; diviser par n−1 corrige ce biais (correction de Bessel).
  • Pour l'exemple 2, 4, 4, 4, 5, 5, 7, 9, l'écart type vaut 2 pour la population et environ 2.1381 pour l'échantillon.
  • Excel distingue STDEV.S (échantillon) et STDEV.P (population) ; NumPy et pandas ont des valeurs par défaut différentes.
  • Distinguez l'écart type (dispersion des données) de l'erreur type (dispersion de la moyenne).

→ Calculer maintenant: Descriptive

Mis à jour le 2026-09-23