L'écart type est l'indicateur le plus utilisé pour mesurer à quel point les données sont dispersées autour de la moyenne. Pourtant, lorsqu'on calcule un écart type avec une calculatrice ou avec Excel, on obtient parfois deux valeurs différentes. L'une divise la somme des carrés des écarts par n, l'autre par n−1. Cet article explique, exemples à l'appui, ce que signifient ces deux formules, pourquoi on utilise n−1 pour un échantillon et laquelle choisir en pratique.
La différence entre les deux formules
Lorsque l'on connaît toute la population, l'écart type (écart type de la population) s'écrit :
- Écart type de la population :
σ = √(Σ(x−μ)² / N)
Lorsque l'on estime la dispersion d'une population à partir d'un échantillon qui n'en représente qu'une partie, on utilise la formule suivante :
- Écart type de l'échantillon :
s = √(Σ(x−x̄)² / (n−1))
Les différences sont au nombre de deux. D'abord, le centre n'est pas la moyenne de la population μ mais la moyenne de l'échantillon x̄. Ensuite, on divise par n−1 et non par n. Cette seconde différence s'appelle la correction de Bessel (Bessel's correction).
Pourquoi diviser par n−1
La moyenne de l'échantillon x̄ est calculée à partir de ce même échantillon ; elle se place donc au plus près des données de l'échantillon. De fait, la somme des carrés des écarts Σ(x−c)² est minimale lorsque c est la moyenne de l'échantillon. Mesurer les écarts par rapport à x̄ au lieu de la vraie moyenne μ donne donc une somme des carrés systématiquement trop petite.
Mathématiquement, l'espérance de la variance divisée par n vaut (n−1)/n × σ². Par exemple, avec un échantillon de taille 5, la variance divisée par n ne vaut en moyenne que 4/5 = 80% de la vraie variance. Pour corriger cette sous-estimation, on multiplie par n/(n−1), ce qui revient à diviser par n−1. Ainsi, s² devient un estimateur sans biais de la variance de la population σ².
Une autre façon de l'expliquer passe par les degrés de liberté. Les n écarts (x−x̄) sont soumis à une contrainte : leur somme vaut toujours 0. Dès que n−1 écarts sont fixés, le dernier est donc déterminé automatiquement. Comme seules n−1 informations peuvent varier librement, on divise par n−1.
Attention :
s²est un estimateur sans biais deσ², mais sa racine carréesn'est pas un estimateur sans biais deσ. La racine carrée étant une fonction concave,sest en moyenne légèrement inférieur àσ. Cet écart devient toutefois négligeable quand l'échantillon grandit, si bien qu'en pratique on utilisestel quel.
Exemple calculé à la main
Prenons les 8 valeurs suivantes.
2, 4, 4, 4, 5, 5, 7, 9
Étape 1 : la moyenne
x̄ = (2+4+4+4+5+5+7+9) / 8 = 40 / 8 = 5
Étape 2 : écarts et carrés des écarts
| Valeur x | Écart x−x̄ | Carré de l'écart |
|---|---|---|
| 2 | −3 | 9 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 5 | 0 | 0 |
| 5 | 0 | 0 |
| 7 | 2 | 4 |
| 9 | 4 | 16 |
La somme des écarts vaut −3−1−1−1+0+0+2+4 = 0, ce qui confirme la contrainte évoquée plus haut. La somme des carrés des écarts vaut 9+1+1+1+0+0+4+16 = 32.
Étape 3 : les deux variances et écarts types
| Cas | Variance | Écart type |
|---|---|---|
| Population (÷n) | 32 / 8 = 4 | √4 = 2 |
| Échantillon (÷(n−1)) | 32 / 7 ≈ 4.5714 | √4.5714 ≈ 2.1381 |
Si ces 8 valeurs constituent l'intégralité de ce qui vous intéresse, l'écart type vaut 2. Si, au contraire, ces 8 valeurs ont été tirées d'un ensemble plus grand dont vous voulez estimer la dispersion, il faut rapporter environ 2.1381. Quand n est petit comme ici (8), l'écart entre les deux valeurs est d'environ 7 %, ce qui se remarque. Pour n = 100, il tombe à environ 0.5 %, et pour n = 1,000 à environ 0.05 %.
Quand utiliser quelle formule
Le critère est simple : « les données dont je dispose représentent-elles la totalité de ce que je veux décrire, ou seulement une partie ? »
- Population (÷n) : les données couvrent l'ensemble étudié, par exemple quand on décrit la dispersion des notes des 30 élèves d'une classe pour cette classe seulement, ou la distribution des salaires de tous les employés d'une entreprise.
- Échantillon (÷(n−1)) : les données sont une partie d'un ensemble plus grand, par exemple quand on estime l'opinion de toute la population à partir de 500 répondants, ou la variabilité d'un procédé entier à partir de 20 pièces prélevées sur la ligne de production.
En pratique, la plupart des données sont des échantillons. Les calculs qui mènent à une inférence, comme les intervalles de confiance, le test t ou le calcul de la taille d'échantillon, supposent tous l'écart type de l'échantillon s. En cas de doute, la formule de l'échantillon est le choix prudent.
Correspondance avec Excel et les outils de programmation
| Outil | Échantillon (÷(n−1)) | Population (÷n) |
|---|---|---|
| Excel · Google Sheets | STDEV.S, VAR.S (anciennes versions STDEV) | STDEV.P, VAR.P (anciennes versions STDEVP) |
| R | sd(), var() | correction manuelle nécessaire |
| Python pandas | Series.std() par défaut ddof=1 | std(ddof=0) |
| Python NumPy | np.std(x, ddof=1) | np.std(x) par défaut ddof=0 |
NumPy et pandas ont notamment des valeurs par défaut opposées : il arrive souvent qu'on obtienne des résultats différents à partir des mêmes données. Avant de comparer des résultats, vérifiez d'abord quelle formule a été utilisée.
Comment lire un écart type
L'écart type s'exprime dans la même unité que les données d'origine : des « points » pour des notes, des « cm » pour des tailles. La variance, elle, a une unité au carré et se lit mal intuitivement ; c'est pourquoi on rapporte généralement l'écart type. Si les données suivent à peu près une loi normale, on peut considérer qu'environ 68 % des valeurs se trouvent dans l'intervalle moyenne ± 1 écart type et environ 95 % dans moyenne ± 2 écarts types. Pour comparer la dispersion de deux groupes dont les moyennes sont très différentes, on regarde parfois aussi le coefficient de variation (CV), c'est-à-dire l'écart type divisé par la moyenne.
Erreurs fréquentes
- Ne pas préciser la formule utilisée dans un rapport : sur un petit échantillon, les valeurs diffèrent nettement ; indiquez le symbole
souσ, ou l'expression « écart type de l'échantillon ». - Confondre écart type et erreur type : l'erreur type
SE = s / √nmesure la dispersion de la moyenne de l'échantillon, pas celle des données individuelles. C'est l'erreur type qui intervient dans les intervalles de confiance. - Calculer un écart type d'échantillon avec n = 1 : n−1 vaut alors 0, et la quantité n'est pas définie. Il est normal que la calculatrice renvoie une erreur.
- Ne pas vérifier les valeurs aberrantes : comme l'écart type utilise des carrés, une seule valeur extrême peut le faire varier fortement. Si vous soupçonnez des valeurs aberrantes, regardez aussi l'écart interquartile (IQR).
Collez vos données dans la calculatrice de statistiques descriptives de ce site pour voir côte à côte l'écart type de l'échantillon et celui de la population.
À retenir
- Divisez par n si les données couvrent tout l'ensemble étudié, par n−1 si elles ne sont qu'une partie d'un ensemble plus grand.
- La variance d'échantillon divisée par n a pour espérance
(n−1)/n × σ²et sous-estime donc la variance ; diviser par n−1 corrige ce biais (correction de Bessel). - Pour l'exemple
2, 4, 4, 4, 5, 5, 7, 9, l'écart type vaut 2 pour la population et environ 2.1381 pour l'échantillon. - Excel distingue
STDEV.S(échantillon) etSTDEV.P(population) ; NumPy et pandas ont des valeurs par défaut différentes. - Distinguez l'écart type (dispersion des données) de l'erreur type (dispersion de la moyenne).