Pour savoir si deux variables évoluent ensemble, les premiers outils utilisés sont l'analyse de corrélation et l'analyse de régression. Leurs calculs se recoupent largement, mais elles ne posent pas la même question. La corrélation demande « avec quelle force les deux variables évoluent-elles ensemble ? », tandis que la régression demande « de combien y varie-t-il en moyenne quand x augmente d'une unité ? ».
Le coefficient de corrélation de Pearson r
Le r de Pearson exprime, par une valeur comprise entre −1 et 1, la force et le sens de la relation linéaire entre deux variables continues.
r = Sxy / √(Sxx × Syy)Sxy = Σ(x−x̄)(y−ȳ),Sxx = Σ(x−x̄)²,Syy = Σ(y−ȳ)²
Un r proche de 1 indique une forte relation linéaire positive, un r proche de −1 une forte relation linéaire négative, et un r proche de 0 une relation linéaire faible. Les seuils de force varient selon les domaines, mais une convention répandue considère les valeurs absolues de 0.1, 0.3 et 0.5 comme faible, moyenne et forte.
Un r proche de 0 ne signifie pas pour autant qu'il n'y a pas de relation. Même une relation courbe très nette comme y = x² peut donner un r proche de 0. C'est pourquoi on regarde toujours d'abord le nuage de points avant de calculer un coefficient de corrélation.
La corrélation des rangs de Spearman ρ
Le ρ de Spearman est le r de Pearson calculé après avoir remplacé les valeurs d'origine par leurs rangs. En l'absence d'ex æquo, il équivaut à la formule simple suivante.
ρ = 1 − 6Σd² / (n(n²−1))(d est la différence de rangs de chaque paire)
Le ρ de Spearman détecte les relations qui croissent ou décroissent régulièrement dans un seul sens (relations monotones), même si elles ne sont pas linéaires, et il est moins sensible aux valeurs aberrantes. Il s'applique aussi aux données ordinales (classements de satisfaction, etc.).
Exemple : temps de travail et note
Voici le temps de travail (x, en heures) et la note (y) de 6 élèves.
| Élève | x | y | x−x̄ | y−ȳ | (x−x̄)(y−ȳ) |
|---|---|---|---|---|---|
| 1 | 1 | 52 | −2.5 | −9.667 | 24.167 |
| 2 | 2 | 55 | −1.5 | −6.667 | 10.000 |
| 3 | 3 | 61 | −0.5 | −0.667 | 0.333 |
| 4 | 4 | 60 | 0.5 | −1.667 | −0.833 |
| 5 | 5 | 68 | 1.5 | 6.333 | 9.500 |
| 6 | 6 | 74 | 2.5 | 12.333 | 30.833 |
Étape 1 : les moyennes
x̄ = 21 / 6 = 3.5, ȳ = 370 / 6 ≈ 61.667
Étape 2 : sommes des carrés et somme des produits croisés
Sxy = 24.167 + 10.000 + 0.333 − 0.833 + 9.500 + 30.833 = 74Sxx = 6.25 + 2.25 + 0.25 + 0.25 + 2.25 + 6.25 = 17.5Syy ≈ 333.333
Étape 3 : le r de Pearson
r = 74 / √(17.5 × 333.333) = 74 / √5833.33 ≈ 74 / 76.376 ≈ 0.9689
Il s'agit d'une relation linéaire positive très forte. La valeur p bilatérale du test de ce r (hypothèse nulle ρ=0, 4 degrés de liberté) est d'environ 0.0014.
Étape 4 : le ρ de Spearman
Les rangs de x restent 1 à 6, et ceux de y sont 1, 2, 4, 3, 5, 6 (60 étant inférieur à 61, les rangs des élèves 3 et 4 sont inversés). Les différences de rangs d valent 0, 0, −1, 1, 0, 0, et Σd² = 2.
ρ = 1 − 6 × 2 / (6 × (36 − 1)) = 1 − 12 / 210 ≈ 0.9429
Étape 5 : la droite de régression
- Pente :
b = Sxy / Sxx = 74 / 17.5 ≈ 4.2286 - Ordonnée à l'origine :
a = ȳ − b × x̄ = 61.667 − 4.2286 × 3.5 ≈ 46.867 - Équation de régression :
ŷ ≈ 46.867 + 4.2286x
Interpréter la pente et r²
- Pente 4.2286 : un élève qui travaille une heure de plus a une note prédite en moyenne supérieure d'environ 4.23 points. La pente a une unité (points par heure) ; si l'on change l'unité de x ou de y, la pente change aussi. Le r, lui, est sans unité.
- Ordonnée à l'origine 46.867 : c'est la valeur prédite pour x=0, c'est-à-dire ici un élève qui n'a pas travaillé du tout. Comme les données ne contiennent pas x=0, il s'agit d'une extrapolation hors de la plage observée, à interpréter avec prudence.
- Coefficient de détermination r² ≈ 0.9387 : environ 93.9 % de la variation totale des notes s'explique par la relation linéaire avec le temps de travail. En régression simple, r² est égal au carré du r de Pearson.
La pente et r ont toujours le même signe, et ils sont liés par b = r × (s_y / s_x). Autrement dit, à r égal, la pente est plus forte si y est plus dispersé.
L'effet des valeurs aberrantes
Ajoutons un élève aux données ci-dessus : il a travaillé 7 heures mais n'a obtenu que 30 points (disons qu'il n'était pas en forme le jour de l'examen).
| Cas | 6 élèves d'origine | 7 élèves avec la valeur aberrante |
|---|---|---|
| r de Pearson | environ 0.9689 | environ −0.1149 |
| ρ de Spearman | environ 0.9429 | environ 0.2143 |
Un seul point a suffi à changer jusqu'au signe du r de Pearson. Comme le r de Pearson utilise les moyennes et les carrés des écarts, un seul point extrême à la fois en x et en y peut déterminer le résultat. Le ρ de Spearman est lui aussi affecté, mais, comme il utilise les rangs, la variation est relativement plus faible. C'est pourquoi on recommande la démarche suivante.
- Vérifiez d'abord sur un nuage de points la présence de valeurs aberrantes et de relations courbes.
- Déterminez si la valeur aberrante est une erreur de saisie ou une valeur réelle.
- S'il s'agit d'une valeur réelle, rapportez à la fois les résultats avec et sans la valeur aberrante, ou présentez aussi le ρ de Spearman.
Corrélation n'est pas causalité
Même une forte corrélation ne permet pas d'affirmer que x est la cause de y. Les raisons les plus fréquentes sont les suivantes.
- Une troisième variable (variable confondante) : les ventes de glaces et les accidents de baignade augmentent ensemble, mais tous deux sont causés par la température.
- La causalité inverse : la corrélation seule ne permet pas de savoir si les personnes qui font beaucoup de sport sont en bonne santé grâce au sport, ou si ce sont les personnes en bonne santé qui font davantage de sport.
- Le hasard : en examinant un grand nombre de paires de variables, on voit apparaître par hasard de fortes corrélations entre des variables sans lien.
- Le biais de sélection : si seules les personnes remplissant certaines conditions entrent dans l'échantillon, une corrélation inexistante peut apparaître, ou une corrélation existante disparaître.
Pour affirmer une causalité, il faut une expérience avec répartition aléatoire, ou un plan d'étude qui contrôle systématiquement les variables confondantes. De même, il est plus sûr d'interpréter la pente d'une régression non pas comme « si l'on modifie x, y change », mais comme « entre des sujets dont x diffère, y diffère en moyenne de tant ».
Que choisir ?
| Situation | Recommandation |
|---|---|
| Deux variables continues, relation linéaire, pas de valeurs aberrantes | r de Pearson |
| Relation monotone mais courbe, valeurs aberrantes, données ordinales | ρ de Spearman |
| Prédire y à partir de x ou connaître l'ampleur de la variation | Régression linéaire simple (pente, ordonnée à l'origine, r²) |
Collez vos paires x, y dans la calculatrice de corrélation et de régression de ce site pour obtenir en une fois le r de Pearson, le ρ de Spearman, l'équation de régression et r².
À retenir
- Le r de Pearson mesure la force d'une relation linéaire, le ρ de Spearman celle d'une relation monotone, à partir des rangs.
- Pour les 6 paires de l'exemple, r ≈ 0.9689, ρ ≈ 0.9429, équation de régression
ŷ ≈ 46.867 + 4.2286xet r² ≈ 0.9387. - La pente est la variation moyenne de y par unité de x (elle a une unité) ; r² est la part de la variation de y expliquée par la relation linéaire.
- Un seul point aberrant peut faire passer le r de Pearson de 0.9689 à −0.1149 : regardez d'abord le nuage de points.
- La corrélation et la pente de régression ne prouvent pas une causalité.