GUIDE 08

Corrélation et régression : r de Pearson, ρ de Spearman et interprétation de la pente

Pearson ou Spearman, coefficient de détermination r², pente de régression, corrélation et causalité, effet des valeurs aberrantes.

Pour savoir si deux variables évoluent ensemble, les premiers outils utilisés sont l'analyse de corrélation et l'analyse de régression. Leurs calculs se recoupent largement, mais elles ne posent pas la même question. La corrélation demande « avec quelle force les deux variables évoluent-elles ensemble ? », tandis que la régression demande « de combien y varie-t-il en moyenne quand x augmente d'une unité ? ».

Le coefficient de corrélation de Pearson r

Le r de Pearson exprime, par une valeur comprise entre −1 et 1, la force et le sens de la relation linéaire entre deux variables continues.

  • r = Sxy / √(Sxx × Syy)
  • Sxy = Σ(x−x̄)(y−ȳ), Sxx = Σ(x−x̄)², Syy = Σ(y−ȳ)²

Un r proche de 1 indique une forte relation linéaire positive, un r proche de −1 une forte relation linéaire négative, et un r proche de 0 une relation linéaire faible. Les seuils de force varient selon les domaines, mais une convention répandue considère les valeurs absolues de 0.1, 0.3 et 0.5 comme faible, moyenne et forte.

Un r proche de 0 ne signifie pas pour autant qu'il n'y a pas de relation. Même une relation courbe très nette comme y = x² peut donner un r proche de 0. C'est pourquoi on regarde toujours d'abord le nuage de points avant de calculer un coefficient de corrélation.

La corrélation des rangs de Spearman ρ

Le ρ de Spearman est le r de Pearson calculé après avoir remplacé les valeurs d'origine par leurs rangs. En l'absence d'ex æquo, il équivaut à la formule simple suivante.

  • ρ = 1 − 6Σd² / (n(n²−1)) (d est la différence de rangs de chaque paire)

Le ρ de Spearman détecte les relations qui croissent ou décroissent régulièrement dans un seul sens (relations monotones), même si elles ne sont pas linéaires, et il est moins sensible aux valeurs aberrantes. Il s'applique aussi aux données ordinales (classements de satisfaction, etc.).

Exemple : temps de travail et note

Voici le temps de travail (x, en heures) et la note (y) de 6 élèves.

Élèvexyx−x̄y−ȳ(x−x̄)(y−ȳ)
1152−2.5−9.66724.167
2255−1.5−6.66710.000
3361−0.5−0.6670.333
44600.5−1.667−0.833
55681.56.3339.500
66742.512.33330.833

Étape 1 : les moyennes

x̄ = 21 / 6 = 3.5, ȳ = 370 / 6 ≈ 61.667

Étape 2 : sommes des carrés et somme des produits croisés

  • Sxy = 24.167 + 10.000 + 0.333 − 0.833 + 9.500 + 30.833 = 74
  • Sxx = 6.25 + 2.25 + 0.25 + 0.25 + 2.25 + 6.25 = 17.5
  • Syy ≈ 333.333

Étape 3 : le r de Pearson

r = 74 / √(17.5 × 333.333) = 74 / √5833.33 ≈ 74 / 76.376 ≈ 0.9689

Il s'agit d'une relation linéaire positive très forte. La valeur p bilatérale du test de ce r (hypothèse nulle ρ=0, 4 degrés de liberté) est d'environ 0.0014.

Étape 4 : le ρ de Spearman

Les rangs de x restent 1 à 6, et ceux de y sont 1, 2, 4, 3, 5, 6 (60 étant inférieur à 61, les rangs des élèves 3 et 4 sont inversés). Les différences de rangs d valent 0, 0, −1, 1, 0, 0, et Σd² = 2.

ρ = 1 − 6 × 2 / (6 × (36 − 1)) = 1 − 12 / 210 ≈ 0.9429

Étape 5 : la droite de régression

  • Pente : b = Sxy / Sxx = 74 / 17.5 ≈ 4.2286
  • Ordonnée à l'origine : a = ȳ − b × x̄ = 61.667 − 4.2286 × 3.5 ≈ 46.867
  • Équation de régression : ŷ ≈ 46.867 + 4.2286x

Interpréter la pente et r²

  • Pente 4.2286 : un élève qui travaille une heure de plus a une note prédite en moyenne supérieure d'environ 4.23 points. La pente a une unité (points par heure) ; si l'on change l'unité de x ou de y, la pente change aussi. Le r, lui, est sans unité.
  • Ordonnée à l'origine 46.867 : c'est la valeur prédite pour x=0, c'est-à-dire ici un élève qui n'a pas travaillé du tout. Comme les données ne contiennent pas x=0, il s'agit d'une extrapolation hors de la plage observée, à interpréter avec prudence.
  • Coefficient de détermination r² ≈ 0.9387 : environ 93.9 % de la variation totale des notes s'explique par la relation linéaire avec le temps de travail. En régression simple, r² est égal au carré du r de Pearson.

La pente et r ont toujours le même signe, et ils sont liés par b = r × (s_y / s_x). Autrement dit, à r égal, la pente est plus forte si y est plus dispersé.

L'effet des valeurs aberrantes

Ajoutons un élève aux données ci-dessus : il a travaillé 7 heures mais n'a obtenu que 30 points (disons qu'il n'était pas en forme le jour de l'examen).

Cas6 élèves d'origine7 élèves avec la valeur aberrante
r de Pearsonenviron 0.9689environ −0.1149
ρ de Spearmanenviron 0.9429environ 0.2143

Un seul point a suffi à changer jusqu'au signe du r de Pearson. Comme le r de Pearson utilise les moyennes et les carrés des écarts, un seul point extrême à la fois en x et en y peut déterminer le résultat. Le ρ de Spearman est lui aussi affecté, mais, comme il utilise les rangs, la variation est relativement plus faible. C'est pourquoi on recommande la démarche suivante.

  1. Vérifiez d'abord sur un nuage de points la présence de valeurs aberrantes et de relations courbes.
  2. Déterminez si la valeur aberrante est une erreur de saisie ou une valeur réelle.
  3. S'il s'agit d'une valeur réelle, rapportez à la fois les résultats avec et sans la valeur aberrante, ou présentez aussi le ρ de Spearman.

Corrélation n'est pas causalité

Même une forte corrélation ne permet pas d'affirmer que x est la cause de y. Les raisons les plus fréquentes sont les suivantes.

  • Une troisième variable (variable confondante) : les ventes de glaces et les accidents de baignade augmentent ensemble, mais tous deux sont causés par la température.
  • La causalité inverse : la corrélation seule ne permet pas de savoir si les personnes qui font beaucoup de sport sont en bonne santé grâce au sport, ou si ce sont les personnes en bonne santé qui font davantage de sport.
  • Le hasard : en examinant un grand nombre de paires de variables, on voit apparaître par hasard de fortes corrélations entre des variables sans lien.
  • Le biais de sélection : si seules les personnes remplissant certaines conditions entrent dans l'échantillon, une corrélation inexistante peut apparaître, ou une corrélation existante disparaître.

Pour affirmer une causalité, il faut une expérience avec répartition aléatoire, ou un plan d'étude qui contrôle systématiquement les variables confondantes. De même, il est plus sûr d'interpréter la pente d'une régression non pas comme « si l'on modifie x, y change », mais comme « entre des sujets dont x diffère, y diffère en moyenne de tant ».

Que choisir ?

SituationRecommandation
Deux variables continues, relation linéaire, pas de valeurs aberrantesr de Pearson
Relation monotone mais courbe, valeurs aberrantes, données ordinalesρ de Spearman
Prédire y à partir de x ou connaître l'ampleur de la variationRégression linéaire simple (pente, ordonnée à l'origine, r²)

Collez vos paires x, y dans la calculatrice de corrélation et de régression de ce site pour obtenir en une fois le r de Pearson, le ρ de Spearman, l'équation de régression et r².

À retenir

  • Le r de Pearson mesure la force d'une relation linéaire, le ρ de Spearman celle d'une relation monotone, à partir des rangs.
  • Pour les 6 paires de l'exemple, r ≈ 0.9689, ρ ≈ 0.9429, équation de régression ŷ ≈ 46.867 + 4.2286x et r² ≈ 0.9387.
  • La pente est la variation moyenne de y par unité de x (elle a une unité) ; r² est la part de la variation de y expliquée par la relation linéaire.
  • Un seul point aberrant peut faire passer le r de Pearson de 0.9689 à −0.1149 : regardez d'abord le nuage de points.
  • La corrélation et la pente de régression ne prouvent pas une causalité.

→ Calculer maintenant: Corrélation

Mis à jour le 2026-09-23