La valeur p apparaît partout, dans les rapports d'étude, les résultats de tests A/B et les articles scientifiques, mais c'est aussi la statistique la plus souvent mal interprétée. L'Association américaine de statistique (ASA) a même publié en 2016 une déclaration officielle consacrée au bon usage de la valeur p. Cet article part de la définition exacte de la valeur p, puis passe en revue, exemples à l'appui, les idées fausses courantes et la bonne façon de rapporter les résultats.
Définition de la valeur p
La valeur p se définit ainsi :
En supposant que l'hypothèse nulle est vraie, la probabilité d'obtenir un résultat aussi extrême, ou plus extrême, que celui qui a été observé
L'essentiel tient à la condition du début. La valeur p est calculée sous l'hypothèse « si l'hypothèse nulle est vraie » ; elle ne dit donc rien de la probabilité que cette hypothèse soit elle-même vraie. Une petite valeur p signifie que « si l'hypothèse nulle était vraie, des données comme celles-ci seraient rares », autrement dit que les données s'accordent mal avec l'hypothèse nulle.
Exemple : comparer les moyennes de deux groupes
Voici les notes du groupe A, qui a utilisé une nouvelle méthode d'apprentissage, et du groupe B, qui a utilisé l'ancienne (8 personnes chacun).
- A :
72, 75, 78, 80, 74, 77, 79, 81 - B :
70, 71, 74, 73, 69, 72, 75, 68
L'hypothèse nulle est « les moyennes des deux populations sont égales », l'hypothèse alternative « elles sont différentes ». On utilise le test t de Welch, qui ne suppose pas l'égalité des variances.
- Moyennes :
x̄_A = 77.0,x̄_B = 71.5, différence5.5 - Écarts types des échantillons :
s_A ≈ 3.1168,s_B ≈ 2.4495 - Erreur type :
SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015 - Statistique de test :
t = 5.5 / 1.4015 ≈ 3.924 - Degrés de liberté de Welch : environ
13.26 - Valeur p bilatérale : environ
0.0017
L'interprétation est la suivante : « si les moyennes des deux méthodes étaient réellement égales, la probabilité d'observer un écart entre moyennes d'échantillon de 5.5 points ou plus (dans un sens ou dans l'autre) serait d'environ 0.17 %. » Comme cette valeur est bien inférieure au seuil de 0.05, on rejette l'hypothèse nulle.
Le seuil de signification α
Le seuil de signification α est un critère fixé avant de regarder les données. Si p ≤ α, on rejette l'hypothèse nulle. α est la proportion maximale tolérée d'erreurs consistant à rejeter l'hypothèse nulle alors qu'elle est vraie (erreur de première espèce) ; on utilise souvent 0.05 par convention, mais selon le domaine et le contexte on choisit aussi 0.01 ou 0.10.
α et la valeur p sont deux notions distinctes. α est le taux d'erreur à long terme de la procédure de test, tandis que la valeur p mesure à quel point les données actuelles s'écartent de l'hypothèse nulle.
5 idées fausses courantes
1. « La valeur p est la probabilité que l'hypothèse nulle soit vraie »
Non. p = 0.0017 ne signifie pas que « la probabilité que l'hypothèse nulle soit vraie est de 0.17 % ». La valeur p est la probabilité des données sachant que l'hypothèse nulle est vraie, alors que la probabilité que l'hypothèse nulle soit vraie est la probabilité de l'hypothèse sachant les données. Ces deux probabilités conditionnelles vont en sens inverse, et obtenir la seconde exige une inférence bayésienne qui intègre une probabilité a priori.
2. « 1 − p est la probabilité que l'hypothèse alternative soit vraie » ou « la probabilité de reproduire le résultat »
C'est l'inverse de la première idée fausse, et c'est donc tout aussi faux. p = 0.03 ne signifie pas qu'il y a 97 % de chances que l'effet existe, ni qu'en répétant l'expérience on obtiendrait un résultat significatif avec une probabilité de 97 %.
3. « Si p > 0.05, il n'y a pas d'effet »
Un résultat non significatif n'est pas une « preuve d'absence d'effet » ; il signifie que « les preuves ne suffisent pas pour affirmer qu'il y a un effet ». Avec un petit échantillon, la valeur p peut facilement être élevée même en présence d'un effet réel. Par exemple, si l'on lance une pièce 100 fois et qu'elle tombe 60 fois sur pile, la valeur p du test binomial exact bilatéral de l'hypothèse nulle « la pièce est équilibrée » est d'environ 0.0569. Elle dépasse à peine 0.05, mais on ne peut pas pour autant conclure que la pièce est équilibrée.
4. « Plus la valeur p est petite, plus l'effet est grand »
La valeur p est le produit conjoint de la taille de l'effet et de la taille de l'échantillon. Avec un échantillon assez grand, même une toute petite différence devient significative. Même si la différence entre les moyennes de deux groupes ne vaut que 0.02 écart type (une différence pratiquement insignifiante), avec 100,000 personnes par groupe on obtient z ≈ 4.47 et p ≈ 0.0000077. C'est pourquoi il faut rapporter la taille d'effet en même temps que la valeur p. Dans l'exemple de la méthode d'apprentissage ci-dessus, la taille d'effet (d de Cohen, calculé avec la moyenne des deux variances d'échantillon) vaut environ 1.96, ce qui correspond par convention à un « grand effet ».
5. « p = 0.049 et p = 0.051 mènent à des conclusions opposées »
0.05 n'est pas une loi de la nature mais un seuil de commodité. Ces deux valeurs apportent un niveau de preuve presque identique. En outre, si l'on effectue de nombreux tests et que l'on ne rapporte que ceux qui sont significatifs (comparaisons multiples), ou si l'on continue à collecter des données jusqu'à obtenir un résultat significatif (p-hacking), le taux réel d'erreur de première espèce dépasse largement α.
Puissance et taille d'échantillon
Pour interpréter un résultat non significatif, il faut aussi tenir compte de la puissance (la probabilité de détecter un effet de façon significative lorsqu'il existe réellement). Par exemple, si la différence réelle entre deux groupes correspond à une taille d'effet d = 0.5 (effet moyen) et que l'on réalise un test bilatéral avec α = 0.05, la puissance n'est que d'environ 34 % avec 20 personnes par groupe. Avec 64 personnes par groupe, elle atteint environ 80 %. Si une étude menée avec 20 personnes par groupe donne un résultat non significatif, il est fort probable que ce soit parce qu'elle manquait de puissance pour détecter l'effet, plutôt que parce qu'il n'y a pas d'effet.
Les points clés de la déclaration de l'ASA
Les principes énoncés par la déclaration de l'ASA de 2016 se résument ainsi :
- La valeur p peut indiquer à quel point les données sont incompatibles avec un modèle statistique donné.
- La valeur p ne mesure ni la probabilité qu'une hypothèse soit vraie, ni la probabilité que les données soient dues au seul hasard.
- Les conclusions scientifiques et les décisions ne doivent pas reposer uniquement sur le franchissement d'un seuil par la valeur p.
- Une inférence correcte exige une communication transparente de toutes les étapes de l'analyse.
- La valeur p ne mesure ni la taille d'un effet ni l'importance d'un résultat.
- À elle seule, la valeur p n'est pas une bonne mesure des preuves en faveur d'un modèle ou d'une hypothèse.
Test bilatéral et test unilatéral
- Test bilatéral : on teste « il y a une différence (quel qu'en soit le sens) ». On compte les valeurs extrêmes dans les deux queues.
- Test unilatéral : on teste une direction fixée, par exemple « A est supérieur à B ». On ne compte qu'une seule queue.
Pour une distribution symétrique comme la loi t, si le sens observé correspond à l'hypothèse alternative, la valeur p unilatérale est la moitié de la valeur p bilatérale. Dans l'exemple ci-dessus, la valeur p unilatérale pour « A est plus élevé » est d'environ 0.00084. On n'utilise un test unilatéral que si la direction a été fixée avant de voir les données, sur une base théorique. Passer à un test unilatéral après avoir vu les résultats pour diviser la valeur p par deux est un usage incorrect.
Bien rapporter les résultats
- Donnez la valeur p exacte (
p = 0.0017plutôt quep < 0.05). - Donnez aussi la taille d'effet et l'intervalle de confiance.
- Précisez le test utilisé, s'il est bilatéral ou unilatéral, la taille de l'échantillon et le nombre de tests effectués.
La calculatrice de test t de ce site affiche ensemble la valeur t, les degrés de liberté, les valeurs p bilatérale et unilatérale et la taille d'effet.
À retenir
- La valeur p est la probabilité d'obtenir un résultat au moins aussi extrême que celui observé, en supposant que l'hypothèse nulle est vraie.
- La valeur p n'est ni la probabilité que l'hypothèse nulle soit vraie, ni la probabilité qu'un effet existe, ni la probabilité de reproduire le résultat.
- Un résultat non significatif ne prouve pas l'absence d'effet, et une petite valeur p ne signifie pas un grand effet.
- Dans l'exemple de comparaison de deux groupes (t de Welch), t ≈ 3.924, environ 13.26 degrés de liberté, p bilatérale ≈ 0.0017, p unilatérale ≈ 0.00084.
- Rapportez ensemble la valeur p exacte, la taille d'effet et l'intervalle de confiance, et fixez à l'avance le sens d'un test unilatéral.