Der p-Wert taucht in Forschungsberichten, A/B-Test-Ergebnissen und wissenschaftlichen Artikeln überall auf – und ist zugleich die am häufigsten falsch interpretierte statistische Kennzahl. Die American Statistical Association (ASA) hat 2016 sogar eine eigene offizielle Stellungnahme zum richtigen Umgang mit p-Werten veröffentlicht. In diesem Artikel beginnen wir mit der genauen Definition des p-Werts und fassen anschließend häufige Irrtümer und die richtige Berichterstattung anhand von Beispielen zusammen.
Definition des p-Werts
Der p-Wert ist wie folgt definiert.
Die Wahrscheinlichkeit, unter der Annahme, dass die Nullhypothese wahr ist, ein Ergebnis zu erhalten, das mindestens so extrem ist wie das tatsächlich beobachtete
Entscheidend ist die Bedingung am Anfang. Der p-Wert wird unter der Annahme „falls die Nullhypothese stimmt“ berechnet und sagt daher nichts darüber aus, wie wahrscheinlich diese Annahme selbst ist. Ein kleiner p-Wert bedeutet: „Wenn die Nullhypothese stimmt, treten solche Daten selten auf“ – die Daten passen also schlecht zur Nullhypothese.
Beispiel: Vergleich zweier Gruppenmittelwerte
Angenommen, Gruppe A (neue Lernmethode) und Gruppe B (bisherige Methode) erzielen folgende Punktzahlen (je 8 Personen).
- A:
72, 75, 78, 80, 74, 77, 79, 81 - B:
70, 71, 74, 73, 69, 72, 75, 68
Die Nullhypothese lautet „die Mittelwerte der Grundgesamtheiten beider Gruppen sind gleich“, die Alternativhypothese „sie sind verschieden“. Wir verwenden den Welch-t-Test, der keine Varianzgleichheit voraussetzt.
- Mittelwerte:
x̄_A = 77.0,x̄_B = 71.5, Differenz5.5 - Stichproben-Standardabweichungen:
s_A ≈ 3.1168,s_B ≈ 2.4495 - Standardfehler:
SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015 - Teststatistik:
t = 5.5 / 1.4015 ≈ 3.924 - Welch-Freiheitsgrade: etwa
13.26 - Zweiseitiger p-Wert: etwa
0.0017
Die Interpretation lautet: „Wären die Mittelwerte der Grundgesamtheiten beider Methoden tatsächlich gleich, läge die Wahrscheinlichkeit, dass sich die Stichprobenmittelwerte um 5.5 Punkte oder mehr (in beliebiger Richtung) unterscheiden, bei etwa 0.17 %.“ Da dies deutlich unter dem Signifikanzniveau 0.05 liegt, wird die Nullhypothese verworfen.
Das Signifikanzniveau α
Das Signifikanzniveau α ist ein Kriterium, das man vor der Betrachtung der Daten festlegt. Ist p ≤ α, wird die Nullhypothese verworfen. α ist der maximal zulässige Anteil von Fehlern, bei denen eine wahre Nullhypothese verworfen wird (Fehler 1. Art); üblicherweise verwendet man 0.05, je nach Fachgebiet und Situation aber auch 0.01 oder 0.10.
α und p-Wert sind verschiedene Konzepte. α ist die langfristige Fehlerrate des Testverfahrens, der p-Wert gibt an, wie stark die vorliegenden Daten von der Nullhypothese abweichen.
5 häufige Irrtümer
1. „Der p-Wert ist die Wahrscheinlichkeit, dass die Nullhypothese wahr ist“
Falsch. p = 0.0017 bedeutet nicht „die Nullhypothese ist mit 0.17 % Wahrscheinlichkeit wahr“. Der p-Wert ist die Wahrscheinlichkeit der Daten unter der Bedingung, dass die Nullhypothese wahr ist; die Wahrscheinlichkeit der Nullhypothese ist dagegen die Wahrscheinlichkeit der Hypothese gegeben die Daten. Diese beiden bedingten Wahrscheinlichkeiten haben entgegengesetzte Richtung, und für Letztere braucht man bayessche Inferenz mit A-priori-Wahrscheinlichkeiten.
2. „1 − p ist die Wahrscheinlichkeit, dass die Alternativhypothese wahr ist“ oder „die Replikationswahrscheinlichkeit“
Das ist lediglich die Umkehrung des ersten Irrtums und damit ebenso falsch. p = 0.03 bedeutet weder, dass mit 97 % Wahrscheinlichkeit ein Effekt besteht, noch, dass eine Wiederholung des Experiments mit 97 % Wahrscheinlichkeit wieder signifikant ausfällt.
3. „Bei p > 0.05 gibt es keinen Effekt“
Ein nicht signifikantes Ergebnis ist kein „Beleg dafür, dass kein Effekt besteht“, sondern bedeutet „die Evidenz reicht nicht aus, um einen Effekt zu behaupten“. Bei kleinen Stichproben fällt der p-Wert leicht groß aus, auch wenn tatsächlich ein Effekt besteht. Wirft man etwa eine Münze 100-mal und erhält 60-mal Kopf, beträgt der zweiseitige p-Wert des exakten Binomialtests für die Nullhypothese einer fairen Münze etwa 0.0569. Das liegt knapp über 0.05, dennoch kann man daraus nicht schließen, dass die Münze fair ist.
4. „Je kleiner der p-Wert, desto größer der Effekt“
Der p-Wert entsteht aus Effektgröße und Stichprobenumfang gemeinsam. Bei ausreichend großer Stichprobe wird auch ein winziger Unterschied signifikant. Selbst wenn sich die Mittelwerte zweier Gruppen nur um das 0.02-Fache der Standardabweichung unterscheiden (praktisch bedeutungslos), ergeben sich bei 100,000 Personen pro Gruppe z ≈ 4.47 und p ≈ 0.0000077. Deshalb sollte man zusammen mit dem p-Wert die Effektstärke berichten. Die Effektstärke im obigen Lernmethoden-Beispiel (Cohen's d, berechnet mit dem Mittel der beiden Stichprobenvarianzen) beträgt etwa 1.96 und gilt konventionell als „großer Effekt“.
5. „p = 0.049 und p = 0.051 führen zu entgegengesetzten Schlüssen“
0.05 ist kein Naturgesetz, sondern eine Konvention aus Bequemlichkeit. Beide Werte liefern praktisch gleich starke Evidenz. Testet man zudem mehrfach und berichtet nur die signifikanten Ergebnisse (multiples Testen) oder sammelt so lange Daten, bis ein Ergebnis signifikant wird (p-Hacking), übersteigt die tatsächliche Fehlerrate 1. Art α bei Weitem.
Teststärke und Stichprobenumfang
Bei der Interpretation nicht signifikanter Ergebnisse muss man die Teststärke (Power; die Wahrscheinlichkeit, einen tatsächlich vorhandenen Effekt als signifikant zu erkennen) mitdenken. Beträgt der wahre Unterschied zwischen zwei Gruppen etwa eine Effektstärke von d = 0.5 (mittlerer Effekt) und testet man zweiseitig mit α = 0.05, liegt die Teststärke bei 20 Personen pro Gruppe nur bei etwa 34 %. Bei 64 Personen pro Gruppe sind es etwa 80 %. Liefert eine Studie mit 20 Personen pro Gruppe ein nicht signifikantes Ergebnis, liegt das also eher daran, dass die Kraft zum Nachweis fehlte, als daran, dass es keinen Effekt gibt.
Die Kernpunkte der ASA-Stellungnahme
Die Grundsätze der ASA-Stellungnahme von 2016 lassen sich so zusammenfassen:
- p-Werte können anzeigen, wie wenig die Daten mit einem bestimmten statistischen Modell vereinbar sind.
- p-Werte messen weder die Wahrscheinlichkeit, dass eine Hypothese wahr ist, noch die Wahrscheinlichkeit, dass die Daten allein durch Zufall entstanden sind.
- Wissenschaftliche Schlussfolgerungen und Entscheidungen sollten nicht allein darauf beruhen, ob ein p-Wert eine bestimmte Schwelle überschreitet.
- Korrekte Inferenz erfordert eine vollständige und transparente Berichterstattung über alle Analyseschritte.
- Ein p-Wert misst weder die Größe eines Effekts noch die Bedeutsamkeit eines Ergebnisses.
- Für sich genommen ist ein p-Wert kein gutes Maß für die Evidenz bezüglich eines Modells oder einer Hypothese.
Zweiseitige und einseitige Tests
- Zweiseitiger Test: prüft „es gibt einen Unterschied (unabhängig von der Richtung)“. Extremwerte in beiden Ausläufern werden gezählt.
- Einseitiger Test: prüft eine festgelegte Richtung, etwa „A ist größer als B“. Nur ein Ausläufer wird gezählt.
Bei symmetrischen Verteilungen wie der t-Verteilung ist der einseitige p-Wert halb so groß wie der zweiseitige, sofern die beobachtete Richtung der Alternativhypothese entspricht. Im obigen Beispiel beträgt der einseitige p-Wert für „A ist höher“ etwa 0.00084. Einseitige Tests verwendet man nur, wenn die Richtung vor der Betrachtung der Daten theoretisch begründet festgelegt wurde. Nach Sichtung der Ergebnisse auf einseitig umzustellen, um den p-Wert zu halbieren, ist ein Missbrauch.
So berichtet man richtig
- Geben Sie den exakten p-Wert an (
p = 0.0017stattp < 0.05). - Nennen Sie Effektstärke und Konfidenzintervall mit.
- Geben Sie den verwendeten Test, ein- oder zweiseitig, den Stichprobenumfang und die Anzahl der durchgeführten Tests an.
Mit dem t-Test-Rechner dieser Website sehen Sie t-Wert, Freiheitsgrade, ein- und zweiseitige p-Werte sowie die Effektstärke auf einen Blick.
Das Wichtigste in Kürze
- Der p-Wert ist die Wahrscheinlichkeit, unter Annahme einer wahren Nullhypothese ein mindestens so extremes Ergebnis wie das beobachtete zu erhalten.
- Der p-Wert ist weder die Wahrscheinlichkeit der Nullhypothese noch die Wahrscheinlichkeit eines Effekts noch die Replikationswahrscheinlichkeit.
- Ein nicht signifikantes Ergebnis beweist nicht, dass kein Effekt besteht, und ein kleiner p-Wert bedeutet keinen großen Effekt.
- Der Zwei-Gruppen-Vergleich im Beispiel (Welch-t) ergibt t ≈ 3.924, etwa 13.26 Freiheitsgrade, zweiseitig p ≈ 0.0017 und einseitig p ≈ 0.00084.
- Berichten Sie exakten p-Wert, Effektstärke und Konfidenzintervall gemeinsam und legen Sie die Richtung einseitiger Tests vorab fest.