Oft hat man Daten gesammelt und weiß nicht, welchen Test man anwenden soll. Zum Glück ergibt sich für die meisten grundlegenden Analysen der passende Test, wenn man drei Fragen beantwortet. In diesem Artikel stellen wir diese Fragen, eine Entscheidungstabelle sowie die Voraussetzungen der einzelnen Tests und deren Prüfung zusammen.
Drei Fragen, die Sie zuerst beantworten sollten
1. Welchen Typ hat die Ergebnisvariable?
- Stetig (metrisch): Werte, für die man einen Mittelwert berechnen kann, etwa Körpergröße, Punktzahl, Umsatz oder Reaktionszeit
- Kategorial: Werte, die in Kategorien fallen, etwa Geschlecht, Kauf ja/nein oder bevorzugte Marke. Die Daten werden meist als Häufigkeiten (Anzahl Personen) zusammengefasst.
Geordnete Kategorien (ordinal) wie eine 5-stufige Likert-Skala behandelt man bei einem einzelnen Item meist mit nichtparametrischen Tests, bei einem Summenwert aus mehreren Items dagegen häufig wie eine stetige Variable.
2. Wie viele Gruppen werden verglichen?
Prüfen Sie, ob Sie eine Gruppe mit einem Referenzwert, zwei Gruppen miteinander oder drei und mehr Gruppen vergleichen. Geht es nicht um einen Gruppenvergleich, sondern um den Zusammenhang zweier Variablen, wählt man Korrelation bzw. Regression.
3. Sind die Messungen paarweise verbunden (abhängig)?
- Unabhängig: zwei Gruppen aus unterschiedlichen Personen (Klasse A und Klasse B)
- Verbunden: dieselben Objekte wurden zweimal gemessen (vorher/nachher), oder die Paare sind fest vorgegeben, etwa Zwillinge oder Ehepaare
Analysiert man verbundene Daten mit einem Test für unabhängige Stichproben, mischen sich individuelle Unterschiede in den Fehler, und die Teststärke sinkt stark. Umgekehrt ist es falsch, unabhängige Daten mit einem Test für verbundene Stichproben zu analysieren.
Entscheidungstabelle
| Ziel | Daten | Parametrischer Test | Nichtparametrische Alternative |
|---|---|---|---|
| Mittelwert einer Gruppe mit Referenzwert vergleichen | stetig | Einstichproben-t-Test | Wilcoxon-Vorzeichen-Rang-Test |
| Mittelwerte zweier unabhängiger Gruppen vergleichen | stetig | t-Test für unabhängige Stichproben (Welch) | Mann-Whitney-U-Test |
| Zwei verbundene Messungen vergleichen | stetig | t-Test für verbundene Stichproben | Wilcoxon-Vorzeichen-Rang-Test |
| Mittelwerte von drei oder mehr Gruppen vergleichen | stetig | einfaktorielle Varianzanalyse (ANOVA) | Kruskal-Wallis-Test |
| Passt die Verteilung einer kategorialen Variable zu erwarteten Anteilen? | kategorial | Chi-Quadrat-Anpassungstest | exakter Multinomial- bzw. Binomialtest |
| Hängen zwei kategoriale Variablen zusammen? | kategorial | Chi-Quadrat-Unabhängigkeitstest | exakter Test nach Fisher |
| Linearer Zusammenhang zweier stetiger Variablen | stetig | Pearson-Korrelation, einfache Regression | Spearman-Rangkorrelation |
Einige Ergänzungen:
- Für zwei unabhängige Gruppen sollte der Welch-t-Test der Standard sein. Der Student-t-Test mit Varianzgleichheit liefert verzerrte Fehlerraten, wenn sich Varianzen oder Gruppengrößen unterscheiden; der Welch-t-Test verliert dagegen kaum etwas, wenn die Varianzen gleich sind.
- Bei drei oder mehr Gruppen führt man nicht mehrere t-Tests durch. Testet man jedes Paar mit α=0.05, steigt die Gesamtfehlerrate 1. Art. Man prüft zuerst mit der Varianzanalyse den Gesamtunterschied und führt danach Post-hoc-Tests durch.
- Der Vergleich zweier Anteile (Konversionsrate A gegen B) lässt sich mit dem Chi-Quadrat-Unabhängigkeitstest einer 2×2-Tafel durchführen; das Ergebnis ist identisch mit dem z-Test für zwei Anteile.
Beispiel: Chi-Quadrat-Unabhängigkeitstest für eine 2×2-Tafel
Zwei Werbetexte wurden jeweils 50 Personen gezeigt und es wurde notiert, ob geklickt wurde.
| Text | Klick | Kein Klick | Summe |
|---|---|---|---|
| A | 30 | 20 | 50 |
| B | 18 | 32 | 50 |
| Summe | 48 | 52 | 100 |
Die Ergebnisvariable (Klick ja/nein) ist kategorial, ebenso der Text; daher verwendet man den Chi-Quadrat-Unabhängigkeitstest.
- Erwartete Häufigkeiten:
Zeilensumme × Spaltensumme / Gesamt. Für A·Klick ist das50 × 48 / 100 = 24, für A·kein Klick50 × 52 / 100 = 26; für B ebenfalls 24 und 26. (beobachtet − erwartet)² / erwartetfür jede Zelle:(30−24)²/24 = 1.5,(20−26)²/26 ≈ 1.3846,(18−24)²/24 = 1.5,(32−26)²/26 ≈ 1.3846- Chi-Quadrat-Statistik:
χ² ≈ 5.769 - Freiheitsgrade:
(Zeilenzahl − 1) × (Spaltenzahl − 1) = 1 - p-Wert: etwa
0.0163(der kritische Wert für α=0.05 ist etwa 3.841)
Da p < 0.05 ist, schließt man auf einen Zusammenhang zwischen Text und Klickverhalten. Die Klickrate beträgt bei A 60 % und bei B 36 %. Wendet man auf dieselben Daten die Yates-Kontinuitätskorrektur an, ergeben sich χ² ≈ 4.848 und p ≈ 0.0277, also etwas konservativere Werte. Halten Sie im Bericht fest, welches Verfahren verwendet wurde.
Voraussetzungen prüfen
Jeder Test liefert nur dann korrekte p-Werte, wenn seine Voraussetzungen erfüllt sind. Die wichtigsten Voraussetzungen und ihre Prüfung sind:
Unabhängigkeit
Diese Voraussetzung gilt für alle Tests. Sie ist verletzt, wenn Antworten einer Person mehrfach eingehen oder eine Clusterstruktur besteht, etwa bei Schülern derselben Klasse. Man beurteilt sie weniger mit statistischen Tests als anhand des Erhebungsdesigns.
Normalverteilung (t-Test, Varianzanalyse, Test der Pearson-Korrelation)
- Streng genommen muss nicht die Datenverteilung selbst, sondern die Verteilung des Stichprobenmittelwerts annähernd normal sein. Dank des zentralen Grenzwertsatzes ist der t-Test ab etwa 30 Werten pro Gruppe recht stabil, sofern die Verteilung nicht stark schief ist.
- Bei kleinen Stichproben prüft man mit Histogramm, Boxplot und Q-Q-Plot, ob extreme Asymmetrie oder Ausreißer vorliegen.
- Normalitätstests wie der Shapiro-Wilk-Test übersehen bei kleinen Stichproben Verletzungen und schlagen bei großen schon bei unbedeutenden Abweichungen an; beurteilen Sie deshalb zusammen mit Grafiken.
Varianzhomogenität
Mit dem Welch-t-Test muss man sich um diese Voraussetzung nicht kümmern. Bei der Varianzanalyse prüft man, ob das Verhältnis der Standardabweichungen der Gruppen den Faktor 2 übersteigt; bei starken Unterschieden zieht man die Welch-ANOVA in Betracht.
Erwartete Häufigkeiten (Chi-Quadrat-Test)
Der Chi-Quadrat-Test ist ein Näherungsverfahren und wird bei kleinen erwarteten Häufigkeiten ungenau. Ein gängiges Kriterium lautet: In allen Zellen beträgt die erwartete Häufigkeit mindestens 5 (als lockereres Kriterium gilt auch: „höchstens 20 % der Zellen mit erwarteter Häufigkeit unter 5 und keine Zelle unter 1“). Wird das Kriterium bei einer 2×2-Tafel verletzt, verwendet man den exakten Test nach Fisher. Im obigen Beispiel liegen alle erwarteten Häufigkeiten bei 24 oder mehr, es gibt also kein Problem.
Linearität (Pearson-Korrelation, Regression)
Zeichnen Sie zuerst ein Streudiagramm. Ist der Zusammenhang kurvenförmig, unterschätzt Pearsons r ihn. Bei monotonem Zusammenhang ist die Spearman-Korrelation eine Alternative.
Wann verwendet man nichtparametrische Tests?
- Wenn die Stichprobe klein ist und die Verteilung stark schief ist oder Ausreißer enthält
- Wenn die Daten Ränge oder ordinal sind
- Wenn der Median oder die Lage der Verteilung von Interesse ist
Nichtparametrische Tests haben weniger Voraussetzungen, besitzen aber etwas geringere Teststärke, wenn die Normalverteilungsannahme zutrifft. Zudem prüft der Mann-Whitney-U-Test streng genommen nicht „die Mittelwerte sind gleich“; interpretieren Sie das Ergebnis daher nicht als Mittelwertunterschied.
Diese Website bietet Rechner für t-Tests (Einstichproben, unabhängig nach Welch, verbunden), Chi-Quadrat-Tests (Anpassung, Unabhängigkeit) sowie Korrelation und Regression. Wählen Sie die Methode mit der obigen Entscheidungstabelle und rechnen Sie direkt im passenden Rechner.
Das Wichtigste in Kürze
- Der Test ergibt sich aus drei Punkten: Typ der Ergebnisvariable (stetig oder kategorial), Anzahl der Gruppen und Verbundenheit.
- Für Mittelwerte zweier unabhängiger Gruppen nimmt man den Welch-t-Test, für Vorher-nachher-Messungen den t-Test für verbundene Stichproben und ab drei Gruppen die Varianzanalyse.
- Der Zusammenhang zweier kategorialer Variablen wird mit dem Chi-Quadrat-Unabhängigkeitstest geprüft; die Beispiel-2×2-Tafel ergibt
χ² ≈ 5.769, 1 Freiheitsgrad undp ≈ 0.0163. - Beim Chi-Quadrat-Test prüft man erwartete Häufigkeiten von mindestens 5; sonst verwendet man den exakten Test nach Fisher.
- Sind die Voraussetzungen deutlich verletzt, zieht man nichtparametrische Alternativen wie Wilcoxon, Mann-Whitney, Kruskal-Wallis oder Spearman in Betracht.