データを集めたものの、どの検定を使えばよいのか途方に暮れることはよくあります。幸い、基本的な分析のほとんどは3つの問いに答えれば適切な検定が決まります。この記事では、その問いと決定表、各検定の仮定と確認方法を整理します。
まず答えるべき3つの問い
1. 結果変数はどの種類か
- 連続型(数値型):身長、点数、売上、反応時間のように平均を計算できる値
- カテゴリ型:性別、購入の有無、好みのブランドのように項目に分かれる値。データは通常、度数(何人か)でまとめられます。
リッカート5件法のように順序のあるカテゴリ(順序型)は、設問1つならノンパラメトリック検定を、複数設問の合計得点なら連続型のように扱うことが多いです。
2. いくつの群を比較するか
1つの群を基準値と比較するのか、2つの群を比較するのか、3つ以上の群を比較するのかを確認します。群の比較ではなく2つの変数の関係を見たいのであれば、相関・回帰に進みます。
3. 測定どうしが対になっているか(対応の有無)
- 独立:異なる人々からなる2つの群(Aクラスと Bクラス)
- 対応あり:同じ対象を2回測定した(事前・事後)場合や、双子・夫婦のようにペアが決まっている場合
対応のあるデータを独立の検定で分析すると、個人差が誤差に混ざって検出力が大きく落ちます。逆に、独立のデータを対応のある検定で分析するのは誤りです。
決定表
| 目的 | データ | パラメトリック検定 | ノンパラメトリックの代替 |
|---|---|---|---|
| 1群の平均を基準値と比較 | 連続型 | 1標本t検定 | ウィルコクソンの符号順位検定 |
| 独立した2群の平均を比較 | 連続型 | 独立2標本t検定(ウェルチ) | マン・ホイットニーのU検定 |
| 対応のある2つの測定を比較 | 連続型 | 対応のあるt検定 | ウィルコクソンの符号順位検定 |
| 3群以上の平均を比較 | 連続型 | 一元配置分散分析(ANOVA) | クラスカル・ウォリス検定 |
| 1つのカテゴリ変数の分布が期待比率に合うか | カテゴリ型 | カイ二乗適合度検定 | 正確多項検定・二項検定 |
| 2つのカテゴリ変数に関連があるか | カテゴリ型 | カイ二乗独立性検定 | フィッシャーの正確検定 |
| 2つの連続変数の線形関係 | 連続型 | ピアソンの相関、単回帰 | スピアマンの順位相関 |
いくつか補足します。
- 独立t検定はウェルチの方式を標準として使うのがよいでしょう。等分散を仮定するスチューデントのt検定は、2群の分散やサイズが異なると誤り率が狂いますが、ウェルチのt検定は分散が等しいときもほとんど損がありません。
- 3群以上にt検定を何度も行いません。 ペアごとにα=0.05で検定すると、全体の第1種の過誤率が大きくなります。分散分析で全体の差を見た後に、事後検定(多重比較)を行います。
- 2つの比率の比較(コンバージョン率A対B)は、2×2表のカイ二乗独立性検定で行うことができ、2つの比率のz検定と結果が一致します。
例題:2×2のカイ二乗独立性検定
2種類の広告文をそれぞれ50人に見せ、クリックの有無を記録しました。
| 広告文 | クリック | クリックなし | 合計 |
|---|---|---|---|
| A | 30 | 20 | 50 |
| B | 18 | 32 | 50 |
| 合計 | 48 | 52 | 100 |
結果変数(クリックの有無)がカテゴリ型で、広告文もカテゴリ型なので、カイ二乗独立性検定を使います。
- 期待度数:
行の合計 × 列の合計 / 全体。A・クリックは50 × 48 / 100 = 24、A・なしは50 × 52 / 100 = 26で、Bもそれぞれ24、26です。 - 各セルの
(観測 − 期待)² / 期待:(30−24)²/24 = 1.5、(20−26)²/26 ≈ 1.3846、(18−24)²/24 = 1.5、(32−26)²/26 ≈ 1.3846 - カイ二乗統計量:
χ² ≈ 5.769 - 自由度:
(行数 − 1) × (列数 − 1) = 1 - p値:約
0.0163(α=0.05の臨界値は約3.841)
p < 0.05なので、広告文とクリックの有無には関連があると判断します。クリック率はAが60%、Bが36%です。同じデータにイェーツの連続性補正を適用するとχ² ≈ 4.848、p ≈ 0.0277と少し保守的な値になります。どちらの方式を使ったかを報告に書いておきます。
仮定の確認
どの検定も、前提条件が満たされてはじめて正確なp値を与えます。主な仮定と確認方法は次のとおりです。
独立性
すべての検定に共通の仮定です。1人の回答が何度も含まれていたり、同じクラスの生徒のようにまとまりのある構造があったりすると破られます。統計的な検定で確かめるよりも、データ収集の設計を見て判断します。
正規性(t検定、分散分析、ピアソン相関の検定)
- 厳密には、データそのものではなく標本平均の分布が正規に近ければ十分です。中心極限定理のおかげで、1群あたり標本が約30個以上あれば、ひどく偏った分布でない限りt検定はかなり安定しています。
- 標本が小さい場合は、ヒストグラム、箱ひげ図、Q-Qプロットで極端な非対称や外れ値がないかを見ます。
- シャピロ・ウィルク検定のような正規性の検定は、標本が小さいと違反を見逃し、大きいとささいな差まで検出するので、図とあわせて判断します。
等分散
ウェルチのt検定を使えば、この仮定を気にする必要はありません。分散分析では、群ごとの標準偏差の比が2倍を超えていないかを確認し、大きく異なる場合はウェルチの分散分析を検討します。
期待度数(カイ二乗検定)
カイ二乗検定は近似的な方法なので、期待度数が小さいと不正確になります。よく使われる基準はすべてのセルの期待度数が5以上です(より緩い基準として「期待度数5未満のセルが20%以下で、1未満のセルがない」も使われます)。2×2表で基準を満たさない場合は、フィッシャーの正確検定を使います。上の例題は期待度数がすべて24以上なので問題ありません。
線形性(ピアソン相関、回帰)
まず散布図を描きます。関係が曲線的であれば、ピアソンのrは関係を過小評価します。単調な関係であれば、スピアマンの相関が代替になります。
ノンパラメトリック検定はいつ使うか
- 標本が小さく、分布がひどく偏っているか外れ値があるとき
- データが順位や順序型のとき
- 中央値や分布の位置に関心があるとき
ノンパラメトリック検定は仮定が少ない代わりに、正規性の仮定が成り立つ状況では検出力がやや低くなります。また、マン・ホイットニーのU検定は厳密には「平均が等しい」を検定しているわけではないので、結果を平均の差として解釈しないよう注意します。
このサイトでは、t検定(1標本・独立ウェルチ・対応あり)、カイ二乗(適合度・独立性)、相関・回帰の計算機を提供しています。上の決定表で方法を選んだら、該当する計算機ですぐに計算できます。
まとめ
- 結果変数の種類(連続・カテゴリ)、比較する群の数、対応の有無の3つで検定が決まります。
- 独立した2群の平均はウェルチのt検定、事前・事後は対応のあるt検定、3群以上は分散分析を使います。
- カテゴリ型の2変数の関連はカイ二乗独立性検定で、例題の2×2表は
χ² ≈ 5.769、自由度1、p ≈ 0.0163です。 - カイ二乗では期待度数が5以上かを確認し、満たさなければフィッシャーの正確検定を使います。
- 仮定が大きく崩れる場合は、ウィルコクソン、マン・ホイットニー、クラスカル・ウォリス、スピアマンのようなノンパラメトリックの代替を検討します。