p値は研究報告書、A/Bテストの結果、論文のあらゆるところに登場しますが、最も誤って解釈されることの多い統計量でもあります。アメリカ統計学会(ASA)が2016年に、p値の正しい使い方に関する公式声明をわざわざ発表したほどです。この記事では、p値の正確な定義から始めて、よくある誤解と正しい報告の仕方を例題で整理します。
p値の定義
p値は次のように定義されます。
帰無仮説が真であると仮定したとき、いま観測した結果と同じか、それよりも極端な結果が得られる確率
要点は前半の条件です。p値は「帰無仮説が正しければ」という仮定のもとで計算される値なので、その仮定自体が正しい確率は教えてくれません。p値が小さいということは、「帰無仮説が正しければこのようなデータはめったに出ない」、つまりデータが帰無仮説とよく合わないという意味です。
例題:2群の平均の比較
新しい学習法を使ったグループAと、従来の方法を使ったグループBの点数が次のとおりだとします(各8人)。
- A:
72, 75, 78, 80, 74, 77, 79, 81 - B:
70, 71, 74, 73, 69, 72, 75, 68
帰無仮説は「2群の母平均は等しい」、対立仮説は「異なる」です。等分散を仮定しないウェルチのt検定を使います。
- 平均:
x̄_A = 77.0、x̄_B = 71.5、差5.5 - 標本標準偏差:
s_A ≈ 3.1168、s_B ≈ 2.4495 - 標準誤差:
SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015 - 検定統計量:
t = 5.5 / 1.4015 ≈ 3.924 - ウェルチの自由度:約
13.26 - 両側p値:約
0.0017
解釈は次のとおりです。「2つの方法の母平均が本当に等しいなら、標本平均の差が5.5点以上(どちらの方向でも)開く確率は約0.17%である。」有意水準0.05よりはるかに小さいので、帰無仮説を棄却します。
有意水準α
有意水準αは、データを見る前に決めておく基準です。p ≤ αなら帰無仮説を棄却します。αは帰無仮説が真であるのに棄却してしまう誤り(第1種の過誤)を許容する最大の割合で、慣例的に0.05がよく使われますが、分野や状況によって0.01や0.10を使うこともあります。
αとp値は別の概念です。αは検定手続きの長期的な誤り率であり、p値は今回のデータが帰無仮説とどれだけ食い違っているかを表す値です。
よくある誤解5つ
1. 「p値は帰無仮説が真である確率だ」
違います。p = 0.0017は「帰無仮説が真である確率が0.17%」という意味ではありません。p値は帰無仮説が真であるという条件のもとでのデータの確率であり、帰無仮説が真である確率はデータが与えられたときの仮説の確率です。2つの条件付き確率は向きが逆で、後者を求めるには事前確率を含むベイズ推論が必要です。
2. 「1 − pは対立仮説が真である確率だ」または「再現される確率だ」
1つ目の誤解を裏返したものなので、これも誤りです。p = 0.03だからといって、効果がある確率が97%だとか、同じ実験を繰り返せば97%の確率で有意になるという意味ではありません。
3. 「p > 0.05なら効果はない」
有意でない結果は「効果がないという証拠」ではなく、「効果があると言えるほど証拠が十分でない」という意味です。標本が小さいと、実際に効果があってもp値は大きくなりがちです。たとえばコインを100回投げて表が60回出たとき、公正なコインだという帰無仮説に対する両側の正確二項検定のp値は約0.0569です。0.05をわずかに超えていますが、これでコインが公正だと結論づけることはできません。
4. 「p値が小さいほど効果が大きい」
p値は効果の大きさと標本サイズが一緒に作り出す値です。標本が十分大きければ、ごく小さな差でも有意になります。2群の平均の差が標準偏差の0.02倍(実務的にはほぼ無意味な差)でも、1群あたり100,000人ならz ≈ 4.47、p ≈ 0.0000077になります。そのため、p値とあわせて効果量を報告する必要があります。上の学習法の例題の効果量(Cohen's d、2標本の分散の平均で計算)は約1.96で、慣例上「大きな効果」に当たります。
5. 「p = 0.049とp = 0.051では結論が正反対だ」
0.05は自然法則ではなく便宜上の基準です。2つの値が示す証拠の強さはほぼ同じです。また、何度も検定してその中で有意なものだけを報告したり(多重比較)、有意になるまでデータを追加で集めたり(pハッキング)すると、実際の第1種の過誤率はαをはるかに上回ります。
検出力と標本サイズ
有意でない結果を解釈するときは、検出力(実際に効果があるときにそれを有意として見つけ出す確率)もあわせて考える必要があります。たとえば2群の実際の差が効果量d = 0.5(中程度)で、α = 0.05の両側検定を行う場合、1群あたり20人では検出力はわずか約34%です。1群あたり64人なら約80%になります。1群20人の研究で有意でない結果が出たなら、効果がないからというより、そもそも見つけ出す力が足りなかった可能性が高いのです。
ASA声明の要点
2016年のASA声明が示した原則を要約すると次のとおりです。
- p値は、データが特定の統計モデルとどれだけ合わないかを示すことができます。
- p値は、仮説が真である確率や、データが偶然だけで生じた確率を測るものではありません。
- 科学的な結論や意思決定は、p値が特定の基準を超えたかどうかだけに基づいてはなりません。
- 正しい推論には、すべての分析過程の透明な報告が必要です。
- p値は、効果の大きさや結果の重要性を測るものではありません。
- p値だけでは、モデルや仮説に関する証拠のよい尺度にはなりません。
両側検定と片側検定
- 両側検定:「差がある(方向は問わない)」を検定します。両側の裾の極端な値をすべて数えます。
- 片側検定:「AはBより大きい」のように方向を決めて検定します。片側の裾だけを数えます。
t分布のように対称な分布では、観測した方向が対立仮説と同じなら、片側p値は両側p値の半分です。上の例題で「Aのほうが高い」とする片側p値は約0.00084です。片側検定は、方向をデータを見る前に理論的根拠に基づいて決めたときにだけ使います。結果を見てからp値を半分にするために片側に切り替えるのは誤った使い方です。
よい報告の仕方
- 正確なp値を書きます(
p < 0.05ではなくp = 0.0017)。 - 効果量と信頼区間をあわせて書きます。
- 使った検定、両側・片側の別、標本サイズ、行った検定の数を明らかにします。
このサイトのt検定計算機では、t値、自由度、両側・片側のp値と効果量をまとめて確認できます。
まとめ
- p値は、帰無仮説が真であると仮定したとき、観測値以上に極端な結果が得られる確率です。
- p値は、帰無仮説が真である確率でも、効果がある確率でも、再現される確率でもありません。
- 有意でない結果は効果がないという証拠ではなく、小さなp値が大きな効果を意味するわけでもありません。
- 例題の2群比較(ウェルチのt)は、t ≈ 3.924、自由度約13.26、両側p ≈ 0.0017、片側p ≈ 0.00084です。
- 正確なp値、効果量、信頼区間をあわせて報告し、片側検定の方向はあらかじめ決めておきます。