GUIDE 04

正确解读 p 值:定义与 5 个常见误解

用示例说明 p 值的准确定义、它并非原假设为真的概率等 5 个常见误解,以及显著性水平、效应量和双侧·单侧检验。

p 值出现在研究报告、A/B 测试结果和论文的各个角落,但它也是最常被误读的统计量。美国统计协会(ASA)甚至在 2016 年专门发表了关于正确使用 p 值的正式声明。本文从 p 值的准确定义出发,用示例梳理常见误解和正确的报告方法。

p 值的定义

p 值的定义如下。

假定原假设为真时,得到与当前观测结果一样极端或更极端结果的概率

关键在于前半部分的条件。p 值是在“如果原假设成立”这一假定下计算出来的,因此它并不告诉我们这个假定本身成立的概率。p 值小意味着“如果原假设成立,这样的数据很少出现”,也就是说数据与原假设不太吻合。

示例:比较两组均值

假设使用新学习法的 A 组和使用传统方法的 B 组成绩如下(每组 8 人)。

  • A:72, 75, 78, 80, 74, 77, 79, 81
  • B:70, 71, 74, 73, 69, 72, 75, 68

原假设为“两组的总体均值相等”,备择假设为“不相等”。这里使用不假定方差齐性的 Welch t 检验。

  1. 均值:x̄_A = 77.0x̄_B = 71.5,差值 5.5
  2. 样本标准差:s_A ≈ 3.1168s_B ≈ 2.4495
  3. 标准误:SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015
  4. 检验统计量:t = 5.5 / 1.4015 ≈ 3.924
  5. Welch 自由度:约 13.26
  6. 双侧 p 值:约 0.0017

解读如下:“如果两种方法的总体均值真的相等,样本均值之差达到 5.5 分及以上(无论哪个方向)的概率约为 0.17%。”这远小于显著性水平 0.05,因此拒绝原假设。

显著性水平 α

显著性水平 α 是在查看数据之前就设定好的标准。若 p ≤ α,则拒绝原假设。α 是允许在原假设为真时仍将其拒绝的错误(第一类错误)的最大比例,惯例上多用 0.05,但视领域和情境也会使用 0.01 或 0.10。

α 与 p 值是不同的概念。α 是检验程序的长期错误率,p 值则表示本次数据与原假设偏离的程度。

5 个常见误解

1. “p 值是原假设为真的概率”

不是。p = 0.0017 并不意味着“原假设为真的概率是 0.17%”。p 值是以原假设为真为条件的数据概率,而原假设为真的概率是给定数据时假设的概率。两个条件概率方向相反,要求后者需要包含先验概率的贝叶斯推断。

2. “1 − p 是备择假设为真的概率”或“是可重复的概率”

这是把第一个误解反过来说,同样是错的。p = 0.03 并不意味着存在效应的概率是 97%,也不意味着重复同一实验时有 97% 的概率得到显著结果。

3. “p > 0.05 就说明没有效应”

不显著的结果不是“没有效应的证据”,而是“证据不足以说明存在效应”。样本较小时,即使确实有效应,p 值也容易偏大。例如把硬币抛 100 次出现 60 次正面时,针对“硬币是公平的”这一原假设的双侧精确二项检验 p 值约为 0.0569。它略高于 0.05,但不能据此得出硬币公平的结论。

4. “p 值越小,效应越大”

p 值是效应大小与样本量共同作用的结果。样本足够大时,非常小的差异也会变得显著。即使两组均值之差只有标准差的 0.02 倍(实务上几乎没有意义的差异),只要每组 100,000 人,就会得到 z ≈ 4.47、p ≈ 0.0000077。因此必须与 p 值一起报告效应量。上述学习法示例的效应量(Cohen's d,用两个样本方差的平均计算)约为 1.96,按惯例属于“大效应”。

5. “p = 0.049 与 p = 0.051 的结论截然相反”

0.05 不是自然法则,而是为方便而设的标准。两个值所提供的证据强度几乎相同。此外,如果进行多次检验只报告其中显著的结果(多重比较),或者不断收集数据直到显著为止(p-hacking),实际的第一类错误率会远远超过 α。

检验功效与样本量

解读不显著的结果时,应同时考虑检验功效(在确实存在效应时将其显著检出的概率)。例如两组的真实差异为效应量 d = 0.5(中等大小),进行 α = 0.05 的双侧检验时,每组 20 人的检验功效只有约 34%。每组 64 人时约为 80%。如果一项每组 20 人的研究得到了不显著的结果,与其说是没有效应,不如说很可能是一开始就缺乏检出的能力。

ASA 声明的要点

2016 年 ASA 声明提出的原则概括如下。

  1. p 值可以表明数据与特定统计模型不相容的程度。
  2. p 值并不衡量假设为真的概率,也不衡量数据纯属偶然产生的概率。
  3. 科学结论或决策不应仅仅基于 p 值是否越过某个阈值。
  4. 正确的推断需要对全部分析过程进行透明的报告。
  5. p 值不衡量效应的大小或结果的重要性。
  6. 仅凭 p 值本身,并不是关于模型或假设的证据的良好度量。

双侧检验与单侧检验

  • 双侧检验:检验“存在差异(不论方向)”。两侧尾部的极端值都计入。
  • 单侧检验:像“A 大于 B”这样指定方向进行检验。只计入一侧尾部。

在 t 分布这类对称分布中,若观测方向与备择假设一致,单侧 p 值是双侧 p 值的一半。上述示例中“A 更高”的单侧 p 值约为 0.00084。单侧检验只应在查看数据之前依据理论确定了方向时使用。看到结果后为了把 p 值减半而改用单侧检验,是错误的用法。

良好的报告方法

  • 写出精确的 p 值(写 p = 0.0017,而不是 p < 0.05)。
  • 同时写出效应量和置信区间。
  • 说明所用的检验、双侧还是单侧、样本量以及进行过的检验次数。

在本站的 t 检验计算器中,可以同时查看 t 值、自由度、双侧·单侧 p 值和效应量。

要点总结

  • p 值是假定原假设为真时,得到与观测值一样或更极端结果的概率。
  • p 值既不是原假设为真的概率,也不是存在效应的概率或可重复的概率。
  • 不显著的结果不是没有效应的证据,小的 p 值也不意味着效应大。
  • 示例的两组比较(Welch t)为 t ≈ 3.924,自由度约 13.26,双侧 p ≈ 0.0017,单侧 p ≈ 0.00084。
  • 同时报告精确的 p 值、效应量和置信区间,单侧检验的方向要事先确定。

→ 用计算器直接计算: t检验

更新日期 2026-09-23