p 值出现在研究报告、A/B 测试结果和论文的各个角落,但它也是最常被误读的统计量。美国统计协会(ASA)甚至在 2016 年专门发表了关于正确使用 p 值的正式声明。本文从 p 值的准确定义出发,用示例梳理常见误解和正确的报告方法。
p 值的定义
p 值的定义如下。
假定原假设为真时,得到与当前观测结果一样极端或更极端结果的概率
关键在于前半部分的条件。p 值是在“如果原假设成立”这一假定下计算出来的,因此它并不告诉我们这个假定本身成立的概率。p 值小意味着“如果原假设成立,这样的数据很少出现”,也就是说数据与原假设不太吻合。
示例:比较两组均值
假设使用新学习法的 A 组和使用传统方法的 B 组成绩如下(每组 8 人)。
- A:
72, 75, 78, 80, 74, 77, 79, 81 - B:
70, 71, 74, 73, 69, 72, 75, 68
原假设为“两组的总体均值相等”,备择假设为“不相等”。这里使用不假定方差齐性的 Welch t 检验。
- 均值:
x̄_A = 77.0,x̄_B = 71.5,差值5.5 - 样本标准差:
s_A ≈ 3.1168,s_B ≈ 2.4495 - 标准误:
SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015 - 检验统计量:
t = 5.5 / 1.4015 ≈ 3.924 - Welch 自由度:约
13.26 - 双侧 p 值:约
0.0017
解读如下:“如果两种方法的总体均值真的相等,样本均值之差达到 5.5 分及以上(无论哪个方向)的概率约为 0.17%。”这远小于显著性水平 0.05,因此拒绝原假设。
显著性水平 α
显著性水平 α 是在查看数据之前就设定好的标准。若 p ≤ α,则拒绝原假设。α 是允许在原假设为真时仍将其拒绝的错误(第一类错误)的最大比例,惯例上多用 0.05,但视领域和情境也会使用 0.01 或 0.10。
α 与 p 值是不同的概念。α 是检验程序的长期错误率,p 值则表示本次数据与原假设偏离的程度。
5 个常见误解
1. “p 值是原假设为真的概率”
不是。p = 0.0017 并不意味着“原假设为真的概率是 0.17%”。p 值是以原假设为真为条件的数据概率,而原假设为真的概率是给定数据时假设的概率。两个条件概率方向相反,要求后者需要包含先验概率的贝叶斯推断。
2. “1 − p 是备择假设为真的概率”或“是可重复的概率”
这是把第一个误解反过来说,同样是错的。p = 0.03 并不意味着存在效应的概率是 97%,也不意味着重复同一实验时有 97% 的概率得到显著结果。
3. “p > 0.05 就说明没有效应”
不显著的结果不是“没有效应的证据”,而是“证据不足以说明存在效应”。样本较小时,即使确实有效应,p 值也容易偏大。例如把硬币抛 100 次出现 60 次正面时,针对“硬币是公平的”这一原假设的双侧精确二项检验 p 值约为 0.0569。它略高于 0.05,但不能据此得出硬币公平的结论。
4. “p 值越小,效应越大”
p 值是效应大小与样本量共同作用的结果。样本足够大时,非常小的差异也会变得显著。即使两组均值之差只有标准差的 0.02 倍(实务上几乎没有意义的差异),只要每组 100,000 人,就会得到 z ≈ 4.47、p ≈ 0.0000077。因此必须与 p 值一起报告效应量。上述学习法示例的效应量(Cohen's d,用两个样本方差的平均计算)约为 1.96,按惯例属于“大效应”。
5. “p = 0.049 与 p = 0.051 的结论截然相反”
0.05 不是自然法则,而是为方便而设的标准。两个值所提供的证据强度几乎相同。此外,如果进行多次检验只报告其中显著的结果(多重比较),或者不断收集数据直到显著为止(p-hacking),实际的第一类错误率会远远超过 α。
检验功效与样本量
解读不显著的结果时,应同时考虑检验功效(在确实存在效应时将其显著检出的概率)。例如两组的真实差异为效应量 d = 0.5(中等大小),进行 α = 0.05 的双侧检验时,每组 20 人的检验功效只有约 34%。每组 64 人时约为 80%。如果一项每组 20 人的研究得到了不显著的结果,与其说是没有效应,不如说很可能是一开始就缺乏检出的能力。
ASA 声明的要点
2016 年 ASA 声明提出的原则概括如下。
- p 值可以表明数据与特定统计模型不相容的程度。
- p 值并不衡量假设为真的概率,也不衡量数据纯属偶然产生的概率。
- 科学结论或决策不应仅仅基于 p 值是否越过某个阈值。
- 正确的推断需要对全部分析过程进行透明的报告。
- p 值不衡量效应的大小或结果的重要性。
- 仅凭 p 值本身,并不是关于模型或假设的证据的良好度量。
双侧检验与单侧检验
- 双侧检验:检验“存在差异(不论方向)”。两侧尾部的极端值都计入。
- 单侧检验:像“A 大于 B”这样指定方向进行检验。只计入一侧尾部。
在 t 分布这类对称分布中,若观测方向与备择假设一致,单侧 p 值是双侧 p 值的一半。上述示例中“A 更高”的单侧 p 值约为 0.00084。单侧检验只应在查看数据之前依据理论确定了方向时使用。看到结果后为了把 p 值减半而改用单侧检验,是错误的用法。
良好的报告方法
- 写出精确的 p 值(写
p = 0.0017,而不是p < 0.05)。 - 同时写出效应量和置信区间。
- 说明所用的检验、双侧还是单侧、样本量以及进行过的检验次数。
在本站的 t 检验计算器中,可以同时查看 t 值、自由度、双侧·单侧 p 值和效应量。
要点总结
- p 值是假定原假设为真时,得到与观测值一样或更极端结果的概率。
- p 值既不是原假设为真的概率,也不是存在效应的概率或可重复的概率。
- 不显著的结果不是没有效应的证据,小的 p 值也不意味着效应大。
- 示例的两组比较(Welch t)为 t ≈ 3.924,自由度约 13.26,双侧 p ≈ 0.0017,单侧 p ≈ 0.00084。
- 同时报告精确的 p 值、效应量和置信区间,单侧检验的方向要事先确定。