置信区间不只报告一个估计值,而是连同“真值大概在这个范围内”的不确定性一起传达。问卷结果中的“误差范围 ±3 个百分点”也是置信区间的一种形式。然而,95% 置信区间这个说法常常被误读。本文先厘清它的准确含义,再用示例计算均值和比例的置信区间。
95% 指的是什么的 95%
总体均值 μ 虽然未知,却是一个固定的值。而置信区间是随样本每次都会变化的随机区间。因此,95% 这个概率附着在构造区间的方法上。
如果用同样的方式反复抽样并构造置信区间,那么在这样构造出的区间中,约有 95% 会包含真值。
对于一个已经算好的区间,例如 [45.74, 54.26],说“μ 落在其中的概率是 95%”,严格来说是错误的表述。这个区间要么包含 μ,要么不包含,只是我们不知道而已。实务中会采用“在 95% 置信水平下,总体均值估计在 45.74 到 54.26 之间”这类体现方法可信度的表述。
以下也是常见误解。
- “95% 的数据落在这个区间内”:不是。置信区间是关于参数(均值等)的区间,单个数据的范围要宽得多。
- “下一个样本的均值有 95% 的概率落在其中”:同样不是。那是预测区间的问题。
置信区间的基本结构
大多数置信区间都有相同的形式。
估计值 ± 临界值 × 标准误
置信水平越高,临界值越大;样本越大,标准误越小。因此提高置信水平会使区间变宽,增加样本则使区间变窄。标准误与 1/√n 成正比,所以要把区间宽度减半,样本需要增加到 4 倍。
z 还是 t
均值置信区间的临界值取决于是否已知总体标准差 σ。
- 已知 σ(少见):使用标准正态分布的 z 值。95% 时为
1.96。 - 未知 σ,用样本标准差 s 代替(大多数情况):使用自由度为
n−1的 t 分布的 t 值。
t 值反映了估计 s 带来的额外不确定性,因此比 z 大。样本越小,差距越大。
| 自由度 | 95% t 临界值 |
|---|---|
| 2 | 约 4.303 |
| 5 | 约 2.571 |
| 10 | 约 2.228 |
| 15 | 约 2.131 |
| 30 | 约 2.042 |
| 100 | 约 1.984 |
| 无穷大(z) | 约 1.960 |
示例 1:均值的置信区间
假设 16 个样本的均值为 x̄ = 50,样本标准差为 s = 8。
- 标准误:
SE = s / √n = 8 / √16 = 2 - 自由度:
16 − 1 = 15,95% t 临界值≈ 2.1314 - 误差范围:
2.1314 × 2 ≈ 4.263 - 置信区间:
50 ± 4.263→[45.74, 54.26]
用 z(1.96)做同样的计算,得到 50 ± 3.92 → [46.08, 53.92],区间变窄。在未知 σ 的情况下使用 z,实际覆盖率会达不到 95%,因此小样本必须使用 t。
示例 2:比例的置信区间(Wald 与 Wilson)
比例 p 的置信区间有多种公式。教科书中最先出现的是 Wald 区间。
- Wald:
p̂ ± z × √(p̂(1−p̂)/n)
如果 400 人中有 120 人回答“是”,则 p̂ = 0.30。
- 标准误:
√(0.30 × 0.70 / 400) ≈ 0.02291 - 误差范围:
1.96 × 0.02291 ≈ 0.0449 - Wald 95% 区间:
[0.2551, 0.3449]
Wilson 区间由在标准误中用假设值代替 p̂ 的方式推导而来,公式稍复杂,但性质良好。
- Wilson:中心
(p̂ + z²/(2n)) / (1 + z²/n),半宽z/(1 + z²/n) × √(p̂(1−p̂)/n + z²/(4n²))
对同一数据应用得到 [0.2572, 0.3466],与 Wald 几乎相同。当 n 较大且 p̂ 远离 0 或 1 时,两种方法给出相近的结果。
差别出现在样本较小或比例接近极端时。来看 20 人中 2 人(p̂ = 0.10)的情况。
| 方法 | 95% 区间 |
|---|---|
| Wald | [−0.0315, 0.2315] |
| Wilson | [0.0279, 0.3010] |
Wald 区间的下限变成了负数,作为比例没有意义。此外已知在这种条件下,Wald 区间的实际覆盖率会明显低于名义的 95%。Wilson 区间不会超出 0~1 的范围,中心略微向 0.5 靠拢,覆盖率也更接近名义值。因此如今多推荐把 Wilson 区间作为默认选择。
置信区间与假设检验的关系
均值的 95% 置信区间与显著性水平 0.05 的双侧 t 检验,是以不同方式呈现同一信息。如果某个值 μ₀ 位于 95% 置信区间之外,那么“总体均值为 μ₀”这一原假设的双侧 p 值小于 0.05。反之,若在区间内,p 值大于等于 0.05。
示例 1 的区间 [45.74, 54.26] 不包含 45。实际以原假设 μ₀ = 45 进行单样本 t 检验,得到 t = (50 − 45) / 2 = 2.5,自由度 15 下双侧 p ≈ 0.0245,小于 0.05。置信区间还能进一步给出“合理取值的范围”,因此比单个 p 值包含更多信息。
再来看看样本量的影响。同样是 x̄ = 50、s = 8,若样本为 64 个,标准误为 8 / 8 = 1,自由度 63 的 t 临界值约为 1.998,因此区间为 50 ± 2.00 → [48.00, 52.00]。样本增加到 4 倍后,宽度从约 8.53 缩小到 4.00,不到原来的一半(因为 t 临界值也随之变小)。
实用建议
- 同时写明置信水平和方法。 写成“95% CI(t 分布)”“95% CI(Wilson)”这样。
- 不要因为两个区间重叠就断定没有差异。 直接计算两均值之差的置信区间才准确。
- 样本是否有代表性是首要问题。 置信区间只反映随机抽样误差,不反映回答偏差或样本选择偏差。
在本站的置信区间计算器中,可以并排计算均值(z·t)和比例(Wald·Wilson)区间。
要点总结
- 95% 是构造区间的方法的长期覆盖率,而不是 μ 落在某个已算出区间内的概率。
- 置信区间的结构是
估计值 ± 临界值 × 标准误,要把宽度减半,样本需增加到 4 倍。 - 未知 σ 时使用 t 分布。n=16、x̄=50、s=8 的 95% 区间为
[45.74, 54.26]。 - 比例 120/400 的 95% 区间为 Wald
[0.2551, 0.3449]、Wilson[0.2572, 0.3466]。 - 在小样本或极端比例(如 2/20)下,Wald 会出现负的下限等不准确的情况,因此推荐 Wilson。