GUIDE 05

95% 置信区间的正确含义与计算方法

说明如何从重复抽样的角度正确解读 95% 置信区间、如何在 z 与 t 之间选择,并给出均值·比例置信区间示例及 Wald 与 Wilson 区间的区别。

置信区间不只报告一个估计值,而是连同“真值大概在这个范围内”的不确定性一起传达。问卷结果中的“误差范围 ±3 个百分点”也是置信区间的一种形式。然而,95% 置信区间这个说法常常被误读。本文先厘清它的准确含义,再用示例计算均值和比例的置信区间。

95% 指的是什么的 95%

总体均值 μ 虽然未知,却是一个固定的值。而置信区间是随样本每次都会变化的随机区间。因此,95% 这个概率附着在构造区间的方法上。

如果用同样的方式反复抽样并构造置信区间,那么在这样构造出的区间中,约有 95% 会包含真值。

对于一个已经算好的区间,例如 [45.74, 54.26],说“μ 落在其中的概率是 95%”,严格来说是错误的表述。这个区间要么包含 μ,要么不包含,只是我们不知道而已。实务中会采用“在 95% 置信水平下,总体均值估计在 45.74 到 54.26 之间”这类体现方法可信度的表述。

以下也是常见误解。

  • “95% 的数据落在这个区间内”:不是。置信区间是关于参数(均值等)的区间,单个数据的范围要宽得多。
  • “下一个样本的均值有 95% 的概率落在其中”:同样不是。那是预测区间的问题。

置信区间的基本结构

大多数置信区间都有相同的形式。

  • 估计值 ± 临界值 × 标准误

置信水平越高,临界值越大;样本越大,标准误越小。因此提高置信水平会使区间变宽,增加样本则使区间变窄。标准误与 1/√n 成正比,所以要把区间宽度减半,样本需要增加到 4 倍。

z 还是 t

均值置信区间的临界值取决于是否已知总体标准差 σ。

  • 已知 σ(少见):使用标准正态分布的 z 值。95% 时为 1.96
  • 未知 σ,用样本标准差 s 代替(大多数情况):使用自由度为 n−1 的 t 分布的 t 值。

t 值反映了估计 s 带来的额外不确定性,因此比 z 大。样本越小,差距越大。

自由度95% t 临界值
2约 4.303
5约 2.571
10约 2.228
15约 2.131
30约 2.042
100约 1.984
无穷大(z)约 1.960

示例 1:均值的置信区间

假设 16 个样本的均值为 x̄ = 50,样本标准差为 s = 8

  1. 标准误:SE = s / √n = 8 / √16 = 2
  2. 自由度:16 − 1 = 15,95% t 临界值 ≈ 2.1314
  3. 误差范围:2.1314 × 2 ≈ 4.263
  4. 置信区间:50 ± 4.263[45.74, 54.26]

用 z(1.96)做同样的计算,得到 50 ± 3.92[46.08, 53.92],区间变窄。在未知 σ 的情况下使用 z,实际覆盖率会达不到 95%,因此小样本必须使用 t。

示例 2:比例的置信区间(Wald 与 Wilson)

比例 p 的置信区间有多种公式。教科书中最先出现的是 Wald 区间

  • Wald:p̂ ± z × √(p̂(1−p̂)/n)

如果 400 人中有 120 人回答“是”,则 p̂ = 0.30

  1. 标准误:√(0.30 × 0.70 / 400) ≈ 0.02291
  2. 误差范围:1.96 × 0.02291 ≈ 0.0449
  3. Wald 95% 区间:[0.2551, 0.3449]

Wilson 区间由在标准误中用假设值代替 p̂ 的方式推导而来,公式稍复杂,但性质良好。

  • Wilson:中心 (p̂ + z²/(2n)) / (1 + z²/n),半宽 z/(1 + z²/n) × √(p̂(1−p̂)/n + z²/(4n²))

对同一数据应用得到 [0.2572, 0.3466],与 Wald 几乎相同。当 n 较大且 p̂ 远离 0 或 1 时,两种方法给出相近的结果。

差别出现在样本较小或比例接近极端时。来看 20 人中 2 人(p̂ = 0.10)的情况。

方法95% 区间
Wald[−0.0315, 0.2315]
Wilson[0.0279, 0.3010]

Wald 区间的下限变成了负数,作为比例没有意义。此外已知在这种条件下,Wald 区间的实际覆盖率会明显低于名义的 95%。Wilson 区间不会超出 0~1 的范围,中心略微向 0.5 靠拢,覆盖率也更接近名义值。因此如今多推荐把 Wilson 区间作为默认选择。

置信区间与假设检验的关系

均值的 95% 置信区间与显著性水平 0.05 的双侧 t 检验,是以不同方式呈现同一信息。如果某个值 μ₀ 位于 95% 置信区间之外,那么“总体均值为 μ₀”这一原假设的双侧 p 值小于 0.05。反之,若在区间内,p 值大于等于 0.05。

示例 1 的区间 [45.74, 54.26] 不包含 45。实际以原假设 μ₀ = 45 进行单样本 t 检验,得到 t = (50 − 45) / 2 = 2.5,自由度 15 下双侧 p ≈ 0.0245,小于 0.05。置信区间还能进一步给出“合理取值的范围”,因此比单个 p 值包含更多信息。

再来看看样本量的影响。同样是 x̄ = 50s = 8,若样本为 64 个,标准误为 8 / 8 = 1,自由度 63 的 t 临界值约为 1.998,因此区间为 50 ± 2.00[48.00, 52.00]。样本增加到 4 倍后,宽度从约 8.53 缩小到 4.00,不到原来的一半(因为 t 临界值也随之变小)。

实用建议

  • 同时写明置信水平和方法。 写成“95% CI(t 分布)”“95% CI(Wilson)”这样。
  • 不要因为两个区间重叠就断定没有差异。 直接计算两均值之差的置信区间才准确。
  • 样本是否有代表性是首要问题。 置信区间只反映随机抽样误差,不反映回答偏差或样本选择偏差。

在本站的置信区间计算器中,可以并排计算均值(z·t)和比例(Wald·Wilson)区间。

要点总结

  • 95% 是构造区间的方法的长期覆盖率,而不是 μ 落在某个已算出区间内的概率。
  • 置信区间的结构是 估计值 ± 临界值 × 标准误,要把宽度减半,样本需增加到 4 倍。
  • 未知 σ 时使用 t 分布。n=16、x̄=50、s=8 的 95% 区间为 [45.74, 54.26]
  • 比例 120/400 的 95% 区间为 Wald [0.2551, 0.3449]、Wilson [0.2572, 0.3466]
  • 在小样本或极端比例(如 2/20)下,Wald 会出现负的下限等不准确的情况,因此推荐 Wilson。

→ 用计算器直接计算: 置信区间

更新日期 2026-09-23