GUIDE 06

问卷调查样本量计算:由误差范围和置信水平确定

说明 n = z²·p(1−p)/E² 公式、使用 p=0.5 的原因、有限总体校正,按置信水平·误差范围列出样本量表,并计算考虑回复率的发放数量。

设计问卷调查时首先遇到的问题是“要问多少人”。太少则结果误差大、没有用处;太多则浪费成本和时间。对于估计比例的问卷,只要确定所需的误差范围置信水平,就能用简单的公式求出样本量。

基本公式

估计总体比例 p 时,要把误差控制在 E 以内所需的样本量如下。

  • n = z² × p(1−p) / E²

各符号的含义如下。

  • z:与置信水平对应的标准正态分布临界值(90% 约为 1.645,95% 约为 1.960,99% 约为 2.576)
  • p:预期的回答比例
  • E:允许的误差范围(用小数表示,±3 个百分点即 0.03)

这个公式是把比例置信区间 p̂ ± z × √(p̂(1−p̂)/n) 中的误差范围部分设为 E,再对 n 求解得到的。计算结果一律向上取整。如果四舍五入往下取,就无法满足所需的误差范围。

使用 p = 0.5 的原因

调查之前并不知道真实比例,而公式中含有 p。这时通常使用 p = 0.5。因为 p(1−p) 在 p 为 0.5 时取最大值 0.25。

pp(1−p)
0.1 或 0.90.09
0.2 或 0.80.16
0.3 或 0.70.21
0.50.25

也就是说,用 p=0.5 算出的样本量,无论真实比例是多少都能满足误差范围,是最保守的值。在一份问卷中询问多个题目时,它也是对所有题目都适用的样本量。如果有可靠信息表明以往调查的比例在 20% 左右,可以用 p=0.2 计算以减少样本。在 95%、±5 个百分点下,p=0.5 需要 385 人,而 p=0.2 只需 246 人。

示例:95% 置信水平,误差范围 ±5 个百分点

  1. z = 1.96p = 0.5E = 0.05
  2. n = 1.96² × 0.25 / 0.05² = 3.8415 × 0.25 / 0.0025 ≈ 384.15
  3. 向上取整:385 人

选举民调中常见的“95% 置信水平下 ±3.1 个百分点”这类表述,是样本约 1,000 人时得出的值。

不同置信水平·误差范围所需的样本量

以下是总体足够大且 p=0.5 时的值(均已向上取整)。

置信水平±1 个百分点±3 个百分点±5 个百分点
90%6,764752271
95%9,6041,068385
99%16,5881,844664

从表中可以看出两个规律。

  • 要把误差范围减半,样本需要约 4 倍。因为 n 与 E² 成反比。要从 ±5 个百分点精确 5 倍到 ±1 个百分点,需要 25 倍。
  • 把置信水平从 95% 提高到 99%,需要约 1.73 倍。即 (2.576/1.960)² ≈ 1.73

反过来:由样本量求误差范围

如果样本量已经确定,把公式反过来用就能求出误差范围。

  • E = z × √(p(1−p) / n)

按 95%、p=0.5 计算,回复 200 人时为 1.96 × √(0.25/200) ≈ 0.0693(约 ±6.9 个百分点),500 人时约 ±4.4 个百分点,2,000 人时约 ±2.2 个百分点。阅读回复数已定的调查结果时,了解这个值就能判断两个选项之间的差距是否在误差范围之内。

有限总体校正

上述公式假定总体非常大。当总体 N 较小、样本占总体相当大的比例时,所需样本会减少。这称为有限总体校正(FPC)

  • n = n₀ / (1 + (n₀ − 1) / N)

这里的 n₀ 是用前面公式求出的值(取整前)。有的教材把分母写成 1 + n₀/N,但 N 在数百人以上时,结果几乎没有差别。

在员工 2,000 人的公司以 95%、±5 个百分点进行调查时如下。

  1. n₀ ≈ 384.15
  2. n = 384.15 / (1 + 383.15 / 2000) = 384.15 / 1.1916 ≈ 322.39
  3. 向上取整:323 人

观察随总体规模的变化,就能看出校正的效果(95%、±5 个百分点)。

总体 N所需样本
500218
2,000323
10,000370
100,000383
非常大385

总体超过数万人后,所需样本几乎与总体规模无关。这就是为什么在人口 5,000 万的国家和人口 50 万的城市以同样精度调查,所需样本相差无几。一般以抽样比(n/N)超过 5% 作为应用校正的标准。

考虑回复率

公式给出的是最终回复数。需要发放或联系的人数,要用预期回复率去除来求得。

  • 发放数量 = 所需回复数 / 预期回复率

所需回复 385 人、预期回复率 30% 时,385 / 0.30 ≈ 1,283.3 → 需要发给 1,284 人。如果是前面的公司示例(323 人),在回复率 30% 时需要发给 1,077 人,也就是全体员工的一半以上。

不过,回复率越低,未回复者与回复者存在差异的可能性(无回答偏差)越大。增加样本只能减少随机误差,无法减少这种偏差。

如果计划进行子群体分析

如果不仅报告整体结果,还计划报告各年龄段、各地区的结果,就需要在每个子群体中分别确保所需样本。把整体 385 人分成 5 个年龄段,每组约 77 人,组内的误差范围在 95% 下约扩大到 ±11 个百分点。如果希望每个子群体都达到 ±5 个百分点,每组需要接近 385 人。

公式的前提

  • 假定为简单随机抽样。使用分层抽样、整群抽样时,需要乘以设计效应(design effect)进行校正。
  • 用于比例估计。估计均值或比较两组的检验,要使用其他公式(包含标准差、效应量、检验功效)。
  • 对于方便样本(公开的网络链接等),误差范围这一概念本身并不严格适用。

在本站的样本量计算器中输入置信水平、误差范围、总体规模和回复率,即可同时计算所需回复数和发放数量。

要点总结

  • 所需样本为 n = z² × p(1−p) / E²,结果一律向上取整。
  • 不知道 p 时,使用使 p(1−p) 最大的 0.5 进行保守计算。
  • 95% 下,±5 个百分点需要 385 人,±3 个百分点需要 1,068 人,±1 个百分点需要 9,604 人。
  • 总体较小时用 n₀ / (1 + (n₀−1)/N) 校正。N=2,000 时为 323 人。
  • 发放数量用所需回复数除以回复率求得,并记住无回答偏差不会因增加样本而减少。

→ 用计算器直接计算: 样本量

更新日期 2026-09-23