설문조사를 설계할 때 가장 먼저 부딪히는 질문은 "몇 명에게 물어봐야 하나"입니다. 너무 적으면 결과의 오차가 커서 쓸모가 없고, 너무 많으면 비용과 시간이 낭비됩니다. 비율을 추정하는 설문의 표본 크기는 원하는 오차범위와 신뢰수준만 정하면 간단한 공식으로 구할 수 있습니다.
기본 공식
모비율 p를 추정할 때, 오차범위 E 이내로 추정하는 데 필요한 표본 크기는 다음과 같습니다.
n = z² × p(1−p) / E²
각 기호의 의미는 다음과 같습니다.
z: 신뢰수준에 해당하는 표준정규분포 임계값(90%는 약 1.645, 95%는 약 1.960, 99%는 약 2.576)p: 예상되는 응답 비율E: 허용할 오차범위(소수로 표기, ±3%p라면 0.03)
이 공식은 비율의 신뢰구간 p̂ ± z × √(p̂(1−p̂)/n)에서 오차범위 부분을 E로 놓고 n에 대해 푼 것입니다. 계산 결과는 항상 올림합니다. 반올림으로 내리면 원하는 오차범위를 만족하지 못합니다.
p = 0.5를 쓰는 이유
조사 전에는 실제 비율을 모르는데, 공식에는 p가 들어 있습니다. 이때 보통 p = 0.5를 씁니다. p(1−p)는 p가 0.5일 때 최댓값 0.25를 가지기 때문입니다.
| p | p(1−p) |
|---|---|
| 0.1 또는 0.9 | 0.09 |
| 0.2 또는 0.8 | 0.16 |
| 0.3 또는 0.7 | 0.21 |
| 0.5 | 0.25 |
즉 p=0.5로 계산한 표본 크기는 실제 비율이 무엇이든 오차범위를 만족하는 가장 보수적인 값입니다. 여러 문항을 한 설문에서 묻는 경우에도 모든 문항에 통하는 크기가 됩니다. 이전 조사에서 비율이 20% 안팎이라는 믿을 만한 정보가 있다면 p=0.2로 계산해 표본을 줄일 수 있습니다. 95%, ±5%p에서 p=0.5면 385명이지만 p=0.2면 246명입니다.
예제: 95% 신뢰수준, 오차범위 ±5%p
z = 1.96,p = 0.5,E = 0.05n = 1.96² × 0.25 / 0.05² = 3.8415 × 0.25 / 0.0025 ≈ 384.15- 올림: 385명
선거 여론조사에서 자주 보는 "95% 신뢰수준에 ±3.1%p" 같은 문구는 표본이 약 1,000명일 때 나오는 값입니다.
신뢰수준·오차범위별 필요 표본 크기
모집단이 충분히 크고 p=0.5일 때의 값입니다(모두 올림).
| 신뢰수준 | ±1%p | ±3%p | ±5%p |
|---|---|---|---|
| 90% | 6,764 | 752 | 271 |
| 95% | 9,604 | 1,068 | 385 |
| 99% | 16,588 | 1,844 | 664 |
표에서 두 가지 경향을 읽을 수 있습니다.
- 오차범위를 절반으로 줄이려면 표본이 약 4배 필요합니다. n이 E²에 반비례하기 때문입니다. ±5%p에서 ±1%p로 5배 정밀하게 하려면 25배가 필요합니다.
- 신뢰수준을 95%에서 99%로 올리면 약 1.73배가 필요합니다.
(2.576/1.960)² ≈ 1.73입니다.
반대로: 표본 크기로 오차범위 구하기
이미 표본 크기가 정해져 있다면 공식을 거꾸로 써서 오차범위를 구합니다.
E = z × √(p(1−p) / n)
95%, p=0.5 기준으로 응답 200명이면 1.96 × √(0.25/200) ≈ 0.0693(약 ±6.9%p), 500명이면 약 ±4.4%p, 2,000명이면 약 ±2.2%p입니다. 응답 수가 정해진 조사 결과를 읽을 때 이 값을 알아 두면, 두 선택지의 차이가 오차범위 안에 있는지 가늠할 수 있습니다.
유한모집단 보정
위 공식은 모집단이 매우 크다고 가정합니다. 모집단 N이 작아서 표본이 모집단의 상당 부분을 차지하면, 필요한 표본이 줄어듭니다. 이를 유한모집단 보정(FPC) 이라고 합니다.
n = n₀ / (1 + (n₀ − 1) / N)
여기서 n₀는 앞의 공식으로 구한 값(올림 전)입니다. 교재에 따라 분모를 1 + n₀/N으로 쓰기도 하는데, N이 수백 명 이상이면 결과 차이는 거의 없습니다.
직원 2,000명인 회사에서 95%, ±5%p로 조사한다면 다음과 같습니다.
n₀ ≈ 384.15n = 384.15 / (1 + 383.15 / 2000) = 384.15 / 1.1916 ≈ 322.39- 올림: 323명
모집단 크기에 따른 변화를 보면 보정의 효과를 알 수 있습니다(95%, ±5%p).
| 모집단 N | 필요 표본 |
|---|---|
| 500 | 218 |
| 2,000 | 323 |
| 10,000 | 370 |
| 100,000 | 383 |
| 매우 큼 | 385 |
모집단이 수만 명을 넘으면 필요한 표본은 모집단 크기와 거의 무관합니다. 인구 5천만 명의 나라와 인구 50만 명의 도시에서 같은 정밀도로 조사하는 데 필요한 표본이 비슷한 이유입니다. 표본 비율(n/N)이 5%를 넘을 때 보정을 적용하는 것이 일반적인 기준입니다.
응답률 고려
공식이 알려 주는 것은 최종 응답 수입니다. 발송하거나 접촉해야 할 인원은 예상 응답률로 나누어 구합니다.
발송 수 = 필요 응답 수 / 예상 응답률
필요 응답 385명, 예상 응답률 30%라면 385 / 0.30 ≈ 1,283.3 → 1,284명에게 보내야 합니다. 앞의 회사 예제(323명)라면 응답률 30%에서 1,077명, 즉 전 직원의 절반 이상에게 보내야 한다는 계산이 나옵니다.
다만 응답률이 낮을수록 응답하지 않은 사람과 응답한 사람이 다를 가능성(무응답 편향)이 커집니다. 표본을 늘리는 것은 무작위 오차만 줄일 뿐, 이 편향은 줄이지 못합니다.
하위 집단 분석을 계획한다면
전체 결과뿐 아니라 연령대별, 지역별 결과도 보고할 계획이라면 각 하위 집단 안에서 필요한 표본을 따로 확보해야 합니다. 전체 385명을 5개 연령대로 나누면 집단당 약 77명이고, 그 안에서의 오차범위는 95% 기준 약 ±11%p로 커집니다. 하위 집단마다 ±5%p를 원한다면 집단마다 385명 가까이가 필요합니다.
공식의 전제
- 단순 무작위 표집을 가정합니다. 층화, 군집 표집을 쓰면 설계효과(design effect)를 곱해 보정해야 합니다.
- 비율 추정용입니다. 평균을 추정하거나 두 집단을 비교하는 검정은 다른 공식(표준편차, 효과크기, 검정력 포함)을 씁니다.
- 편의 표본(온라인 공개 링크 등)에는 오차범위라는 개념 자체가 엄밀하게 적용되지 않습니다.
이 사이트의 표본 크기 계산기에 신뢰수준, 오차범위, 모집단 크기, 응답률을 넣으면 필요한 응답 수와 발송 수를 함께 계산할 수 있습니다.
핵심 정리
- 필요 표본은
n = z² × p(1−p) / E²이며, 결과는 항상 올림합니다. - p를 모르면
p(1−p)가 최대가 되는 0.5를 써서 보수적으로 계산합니다. - 95%, ±5%p에는 385명, ±3%p에는 1,068명, ±1%p에는 9,604명이 필요합니다.
- 모집단이 작으면
n₀ / (1 + (n₀−1)/N)로 보정합니다. N=2,000이면 323명입니다. - 발송 수는 필요 응답 수를 응답률로 나누어 구하고, 무응답 편향은 표본을 늘려도 줄지 않는다는 점을 기억합니다.