신뢰구간은 추정값 하나만 보고하는 대신 "이 정도 범위에 참값이 있을 것"이라는 불확실성까지 함께 전달하는 방법입니다. 설문 결과의 "오차범위 ±3%p"도 신뢰구간의 한 형태입니다. 그런데 95% 신뢰구간이라는 말은 자주 잘못 해석됩니다. 이 글에서는 정확한 의미를 먼저 짚고, 평균과 비율의 신뢰구간을 예제로 계산합니다.
95%는 무엇에 대한 95%인가
모평균 μ는 알 수 없지만 고정된 하나의 값입니다. 반면 신뢰구간은 표본에 따라 매번 달라지는 무작위 구간입니다. 따라서 95%라는 확률은 구간을 만드는 방법에 붙는 것입니다.
같은 방식으로 표본을 뽑아 신뢰구간을 계속 만든다면, 그렇게 만든 구간들 가운데 약 95%가 참값을 포함합니다.
이미 계산을 마친 구간 하나, 예를 들어 [45.74, 54.26]에 대해 "μ가 이 안에 있을 확률이 95%"라고 말하는 것은 엄밀히는 틀린 표현입니다. 이 구간은 μ를 포함하거나 포함하지 않거나 둘 중 하나이고, 우리가 그것을 모를 뿐입니다. 실무에서는 "95% 신뢰수준에서 모평균은 45.74에서 54.26 사이로 추정된다"처럼 방법의 신뢰도를 드러내는 표현을 씁니다.
다음도 흔한 오해입니다.
- "데이터의 95%가 이 구간에 있다": 아닙니다. 신뢰구간은 모수(평균 등)에 대한 구간이며, 개별 데이터의 범위는 훨씬 넓습니다.
- "다음 표본의 평균이 95% 확률로 이 안에 들어온다": 역시 아닙니다. 그것은 예측구간의 문제입니다.
신뢰구간의 기본 구조
대부분의 신뢰구간은 같은 모양을 가집니다.
추정값 ± 임계값 × 표준오차
임계값은 신뢰수준이 높을수록 커지고, 표준오차는 표본이 클수록 작아집니다. 그래서 신뢰수준을 높이면 구간이 넓어지고, 표본을 늘리면 좁아집니다. 표준오차는 1/√n에 비례하므로 구간 폭을 절반으로 줄이려면 표본을 4배로 늘려야 합니다.
z와 t, 무엇을 쓸까
평균의 신뢰구간에서 임계값은 모표준편차 σ를 아는지에 따라 달라집니다.
- σ를 안다(드묾): 표준정규분포의 z값을 씁니다. 95%에서
1.96입니다. - σ를 모르고 표본표준편차 s로 대신한다(대부분): 자유도
n−1인 t분포의 t값을 씁니다.
t값은 s를 추정하면서 생기는 추가 불확실성을 반영해 z보다 큽니다. 표본이 작을수록 그 차이가 큽니다.
| 자유도 | 95% t 임계값 |
|---|---|
| 2 | 약 4.303 |
| 5 | 약 2.571 |
| 10 | 약 2.228 |
| 15 | 약 2.131 |
| 30 | 약 2.042 |
| 100 | 약 1.984 |
| 무한대(z) | 약 1.960 |
예제 1: 평균의 신뢰구간
표본 16개의 평균이 x̄ = 50, 표본표준편차가 s = 8이라고 하겠습니다.
- 표준오차:
SE = s / √n = 8 / √16 = 2 - 자유도:
16 − 1 = 15, 95% t 임계값≈ 2.1314 - 오차범위:
2.1314 × 2 ≈ 4.263 - 신뢰구간:
50 ± 4.263→[45.74, 54.26]
같은 계산을 z(1.96)로 하면 50 ± 3.92 → [46.08, 53.92]로 구간이 좁아집니다. σ를 모르는데 z를 쓰면 실제 포함률이 95%에 못 미치게 되므로, 작은 표본에서는 t를 써야 합니다.
예제 2: 비율의 신뢰구간 (Wald와 Wilson)
비율 p의 신뢰구간은 공식이 여러 가지입니다. 교과서에 가장 먼저 나오는 것은 Wald 구간입니다.
- Wald:
p̂ ± z × √(p̂(1−p̂)/n)
400명 중 120명이 "예"라고 답했다면 p̂ = 0.30입니다.
- 표준오차:
√(0.30 × 0.70 / 400) ≈ 0.02291 - 오차범위:
1.96 × 0.02291 ≈ 0.0449 - Wald 95% 구간:
[0.2551, 0.3449]
Wilson 구간은 표준오차 안의 p̂ 대신 가설값을 쓰는 방식에서 유도되며, 식은 조금 복잡하지만 성질이 좋습니다.
- Wilson: 중심
(p̂ + z²/(2n)) / (1 + z²/n), 반폭z/(1 + z²/n) × √(p̂(1−p̂)/n + z²/(4n²))
같은 데이터에 적용하면 [0.2572, 0.3466]로 Wald와 거의 같습니다. n이 크고 p̂가 0이나 1에서 멀면 두 방법은 비슷한 결과를 줍니다.
차이는 표본이 작거나 비율이 극단에 가까울 때 드러납니다. 20명 중 2명(p̂ = 0.10)인 경우를 보겠습니다.
| 방법 | 95% 구간 |
|---|---|
| Wald | [−0.0315, 0.2315] |
| Wilson | [0.0279, 0.3010] |
Wald 구간은 하한이 음수가 되어 비율로서 말이 되지 않습니다. 또한 Wald 구간은 이런 조건에서 실제 포함률이 명목 95%보다 상당히 낮아지는 것으로 알려져 있습니다. Wilson 구간은 0~1 범위를 벗어나지 않고, 중심이 0.5 쪽으로 약간 당겨지며, 포함률도 명목값에 더 가깝습니다. 그래서 요즘은 Wilson 구간을 기본으로 권하는 경우가 많습니다.
신뢰구간과 가설검정의 관계
평균의 95% 신뢰구간과 유의수준 0.05의 양측 t검정은 같은 정보를 다른 방식으로 보여 줍니다. 어떤 값 μ₀가 95% 신뢰구간 밖에 있으면, "모평균이 μ₀"라는 귀무가설의 양측 p값은 0.05보다 작습니다. 반대로 구간 안에 있으면 p값은 0.05 이상입니다.
예제 1의 구간 [45.74, 54.26]은 45를 포함하지 않습니다. 실제로 귀무가설 μ₀ = 45로 일표본 t검정을 하면 t = (50 − 45) / 2 = 2.5, 자유도 15에서 양측 p ≈ 0.0245로 0.05보다 작습니다. 신뢰구간은 여기에 더해 "그럴듯한 값의 범위"까지 보여 주므로, p값 하나보다 정보가 많습니다.
표본 크기의 효과도 확인해 보겠습니다. 같은 x̄ = 50, s = 8에서 표본이 64개라면 표준오차는 8 / 8 = 1, 자유도 63의 t 임계값은 약 1.998이므로 구간은 50 ± 2.00 → [48.00, 52.00]입니다. 표본을 4배로 늘리자 폭이 약 8.53에서 4.00으로 절반 이하가 되었습니다(t 임계값도 함께 작아졌기 때문입니다).
실무 팁
- 신뢰수준과 방법을 함께 적습니다. "95% CI(t분포)", "95% CI(Wilson)"처럼 씁니다.
- 두 구간이 겹친다고 차이가 없다고 단정하지 않습니다. 두 평균 차이의 신뢰구간을 직접 계산하는 것이 정확합니다.
- 표본이 대표성을 갖는지가 먼저입니다. 신뢰구간은 무작위 표집 오차만 반영하며, 응답 편향이나 표본 선택 편향은 반영하지 않습니다.
이 사이트의 신뢰구간 계산기에서 평균(z·t)과 비율(Wald·Wilson) 구간을 나란히 계산해 볼 수 있습니다.
핵심 정리
- 95%는 구간을 만드는 방법의 장기적 포함률이며, 계산된 구간 하나에 μ가 있을 확률이 아닙니다.
- 신뢰구간은
추정값 ± 임계값 × 표준오차구조이고, 폭을 절반으로 줄이려면 표본을 4배로 늘려야 합니다. - σ를 모르면 t분포를 씁니다. n=16, x̄=50, s=8의 95% 구간은
[45.74, 54.26]입니다. - 비율 120/400의 95% 구간은 Wald
[0.2551, 0.3449], Wilson[0.2572, 0.3466]입니다. - 작은 표본이나 극단적 비율(예: 2/20)에서는 Wald가 음수 하한을 내는 등 부정확하므로 Wilson을 권합니다.