정규분포는 평균을 중심으로 좌우 대칭인 종 모양의 분포입니다. 키, 측정 오차, 많은 시험 점수처럼 여러 작은 요인이 더해져 만들어지는 값은 정규분포에 가깝게 나타나는 경우가 많습니다. 또한 표본평균은 표본이 충분히 크면 원래 분포와 관계없이 정규분포에 가까워지는데(중심극한정리), 이 덕분에 신뢰구간과 검정의 상당수가 정규분포를 바탕으로 만들어졌습니다.
정규분포를 결정하는 두 값
정규분포는 평균 μ와 표준편차 σ 두 값으로 완전히 정해집니다. 기호로는 N(μ, σ²)처럼 씁니다(두 번째 자리는 분산입니다).
- μ는 종의 가운데 위치를 정합니다.
- σ는 종의 폭을 정합니다. σ가 크면 낮고 넓게, 작으면 높고 좁게 퍼집니다.
- 평균, 중앙값, 최빈값이 모두 μ로 같습니다.
- 곡선 아래 전체 넓이는 1이며, 어떤 구간의 넓이가 그 구간에 값이 들어갈 확률입니다.
z점수: 서로 다른 척도를 하나로
z점수는 어떤 값이 평균에서 표준편차 몇 개만큼 떨어져 있는지를 나타냅니다.
z = (x − μ) / σ
z점수로 바꾸면 모든 정규분포가 평균 0, 표준편차 1인 표준정규분포 N(0, 1)로 바뀝니다. 그래서 표 하나(또는 계산기 하나)로 모든 정규분포의 확률을 구할 수 있습니다. z점수는 단위가 없어서, 척도가 다른 두 시험의 성적을 비교할 때도 유용합니다. 예를 들어 평균 70·표준편차 10인 시험의 85점(z=1.5)은 평균 60·표준편차 20인 시험의 80점(z=1.0)보다 상대적으로 더 높은 성적입니다.
68–95–99.7 규칙
표준편차 단위로 구간을 잡으면 정규분포 안에 들어가는 비율은 항상 같습니다.
| 구간 | 들어가는 비율(정확값) | 바깥 비율 |
|---|---|---|
| μ ± 1σ | 약 68.27% | 약 31.73% |
| μ ± 2σ | 약 95.45% | 약 4.55% |
| μ ± 3σ | 약 99.73% | 약 0.27% |
이 규칙은 암산용 근사입니다. 정확히 95%를 포함하는 구간은 ±2σ가 아니라 ±1.96σ이며, 신뢰구간에서 1.96이라는 숫자가 나오는 이유가 이것입니다. 비슷하게 90%는 ±1.645σ, 99%는 ±2.576σ입니다.
누적확률 읽는 법
정규분포 계산에서 가장 기본이 되는 값은 누적확률 P(X ≤ x), 즉 x 이하일 확률입니다. 표준정규분포에서는 Φ(z)로 씁니다. 나머지 확률은 모두 여기서 만들어집니다.
- x 이상일 확률:
P(X ≥ x) = 1 − Φ(z) - a와 b 사이일 확률:
P(a ≤ X ≤ b) = Φ(z_b) − Φ(z_a) - 대칭성:
Φ(−z) = 1 − Φ(z)
연속분포에서는 한 점의 확률이 0이므로 ≤와 <의 구분은 결과에 영향을 주지 않습니다.
예제 1: 특정 점수 이하일 확률
어떤 시험 점수가 평균 70, 표준편차 10인 정규분포를 따른다고 하겠습니다.
85점 이하일 확률
- z점수:
z = (85 − 70) / 10 = 1.5 - 누적확률:
Φ(1.5) ≈ 0.9332 - 해석: 약 93.32%의 응시자가 85점 이하입니다. 85점은 상위 약 6.68%에 해당합니다.
60점 이상 85점 이하일 확률
- 60점의 z점수:
(60 − 70) / 10 = −1.0→Φ(−1.0) ≈ 0.1587 - 85점의 z점수:
1.5→Φ(1.5) ≈ 0.9332 - 차이:
0.9332 − 0.1587 ≈ 0.7745 - 해석: 약 77.45%의 응시자가 60점에서 85점 사이에 있습니다.
55점 이하일 확률
z점수는 −1.5이고, 대칭성에 따라 Φ(−1.5) = 1 − 0.9332 ≈ 0.0668입니다. 85점 이상일 확률과 정확히 같습니다.
예제 2: 상위 x% 기준 점수 역산
이번에는 반대로 확률에서 점수를 구합니다. "상위 10% 안에 들려면 몇 점이 필요한가"는 "누적확률 0.90에 해당하는 점수"를 묻는 것입니다.
- 누적확률 0.90에 해당하는 z값을 찾습니다:
z = Φ⁻¹(0.90) ≈ 1.2816 - 원래 척도로 되돌립니다:
x = μ + z × σ = 70 + 1.2816 × 10 ≈ 82.82 - 해석: 약 82.82점 이상이면 상위 10%입니다.
같은 방법으로 상위 5%는 z ≈ 1.6449이므로 70 + 16.449 ≈ 86.45점입니다. 하위 x%를 구할 때는 누적확률 x를 그대로 넣으면 됩니다.
| 기준 | 누적확률 | z값 | 점수(μ=70, σ=10) |
|---|---|---|---|
| 상위 25% | 0.75 | 약 0.6745 | 약 76.74 |
| 상위 10% | 0.90 | 약 1.2816 | 약 82.82 |
| 상위 5% | 0.95 | 약 1.6449 | 약 86.45 |
| 상위 1% | 0.99 | 약 2.3263 | 약 93.26 |
예제 3: 표본평균에 적용하기
정규분포 계산은 개별 점수뿐 아니라 표본평균에도 쓸 수 있습니다. 평균 70, 표준편차 10인 시험에서 무작위로 25명을 뽑았을 때, 그 25명의 평균 점수가 74점 이상일 확률을 구해 보겠습니다.
- 표본평균의 표준편차(표준오차):
σ / √n = 10 / √25 = 2 - z점수:
z = (74 − 70) / 2 = 2.0 - 확률:
1 − Φ(2.0) ≈ 0.0228
개별 학생이 74점 이상일 확률은 1 − Φ(0.4) ≈ 0.3446로 흔하지만, 25명 평균이 74점 이상일 확률은 약 2.28%로 드뭅니다. 평균은 개별 값보다 훨씬 덜 흩어지기 때문입니다. 이것이 신뢰구간과 가설검정의 출발점입니다.
주의할 점
- 정규성 가정을 확인합니다. 소득, 대기 시간처럼 한쪽 꼬리가 긴 데이터에 정규분포를 적용하면 꼬리 쪽 확률을 크게 틀립니다. 히스토그램이나 Q-Q 도표로 먼저 모양을 확인합니다.
- 상한과 하한이 있는 데이터(0~100점 시험 등)는 양 끝에서 정규분포와 어긋날 수 있습니다. 상위 1%처럼 극단의 기준을 역산할 때 특히 조심해야 합니다.
- 모수와 추정치를 구분합니다. μ와 σ를 표본에서 추정했다면, 그 추정 오차만큼 결과도 불확실합니다.
이 사이트의 정규분포 계산기에 평균과 표준편차를 넣으면 누적확률, 구간 확률, 역산 값을 바로 확인할 수 있습니다.
핵심 정리
- 정규분포는 평균 μ와 표준편차 σ로 정해지고,
z = (x − μ) / σ로 표준정규분포로 바꿀 수 있습니다. - μ ± 1σ, 2σ, 3σ 안에 각각 약 68.27%, 95.45%, 99.73%가 들어가며, 정확한 95% 구간은 ±1.96σ입니다.
- 평균 70·표준편차 10일 때 85점 이하일 확률은 약 0.9332, 60~85점 사이일 확률은 약 0.7745입니다.
- 25명 표본평균의 표준오차는
10 / √25 = 2이며, 평균이 74점 이상일 확률은 약 0.0228입니다. - 상위 10% 기준은
70 + 1.2816 × 10 ≈ 82.82점처럼 누적확률의 역함수로 구합니다. - 한쪽으로 치우친 데이터에는 정규분포를 그대로 적용하지 않습니다.