GUIDE 01

표준편차: 표본(n−1)과 모집단(n)의 차이

표본 표준편차는 왜 n−1로 나눌까요? 베셀 보정의 이유, 엑셀 STDEV.S와 STDEV.P 구분, 작은 데이터 손계산 예제로 정리합니다.

표준편차는 데이터가 평균에서 얼마나 흩어져 있는지를 나타내는 가장 널리 쓰이는 지표입니다. 그런데 계산기나 엑셀에서 표준편차를 구하면 값이 두 가지로 나오는 경우가 있습니다. 하나는 편차 제곱합을 n으로 나누고, 다른 하나는 n−1로 나눕니다. 이 글에서는 두 공식이 무엇을 뜻하는지, 왜 표본에서는 n−1을 쓰는지, 실무에서 어느 쪽을 골라야 하는지를 예제와 함께 설명합니다.

두 공식의 차이

모집단 전체를 알고 있을 때의 표준편차(모표준편차)는 다음과 같습니다.

  • 모표준편차: σ = √(Σ(x−μ)² / N)

모집단의 일부만 뽑은 표본으로 모집단의 흩어짐을 추정할 때는 다음 공식을 씁니다.

  • 표본표준편차: s = √(Σ(x−x̄)² / (n−1))

차이는 두 곳입니다. 첫째, 중심값이 모평균 μ가 아니라 표본평균 입니다. 둘째, 나누는 수가 n이 아니라 n−1입니다. 두 번째 차이를 베셀 보정(Bessel's correction) 이라고 부릅니다.

왜 n−1로 나눌까요

표본평균 는 바로 그 표본에서 계산한 값이므로, 표본의 데이터들과 가장 가까운 위치에 놓입니다. 실제로 편차 제곱합 Σ(x−c)²c가 표본평균일 때 가장 작아집니다. 그래서 진짜 모평균 μ 대신 를 기준으로 편차를 재면 편차 제곱합이 체계적으로 작게 나옵니다.

수학적으로 계산하면, n으로 나눈 분산의 기댓값은 (n−1)/n × σ²입니다. 예를 들어 표본 크기가 5라면 n으로 나눈 분산은 평균적으로 실제 분산의 4/5 = 80%밖에 되지 않습니다. 이 과소추정을 바로잡기 위해 n/(n−1)을 곱해 주면 결국 n−1로 나누는 공식이 됩니다. 그 결과 는 모분산 σ²불편추정량이 됩니다.

다른 설명 방식은 자유도입니다. n개의 편차 (x−x̄)는 합이 항상 0이어야 한다는 제약이 하나 있습니다. 따라서 n−1개의 편차만 정해지면 마지막 하나는 자동으로 결정됩니다. 자유롭게 움직일 수 있는 정보가 n−1개이므로 n−1로 나눈다고 이해할 수 있습니다.

주의: σ²의 불편추정량이지만, 제곱근을 씌운 sσ의 불편추정량이 아닙니다. 제곱근이 오목함수이기 때문에 s는 평균적으로 σ보다 약간 작습니다. 다만 표본이 커지면 이 차이는 무시할 만큼 작아지므로 실무에서는 s를 그대로 씁니다.

손계산 예제

다음 8개의 값이 있다고 하겠습니다.

2, 4, 4, 4, 5, 5, 7, 9

1단계: 평균

x̄ = (2+4+4+4+5+5+7+9) / 8 = 40 / 8 = 5

2단계: 편차와 편차 제곱

값 x편차 x−x̄편차 제곱
2−39
4−11
4−11
4−11
500
500
724
9416

편차의 합은 −3−1−1−1+0+0+2+4 = 0으로, 앞에서 말한 제약이 그대로 확인됩니다. 편차 제곱합은 9+1+1+1+0+0+4+16 = 32입니다.

3단계: 두 가지 분산과 표준편차

구분분산표준편차
모집단 기준(÷n)32 / 8 = 4√4 = 2
표본 기준(÷(n−1))32 / 7 ≈ 4.5714√4.5714 ≈ 2.1381

이 8개가 관심 대상 전체라면 표준편차는 2입니다. 반면 더 큰 집단에서 뽑은 8개로 그 집단의 흩어짐을 추정하려는 것이라면 약 2.1381을 보고해야 합니다. n이 8처럼 작을 때는 두 값의 차이가 약 7%로 눈에 띄게 납니다. n이 100이면 차이는 약 0.5%, n이 1,000이면 약 0.05%로 줄어듭니다.

언제 무엇을 쓰나요

판단 기준은 "지금 가진 데이터가 알고 싶은 대상의 전부인가, 일부인가"입니다.

  • 모집단(÷n): 한 반 학생 30명의 시험 점수 흩어짐을 그 반에 대해서만 설명할 때, 한 회사의 전 직원 급여 분포를 설명할 때처럼 데이터가 대상 전체인 경우입니다.
  • 표본(÷(n−1)): 설문 응답자 500명으로 전체 국민의 성향을 추정할 때, 생산 라인에서 뽑은 부품 20개로 공정 전체의 편차를 추정할 때처럼 데이터가 더 큰 집단의 일부인 경우입니다.

실무에서 다루는 데이터는 대부분 표본입니다. 신뢰구간, t검정, 표본 크기 계산처럼 추론으로 이어지는 계산은 모두 표본표준편차 s를 전제로 합니다. 어느 쪽인지 애매하다면 표본 공식을 쓰는 것이 보수적인 선택입니다.

엑셀과 프로그래밍 도구의 대응

도구표본(÷(n−1))모집단(÷n)
엑셀·구글 시트STDEV.S, VAR.S (구버전 STDEV)STDEV.P, VAR.P (구버전 STDEVP)
Rsd(), var()직접 보정 필요
Python pandasSeries.std() 기본값 ddof=1std(ddof=0)
Python NumPynp.std(x, ddof=1)np.std(x) 기본값 ddof=0

특히 NumPy와 pandas는 기본값이 서로 반대라서, 같은 데이터로 계산했는데 값이 다르게 나오는 일이 자주 생깁니다. 결과를 비교할 때는 어느 공식을 썼는지 먼저 확인하는 것이 좋습니다.

표준편차 값 읽는 법

표준편차는 원래 데이터와 같은 단위를 가집니다. 점수 데이터라면 "점", 키 데이터라면 "cm"입니다. 분산은 단위가 제곱이 되어 직관적으로 읽기 어렵기 때문에 보고할 때는 보통 표준편차를 씁니다. 데이터가 정규분포에 가깝다면 평균 ± 1 표준편차 안에 약 68%, ± 2 표준편차 안에 약 95%의 값이 들어간다고 대략 해석할 수 있습니다. 평균이 크게 다른 두 집단의 흩어짐을 비교할 때는 표준편차를 평균으로 나눈 변동계수(CV) 를 함께 보기도 합니다.

자주 하는 실수

  1. 보고서에 어떤 공식을 썼는지 적지 않는 것: 작은 표본에서는 값이 눈에 띄게 달라지므로, s 또는 σ 기호나 "표본 표준편차"라는 표현을 명시합니다.
  2. 표준편차와 표준오차를 혼동하는 것: 표준오차 SE = s / √n은 개별 데이터의 흩어짐이 아니라 표본평균의 흩어짐을 나타냅니다. 신뢰구간에는 표준오차가 쓰입니다.
  3. n이 1일 때 표본표준편차를 구하는 것: n−1이 0이 되므로 정의되지 않습니다. 계산기가 오류를 내는 것이 정상입니다.
  4. 이상치를 확인하지 않는 것: 표준편차는 제곱을 쓰기 때문에 극단값 하나에 크게 흔들립니다. 이상치가 의심되면 사분위범위(IQR)를 함께 봅니다.

이 사이트의 기술통계 계산기에 데이터를 붙여 넣으면 표본과 모집단 표준편차를 나란히 확인할 수 있습니다.

핵심 정리

  • 데이터가 대상 전체면 n으로, 더 큰 집단의 일부면 n−1로 나눕니다.
  • n으로 나눈 표본 분산의 기댓값은 (n−1)/n × σ²로 과소추정되며, n−1로 나누면 이를 바로잡습니다(베셀 보정).
  • 예제 2, 4, 4, 4, 5, 5, 7, 9의 표준편차는 모집단 기준 2, 표본 기준 약 2.1381입니다.
  • 엑셀은 STDEV.S(표본)와 STDEV.P(모집단)로 구분하며, NumPy와 pandas는 기본값이 서로 다릅니다.
  • 표준편차(데이터의 흩어짐)와 표준오차(평균의 흩어짐)를 구분합니다.

→ 계산기로 바로 계산: 기술통계

갱신일 2026-09-23