p값은 연구 보고서, A/B 테스트 결과, 논문 어디에서나 등장하지만 가장 자주 잘못 해석되는 통계량이기도 합니다. 미국통계학회(ASA)는 2016년에 p값의 올바른 사용에 관한 공식 성명을 따로 발표했을 정도입니다. 이 글에서는 p값의 정확한 정의부터 시작해, 흔한 오해와 올바른 보고 방법을 예제로 정리합니다.
p값의 정의
p값은 다음과 같이 정의됩니다.
귀무가설이 참이라고 가정했을 때, 지금 관측한 결과만큼 또는 그보다 더 극단적인 결과가 나올 확률
핵심은 앞부분의 조건입니다. p값은 "귀무가설이 맞다면"이라는 가정 아래에서 계산되는 값이므로, 그 가정 자체가 맞을 확률을 알려 주지 않습니다. p값이 작다는 것은 "귀무가설이 맞다면 이런 데이터는 드물게 나온다", 즉 데이터가 귀무가설과 잘 맞지 않는다는 뜻입니다.
예제: 두 집단 평균 비교
새 학습법을 쓴 집단 A와 기존 방법을 쓴 집단 B의 점수가 다음과 같다고 하겠습니다(각 8명).
- A:
72, 75, 78, 80, 74, 77, 79, 81 - B:
70, 71, 74, 73, 69, 72, 75, 68
귀무가설은 "두 집단의 모평균이 같다", 대립가설은 "다르다"입니다. 등분산을 가정하지 않는 웰치 t검정을 쓰겠습니다.
- 평균:
x̄_A = 77.0,x̄_B = 71.5, 차이5.5 - 표본표준편차:
s_A ≈ 3.1168,s_B ≈ 2.4495 - 표준오차:
SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015 - 검정통계량:
t = 5.5 / 1.4015 ≈ 3.924 - 웰치 자유도: 약
13.26 - 양측 p값: 약
0.0017
해석은 이렇습니다. "두 방법의 모평균이 정말 같다면, 표본평균 차이가 5.5점 이상(어느 방향이든) 벌어질 확률은 약 0.17%다." 유의수준 0.05보다 훨씬 작으므로 귀무가설을 기각합니다.
유의수준 α
유의수준 α는 데이터를 보기 전에 정해 두는 기준입니다. p ≤ α이면 귀무가설을 기각합니다. α는 귀무가설이 참인데도 기각하는 오류(제1종 오류)를 허용할 최대 비율이며, 관례적으로 0.05를 많이 쓰지만 분야와 상황에 따라 0.01이나 0.10을 쓰기도 합니다.
α와 p값은 다른 개념입니다. α는 검정 절차의 장기적 오류율이고, p값은 이번 데이터가 귀무가설과 얼마나 어긋나는지를 나타내는 값입니다.
흔한 오해 5가지
1. "p값은 귀무가설이 참일 확률이다"
아닙니다. p = 0.0017은 "귀무가설이 참일 확률이 0.17%"라는 뜻이 아닙니다. p값은 귀무가설이 참이라는 조건 아래의 데이터 확률이고, 귀무가설이 참일 확률은 데이터가 주어졌을 때의 가설 확률입니다. 두 조건부확률은 방향이 반대이며, 후자를 구하려면 사전확률을 포함하는 베이즈 추론이 필요합니다.
2. "1 − p는 대립가설이 참일 확률이다" 또는 "재현될 확률이다"
첫 번째 오해를 뒤집은 것이므로 역시 틀립니다. p = 0.03이라고 해서 효과가 있을 확률이 97%이거나, 같은 실험을 반복하면 97% 확률로 유의하게 나온다는 뜻이 아닙니다.
3. "p > 0.05이면 효과가 없다"
유의하지 않은 결과는 "효과가 없다는 증거"가 아니라 "효과가 있다고 말할 만큼 증거가 충분하지 않다"는 뜻입니다. 표본이 작으면 실제 효과가 있어도 p값이 크게 나오기 쉽습니다. 예를 들어 동전을 100번 던져 앞면이 60번 나왔을 때 공정한 동전이라는 귀무가설의 양측 정확 이항검정 p값은 약 0.0569입니다. 0.05를 살짝 넘지만, 이것으로 동전이 공정하다고 결론 내릴 수는 없습니다.
4. "p값이 작을수록 효과가 크다"
p값은 효과의 크기와 표본 크기가 함께 만든 값입니다. 표본이 충분히 크면 아주 작은 차이도 유의해집니다. 두 집단의 평균 차이가 표준편차의 0.02배(실무적으로 거의 무의미한 차이)라도 집단당 100,000명이면 z ≈ 4.47, p ≈ 0.0000077이 됩니다. 그래서 p값과 함께 효과크기를 보고해야 합니다. 위 학습법 예제의 효과크기(Cohen's d, 두 표본 분산의 평균으로 계산)는 약 1.96으로, 관례상 "큰 효과"에 해당합니다.
5. "p = 0.049와 p = 0.051은 결론이 정반대다"
0.05는 자연법칙이 아니라 편의상의 기준입니다. 두 값이 주는 증거의 강도는 거의 같습니다. 또한 여러 번 검정해 그중 유의한 것만 보고하거나(다중 비교), 유의해질 때까지 데이터를 더 모으면(p-해킹) 실제 제1종 오류율이 α를 훨씬 넘게 됩니다.
검정력과 표본 크기
유의하지 않은 결과를 해석할 때는 검정력(실제 효과가 있을 때 그것을 유의하게 찾아낼 확률)을 함께 생각해야 합니다. 예를 들어 두 집단의 실제 차이가 효과크기 d = 0.5(중간 크기)이고 α = 0.05 양측 검정을 한다면, 집단당 20명일 때 검정력은 약 34%에 불과합니다. 집단당 64명이면 약 80%가 됩니다. 집단당 20명으로 한 연구에서 유의하지 않은 결과가 나왔다면, 효과가 없어서라기보다 애초에 찾아낼 힘이 부족했을 가능성이 큽니다.
ASA 성명의 요점
2016년 ASA 성명이 제시한 원칙을 요약하면 다음과 같습니다.
- p값은 데이터가 특정 통계 모형과 얼마나 맞지 않는지를 나타낼 수 있습니다.
- p값은 가설이 참일 확률이나 데이터가 우연히 생겼을 확률을 측정하지 않습니다.
- 과학적 결론이나 의사결정은 p값이 특정 기준을 넘었는지에만 근거해서는 안 됩니다.
- 올바른 추론에는 모든 분석 과정의 투명한 보고가 필요합니다.
- p값은 효과의 크기나 결과의 중요성을 측정하지 않습니다.
- p값만으로는 모형이나 가설에 대한 증거의 좋은 척도가 되지 못합니다.
양측 검정과 단측 검정
- 양측 검정: "차이가 있다(방향 무관)"를 검정합니다. 양쪽 꼬리의 극단값을 모두 셉니다.
- 단측 검정: "A가 B보다 크다"처럼 방향을 정해 검정합니다. 한쪽 꼬리만 셉니다.
t분포처럼 대칭인 분포에서는, 관측한 방향이 대립가설과 같으면 단측 p값이 양측 p값의 절반입니다. 위 예제에서 "A가 더 높다"는 단측 p값은 약 0.00084입니다. 단측 검정은 방향을 데이터를 보기 전에 이론적 근거로 정했을 때만 씁니다. 결과를 본 뒤 p값을 반으로 줄이려고 단측으로 바꾸는 것은 잘못된 사용입니다.
좋은 보고 방법
- 정확한 p값을 적습니다(
p < 0.05대신p = 0.0017). - 효과크기와 신뢰구간을 함께 적습니다.
- 사용한 검정, 양측·단측 여부, 표본 크기, 수행한 검정의 수를 밝힙니다.
이 사이트의 t검정 계산기에서는 t값, 자유도, 양측·단측 p값과 효과크기를 함께 확인할 수 있습니다.
핵심 정리
- p값은 귀무가설이 참이라고 가정했을 때 관측값 이상으로 극단적인 결과가 나올 확률입니다.
- p값은 귀무가설이 참일 확률도, 효과가 있을 확률도, 재현 확률도 아닙니다.
- 유의하지 않은 결과는 효과가 없다는 증거가 아니며, 작은 p값이 큰 효과를 뜻하지도 않습니다.
- 예제 두 집단 비교(웰치 t)는 t ≈ 3.924, 자유도 약 13.26, 양측 p ≈ 0.0017, 단측 p ≈ 0.00084입니다.
- 정확한 p값, 효과크기, 신뢰구간을 함께 보고하고, 단측 검정의 방향은 미리 정합니다.