사분위수는 정렬한 데이터를 네 등분하는 경계값입니다. 제1사분위수 Q1은 하위 25%, 제2사분위수 Q2는 중앙값, 제3사분위수 Q3는 하위 75% 지점입니다. 개념은 단순하지만, 같은 데이터를 엑셀과 R, 통계 교과서로 계산해 보면 Q1과 Q3가 서로 다르게 나오는 일이 흔합니다. 계산기가 틀린 것이 아니라 데이터 사이의 위치를 어떻게 정하느냐에 대한 약속이 여러 가지이기 때문입니다.
왜 방식이 여러 가지일까요
데이터가 10개라면 "하위 25% 지점"은 정확히 어느 한 값에 떨어지지 않습니다. 2.5번째 값쯤이라고 할 수도 있고, 3.25번째라고 할 수도 있습니다. 통계 소프트웨어 R은 이런 정의를 9가지(type 1~9)로 정리해 두었고, 널리 쓰이는 방식은 다음 세 가지입니다.
| 방식 | 위치 공식(정렬 후 k번째) | 대표 사용처 |
|---|---|---|
| R type 7 | k = (n−1)p + 1 | 엑셀 QUARTILE.INC·PERCENTILE.INC, R 기본값, NumPy 기본값 |
| R type 6 | k = (n+1)p | 엑셀 QUARTILE.EXC·PERCENTILE.EXC, 일부 교과서·Minitab |
| 튜키 힌지 | 중앙값으로 반을 나눈 뒤 각 절반의 중앙값 | 탐색적 자료분석, 상자그림 교과서, R fivenum() |
위치 k가 정수가 아니면 앞뒤 두 값 사이를 직선으로 보간합니다. 예를 들어 k = 3.25라면 3번째 값에 (4번째 값 − 3번째 값)의 0.25배를 더합니다. 튜키 힌지는 n이 홀수일 때 중앙값을 양쪽 절반에 모두 포함하는 것이 원래 정의입니다.
같은 데이터, 다른 사분위수
다음 10개의 값을 정렬해 두었습니다.
2, 4, 5, 7, 8, 10, 12, 13, 15, 25
중앙값은 5번째와 6번째 값의 평균인 (8+10)/2 = 9로, 세 방식 모두 같습니다. 차이는 Q1과 Q3에서 생깁니다.
type 7 (엑셀 QUARTILE.INC)
- Q1 위치:
(10−1)×0.25 + 1 = 3.25→5 + 0.25×(7−5) = 5.5 - Q3 위치:
(10−1)×0.75 + 1 = 7.75→12 + 0.75×(13−12) = 12.75
type 6 (엑셀 QUARTILE.EXC)
- Q1 위치:
(10+1)×0.25 = 2.75→4 + 0.75×(5−4) = 4.75 - Q3 위치:
(10+1)×0.75 = 8.25→13 + 0.25×(15−13) = 13.5
튜키 힌지
- 아래 절반
2, 4, 5, 7, 8의 중앙값 →5 - 위 절반
10, 12, 13, 15, 25의 중앙값 →13
| 방식 | Q1 | Q3 | IQR |
|---|---|---|---|
| type 7 (INC) | 5.5 | 12.75 | 7.25 |
| type 6 (EXC) | 4.75 | 13.5 | 8.75 |
| 튜키 힌지 | 5 | 13 | 8 |
type 6은 양 끝으로 조금 더 벌어진 값을, type 7은 안쪽으로 모인 값을 주는 경향이 있고, 튜키 힌지는 그 사이에 있는 경우가 많습니다. 데이터가 수백 개 이상이면 방식 간 차이는 거의 사라지지만, 수십 개 이하에서는 결과 해석까지 바뀔 수 있습니다.
IQR과 1.5×IQR 울타리
사분위범위 IQR = Q3 − Q1은 가운데 50% 데이터가 차지하는 폭입니다. 평균과 표준편차는 극단값에 크게 흔들리지만, IQR은 가운데 절반만 보기 때문에 극단값에 강합니다.
튜키가 제안한 이상치 기준은 다음과 같습니다.
- 아래 울타리:
Q1 − 1.5 × IQR - 위 울타리:
Q3 + 1.5 × IQR - 울타리 바깥에 있는 값을 이상치 후보로 표시합니다.
3 × IQR바깥은 극단 이상치로 따로 구분하기도 합니다.
예제 데이터의 최댓값 25에 적용해 보겠습니다.
| 방식 | 아래 울타리 | 위 울타리 | 25는 이상치인가 |
|---|---|---|---|
| type 7 | 5.5 − 1.5×7.25 = −5.375 | 12.75 + 1.5×7.25 = 23.625 | 예 (23.625 초과) |
| type 6 | 4.75 − 1.5×8.75 = −8.375 | 13.5 + 1.5×8.75 = 26.625 | 아니오 |
| 튜키 힌지 | 5 − 1.5×8 = −7 | 13 + 1.5×8 = 25 | 경계값(바깥이 아님) |
같은 값 25가 방식에 따라 이상치가 되기도 하고 아니기도 합니다. 그래서 보고서에는 어떤 사분위수 정의를 썼는지 함께 적어야 하며, 1.5×IQR 기준은 "제거할 값"이 아니라 "다시 확인해 볼 값"을 고르는 도구로 쓰는 것이 바람직합니다.
상자그림 읽는 법
상자그림(box plot)은 사분위수를 그림으로 나타낸 것입니다.
- 상자: 아래 변이 Q1, 위 변이 Q3입니다. 상자 높이가 곧 IQR입니다.
- 상자 안의 선: 중앙값입니다. 선이 상자 한쪽으로 치우쳐 있으면 분포가 비대칭입니다.
- 수염(whisker): 울타리 안쪽에 있는 가장 먼 데이터까지 그립니다. 울타리 값 자체까지 긋는 것이 아닙니다.
- 점: 수염 바깥의 개별 점이 이상치 후보입니다.
위 수염이 아래 수염보다 길고 위쪽에 점이 있다면 오른쪽 꼬리가 긴 분포(양의 왜도)를 의심할 수 있습니다. 소득, 체류 시간, 대기 시간처럼 0 아래로 내려갈 수 없는 데이터에서 흔히 보이는 모양입니다.
실무 팁
- 다른 도구와 결과를 맞춰야 한다면 그 도구가 쓰는 정의를 먼저 확인합니다. 엑셀 사용자와 비교할 때는 type 7(INC)이 가장 무난합니다.
- 이상치는 원인을 확인한 뒤 판단합니다. 입력 오류(단위 착오, 자릿수 오타)라면 수정하고, 실제로 일어난 극단값이라면 남겨 두고 중앙값·IQR처럼 강건한 통계량을 함께 보고합니다.
- 백분위수도 같은 문제가 있습니다. 상위 10% 경계(90번째 백분위수)처럼 사분위수가 아닌 백분위수도 같은 위치 공식의 선택에 따라 값이 달라집니다.
- 표본이 작을 때는 사분위수 자체가 불안정합니다. 데이터가 10개 안팎이면 사분위수보다 원자료를 점으로 모두 보여 주는 편이 정보가 더 많습니다.
이 사이트의 기술통계 계산기에서는 같은 데이터로 사분위수 방식을 바꿔 가며 Q1·Q3·IQR·이상치 울타리를 비교해 볼 수 있습니다.
핵심 정리
- 사분위수는 표준 정의가 하나가 아니며, 엑셀
QUARTILE.INC는 R type 7,QUARTILE.EXC는 R type 6에 해당합니다. - 예제
2, 4, 5, 7, 8, 10, 12, 13, 15, 25에서 Q1·Q3는 type 7이 5.5·12.75, type 6이 4.75·13.5, 튜키 힌지가 5·13입니다. - 이상치 울타리는
Q1 − 1.5×IQR과Q3 + 1.5×IQR이며, 방식에 따라 같은 값이 이상치 여부가 달라질 수 있습니다. - 상자그림의 수염은 울타리 안의 가장 먼 데이터까지 그립니다.
- 보고서에는 사분위수 정의를 명시하고, 이상치는 제거보다 확인의 대상으로 다룹니다.