Нормальное распределение — колоколообразное распределение, симметричное относительно среднего. Величины, складывающиеся из множества мелких факторов, — рост, погрешности измерений, многие экзаменационные баллы — часто распределены почти нормально. Кроме того, при достаточно большой выборке выборочное среднее приближается к нормальному распределению независимо от исходного распределения (центральная предельная теорема), и благодаря этому значительная часть доверительных интервалов и статистических критериев построена на нормальном распределении.
Два параметра нормального распределения
Нормальное распределение полностью задаётся двумя величинами: средним μ и стандартным отклонением σ. Обозначается оно как N(μ, σ²) (на втором месте стоит дисперсия).
- μ задаёт положение центра колокола.
- σ задаёт ширину колокола. Чем больше σ, тем ниже и шире колокол; чем меньше — тем выше и уже.
- Среднее, медиана и мода совпадают и равны μ.
- Вся площадь под кривой равна 1, а площадь над некоторым интервалом — это вероятность попадания значения в этот интервал.
z-оценка: разные шкалы к одной
z-оценка показывает, на сколько стандартных отклонений значение удалено от среднего.
z = (x − μ) / σ
При переходе к z-оценкам любое нормальное распределение превращается в стандартное нормальное распределение N(0, 1) со средним 0 и стандартным отклонением 1. Поэтому одной таблицы (или одного калькулятора) достаточно, чтобы находить вероятности для любого нормального распределения. z-оценка безразмерна, поэтому она удобна и для сравнения результатов двух экзаменов с разными шкалами. Например, 85 баллов на экзамене со средним 70 и стандартным отклонением 10 (z=1.5) — относительно лучший результат, чем 80 баллов на экзамене со средним 60 и стандартным отклонением 20 (z=1.0).
Правило 68–95–99.7
Если брать интервалы в единицах стандартного отклонения, доля значений нормального распределения внутри них всегда одинакова.
| Интервал | Доля внутри (точное значение) | Доля снаружи |
|---|---|---|
| μ ± 1σ | около 68.27% | около 31.73% |
| μ ± 2σ | около 95.45% | около 4.55% |
| μ ± 3σ | около 99.73% | около 0.27% |
Это правило — приближение для устного счёта. Интервал, содержащий ровно 95%, — это не ±2σ, а ±1.96σ; именно отсюда в доверительных интервалах берётся число 1.96. Аналогично для 90% это ±1.645σ, для 99% — ±2.576σ.
Как читать накопленную вероятность
Базовая величина в расчётах с нормальным распределением — накопленная вероятность P(X ≤ x), то есть вероятность того, что значение не превысит x. Для стандартного нормального распределения её обозначают Φ(z). Все остальные вероятности выражаются через неё.
- Вероятность значения не меньше x:
P(X ≥ x) = 1 − Φ(z) - Вероятность попасть между a и b:
P(a ≤ X ≤ b) = Φ(z_b) − Φ(z_a) - Симметрия:
Φ(−z) = 1 − Φ(z)
В непрерывном распределении вероятность отдельной точки равна 0, поэтому различие между ≤ и < на результат не влияет.
Пример 1: вероятность не превысить заданный балл
Пусть баллы за экзамен распределены нормально со средним 70 и стандартным отклонением 10.
Вероятность набрать не более 85 баллов
- z-оценка:
z = (85 − 70) / 10 = 1.5 - Накопленная вероятность:
Φ(1.5) ≈ 0.9332 - Интерпретация: около 93.32% участников набирают не более 85 баллов. 85 баллов соответствуют верхним примерно 6.68%.
Вероятность набрать от 60 до 85 баллов
- z-оценка для 60 баллов:
(60 − 70) / 10 = −1.0→Φ(−1.0) ≈ 0.1587 - z-оценка для 85 баллов:
1.5→Φ(1.5) ≈ 0.9332 - Разность:
0.9332 − 0.1587 ≈ 0.7745 - Интерпретация: около 77.45% участников набирают от 60 до 85 баллов.
Вероятность набрать не более 55 баллов
z-оценка равна −1.5, и по симметрии Φ(−1.5) = 1 − 0.9332 ≈ 0.0668. Это ровно столько же, сколько вероятность набрать 85 баллов и больше.
Пример 2: обратный расчёт балла для верхних x%
Теперь, наоборот, найдём балл по вероятности. Вопрос «сколько баллов нужно, чтобы попасть в верхние 10%» — это вопрос о «балле, которому соответствует накопленная вероятность 0.90».
- Находим значение z, соответствующее накопленной вероятности 0.90:
z = Φ⁻¹(0.90) ≈ 1.2816 - Возвращаемся к исходной шкале:
x = μ + z × σ = 70 + 1.2816 × 10 ≈ 82.82 - Интерпретация: при результате от примерно 82.82 балла вы в верхних 10%.
Точно так же для верхних 5% z ≈ 1.6449, то есть 70 + 16.449 ≈ 86.45 балла. Для нижних x% достаточно подставить накопленную вероятность x как есть.
| Критерий | Накопленная вероятность | Значение z | Балл (μ=70, σ=10) |
|---|---|---|---|
| Верхние 25% | 0.75 | около 0.6745 | около 76.74 |
| Верхние 10% | 0.90 | около 1.2816 | около 82.82 |
| Верхние 5% | 0.95 | около 1.6449 | около 86.45 |
| Верхний 1% | 0.99 | около 2.3263 | около 93.26 |
Пример 3: применение к выборочному среднему
Расчёты с нормальным распределением применимы не только к отдельным баллам, но и к выборочному среднему. Найдём вероятность того, что средний балл 25 случайно выбранных участников экзамена со средним 70 и стандартным отклонением 10 составит 74 и больше.
- Стандартное отклонение выборочного среднего (стандартная ошибка):
σ / √n = 10 / √25 = 2 - z-оценка:
z = (74 − 70) / 2 = 2.0 - Вероятность:
1 − Φ(2.0) ≈ 0.0228
Вероятность того, что отдельный ученик наберёт 74 и больше, равна 1 − Φ(0.4) ≈ 0.3446 — это обычное дело, а вероятность того, что среднее 25 человек составит 74 и больше, — около 2.28%, это редкость. Причина в том, что среднее разбросано гораздо меньше, чем отдельные значения. Отсюда берут начало доверительные интервалы и проверка гипотез.
На что обратить внимание
- Проверяйте допущение о нормальности. Если применить нормальное распределение к данным с длинным хвостом с одной стороны, например к доходам или времени ожидания, вероятности в хвостах окажутся сильно ошибочными. Сначала оцените форму по гистограмме или графику Q-Q.
- Данные с верхней и нижней границей (экзамен на 0~100 баллов и т. п.) на краях могут расходиться с нормальным распределением. Будьте особенно осторожны при обратном расчёте экстремальных порогов вроде верхнего 1%.
- Различайте параметры и их оценки. Если μ и σ оценены по выборке, результат неопределён ровно в той мере, в какой неточны эти оценки.
Если ввести среднее и стандартное отклонение в калькулятор нормального распределения на этом сайте, вы сразу получите накопленную вероятность, вероятность попадания в интервал и обратные значения.
Главное
- Нормальное распределение задаётся средним μ и стандартным отклонением σ и приводится к стандартному нормальному через
z = (x − μ) / σ. - В пределах μ ± 1σ, 2σ, 3σ лежат соответственно около 68.27%, 95.45% и 99.73% значений; точный 95%-й интервал — ±1.96σ.
- При среднем 70 и стандартном отклонении 10 вероятность набрать не более 85 баллов около 0.9332, а от 60 до 85 баллов — около 0.7745.
- Стандартная ошибка среднего для выборки из 25 человек равна
10 / √25 = 2, а вероятность среднего 74 балла и выше — около 0.0228. - Порог верхних 10% находят через обратную функцию накопленной вероятности:
70 + 1.2816 × 10 ≈ 82.82балла. - К данным, смещённым в одну сторону, нормальное распределение не применяют без оглядки.