GUIDE 01

Стандартное отклонение: выборка (n−1) и генеральная совокупность (n)

Почему выборочное стандартное отклонение делят на n−1? Поправка Бесселя, STDEV.S и STDEV.P в Excel и ручной расчёт на примере.

Стандартное отклонение — самый распространённый показатель того, насколько сильно данные разбросаны вокруг среднего. Однако, вычисляя его на калькуляторе или в Excel, можно получить два разных значения. В одном случае сумма квадратов отклонений делится на n, в другом — на n−1. В этой статье на примерах разберём, что означают обе формулы, почему для выборки используют n−1 и какую из них выбирать на практике.

Чем отличаются две формулы

Стандартное отклонение, когда известна вся генеральная совокупность (стандартное отклонение генеральной совокупности), вычисляется так.

  • Стандартное отклонение генеральной совокупности: σ = √(Σ(x−μ)² / N)

Когда разброс генеральной совокупности оценивают по выборке — лишь части этой совокупности, — используют другую формулу.

  • Выборочное стандартное отклонение: s = √(Σ(x−x̄)² / (n−1))

Различий два. Во-первых, центром служит не среднее генеральной совокупности μ, а выборочное среднее . Во-вторых, делитель равен не n, а n−1. Второе различие называют поправкой Бесселя (Bessel's correction).

Почему делят на n−1

Выборочное среднее вычислено по той же самой выборке, поэтому оно расположено ближе всего к её данным. Действительно, сумма квадратов отклонений Σ(x−c)² минимальна, когда c равно выборочному среднему. Поэтому если измерять отклонения не от истинного среднего μ, а от , сумма квадратов отклонений систематически получается заниженной.

Математически математическое ожидание дисперсии, делённой на n, равно (n−1)/n × σ². Например, при объёме выборки 5 дисперсия, делённая на n, в среднем составляет лишь 4/5 = 80% от истинной дисперсии. Чтобы исправить это занижение, её умножают на n/(n−1) — и в итоге получается формула с делением на n−1. В результате становится несмещённой оценкой дисперсии генеральной совокупности σ².

Другое объяснение — через степени свободы. На n отклонений (x−x̄) наложено одно ограничение: их сумма всегда должна быть равна 0. Поэтому, если заданы n−1 отклонений, последнее определяется автоматически. Свободно меняться могут лишь n−1 значений, поэтому и делят на n−1.

Внимание: — несмещённая оценка σ², но квадратный корень из неё, s, не является несмещённой оценкой σ. Поскольку квадратный корень — вогнутая функция, s в среднем немного меньше σ. Впрочем, с ростом выборки эта разница становится пренебрежимо малой, поэтому на практике s используют как есть.

Пример ручного расчёта

Пусть даны следующие 8 значений.

2, 4, 4, 4, 5, 5, 7, 9

Шаг 1: среднее

x̄ = (2+4+4+4+5+5+7+9) / 8 = 40 / 8 = 5

Шаг 2: отклонения и их квадраты

Значение xОтклонение x−x̄Квадрат отклонения
2−39
4−11
4−11
4−11
500
500
724
9416

Сумма отклонений равна −3−1−1−1+0+0+2+4 = 0 — упомянутое выше ограничение подтверждается. Сумма квадратов отклонений равна 9+1+1+1+0+0+4+16 = 32.

Шаг 3: два варианта дисперсии и стандартного отклонения

ВариантДисперсияСтандартное отклонение
Генеральная совокупность (÷n)32 / 8 = 4√4 = 2
Выборка (÷(n−1))32 / 7 ≈ 4.5714√4.5714 ≈ 2.1381

Если эти 8 значений — весь интересующий нас объект, стандартное отклонение равно 2. Если же это 8 значений, взятых из более крупной совокупности, и мы хотим оценить её разброс, следует указывать примерно 2.1381. При малом n, как здесь (8), разница между значениями заметна — около 7%. При n = 100 она сокращается примерно до 0.5%, при n = 1,000 — примерно до 0.05%.

Когда что использовать

Критерий выбора — «являются ли имеющиеся данные всем объектом изучения или только его частью».

  • Генеральная совокупность (÷n): данные охватывают весь объект — например, когда вы описываете разброс оценок 30 учеников одного класса только применительно к этому классу или распределение зарплат всех сотрудников одной компании.
  • Выборка (÷(n−1)): данные — часть более крупной совокупности — например, когда по 500 респондентам опроса оценивают настроения всего населения страны или по 20 деталям с производственной линии оценивают разброс всего процесса.

На практике большинство данных — это выборки. Все расчёты, ведущие к статистическому выводу, — доверительные интервалы, t-критерий, расчёт объёма выборки — предполагают выборочное стандартное отклонение s. Если непонятно, какой случай ваш, выборочная формула — более консервативный выбор.

Соответствие в Excel и языках программирования

ИнструментВыборка (÷(n−1))Генеральная совокупность (÷n)
Excel · Google ТаблицыSTDEV.S, VAR.S (в старых версиях STDEV)STDEV.P, VAR.P (в старых версиях STDEVP)
Rsd(), var()нужна ручная поправка
Python pandasSeries.std() по умолчанию ddof=1std(ddof=0)
Python NumPynp.std(x, ddof=1)np.std(x) по умолчанию ddof=0

У NumPy и pandas значения по умолчанию противоположны, поэтому для одних и тех же данных часто получаются разные результаты. Сравнивая результаты, сначала проверьте, какая формула была использована.

Как читать значение стандартного отклонения

Стандартное отклонение измеряется в тех же единицах, что и исходные данные: для оценок — в «баллах», для роста — в «см». Дисперсия выражена в квадратах единиц и плохо поддаётся интуитивному прочтению, поэтому в отчётах обычно приводят стандартное отклонение. Если данные близки к нормальному распределению, можно грубо считать, что в пределах среднее ± 1 стандартное отклонение лежит около 68% значений, а в пределах ± 2 стандартных отклонения — около 95%. При сравнении разброса двух групп с сильно различающимися средними иногда дополнительно смотрят на коэффициент вариации (CV) — стандартное отклонение, делённое на среднее.

Частые ошибки

  1. Не указывать в отчёте, какая формула использована: на малых выборках значения заметно различаются, поэтому явно пишите символ s или σ либо формулировку «выборочное стандартное отклонение».
  2. Путать стандартное отклонение со стандартной ошибкой: стандартная ошибка SE = s / √n отражает не разброс отдельных данных, а разброс выборочного среднего. В доверительных интервалах используется стандартная ошибка.
  3. Вычислять выборочное стандартное отклонение при n = 1: n−1 становится равным 0, и величина не определена. Если калькулятор выдаёт ошибку — это нормально.
  4. Не проверять выбросы: стандартное отклонение использует квадраты, поэтому одно экстремальное значение сильно на него влияет. Если есть подозрение на выбросы, смотрите также на межквартильный размах (IQR).

Если вставить данные в калькулятор описательной статистики на этом сайте, выборочное стандартное отклонение и стандартное отклонение генеральной совокупности будут показаны рядом.

Главное

  • Если данные — весь объект, делите на n; если это часть более крупной совокупности — на n−1.
  • Математическое ожидание выборочной дисперсии, делённой на n, равно (n−1)/n × σ², то есть она занижена; деление на n−1 исправляет это (поправка Бесселя).
  • Для примера 2, 4, 4, 4, 5, 5, 7, 9 стандартное отклонение равно 2 для генеральной совокупности и примерно 2.1381 для выборки.
  • В Excel это STDEV.S (выборка) и STDEV.P (генеральная совокупность); у NumPy и pandas значения по умолчанию различаются.
  • Различайте стандартное отклонение (разброс данных) и стандартную ошибку (разброс среднего).

→ Рассчитать сейчас: Описательная

Обновлено 2026-09-23