GUIDE 06

Расчёт объёма выборки для опроса по погрешности и доверительной вероятности

Формула n = z²·p(1−p)/E², почему берут p=0.5, поправка на конечную совокупность, таблица объёмов выборки и учёт доли ответов.

При планировании опроса первым делом встаёт вопрос: «скольких людей нужно опросить?». Если слишком мало, погрешность результатов будет так велика, что толку от них не будет; если слишком много — впустую тратятся деньги и время. Объём выборки для опроса, оценивающего долю, находится по простой формуле, если задать лишь желаемую предельную погрешность и доверительную вероятность.

Основная формула

Чтобы оценить долю генеральной совокупности p с погрешностью не больше E, нужен следующий объём выборки.

  • n = z² × p(1−p) / E²

Обозначения таковы.

  • z: критическое значение стандартного нормального распределения для выбранной доверительной вероятности (для 90% около 1.645, для 95% около 1.960, для 99% около 2.576)
  • p: ожидаемая доля ответов
  • E: допустимая погрешность (в виде десятичной дроби; для ±3 п.п. это 0.03)

Эта формула получается, если в доверительном интервале доли p̂ ± z × √(p̂(1−p̂)/n) приравнять предельную погрешность к E и решить относительно n. Результат всегда округляют вверх. Если округлить вниз, желаемая погрешность не будет достигнута.

Почему берут p = 0.5

До опроса истинная доля неизвестна, а в формуле есть p. В этом случае обычно берут p = 0.5, потому что p(1−p) достигает максимума 0.25 при p = 0.5.

pp(1−p)
0.1 или 0.90.09
0.2 или 0.80.16
0.3 или 0.70.21
0.50.25

То есть объём выборки, рассчитанный при p=0.5, — самое консервативное значение, обеспечивающее нужную погрешность при любой истинной доле. Если в одном опросе задаётся много вопросов, такой объём подходит для всех вопросов сразу. Если по прошлым опросам есть надёжные сведения, что доля около 20%, можно рассчитать при p=0.2 и уменьшить выборку. При 95% и ±5 п.п. для p=0.5 нужно 385 человек, а для p=0.2 — 246.

Пример: доверительная вероятность 95%, погрешность ±5 п.п.

  1. z = 1.96, p = 0.5, E = 0.05
  2. n = 1.96² × 0.25 / 0.05² = 3.8415 × 0.25 / 0.0025 ≈ 384.15
  3. Округляем вверх: 385 человек

Формулировка вроде «при доверительной вероятности 95% погрешность ±3.1 п.п.», которую часто видят в предвыборных опросах, соответствует выборке примерно из 1,000 человек.

Необходимый объём выборки по доверительной вероятности и погрешности

Значения для достаточно большой генеральной совокупности и p=0.5 (все округлены вверх).

Доверительная вероятность±1 п.п.±3 п.п.±5 п.п.
90%6,764752271
95%9,6041,068385
99%16,5881,844664

Из таблицы видны две закономерности.

  • Чтобы уменьшить погрешность вдвое, выборка нужна примерно в 4 раза больше, поскольку n обратно пропорционально E². Чтобы перейти от ±5 п.п. к ±1 п.п., то есть повысить точность в 5 раз, нужна выборка в 25 раз больше.
  • Повышение доверительной вероятности с 95% до 99% требует примерно в 1.73 раза больше наблюдений: (2.576/1.960)² ≈ 1.73.

Обратная задача: погрешность по объёму выборки

Если объём выборки уже задан, формулу используют в обратную сторону и находят погрешность.

  • E = z × √(p(1−p) / n)

При 95% и p=0.5 для 200 респондентов получаем 1.96 × √(0.25/200) ≈ 0.0693 (около ±6.9 п.п.), для 500 — около ±4.4 п.п., для 2,000 — около ±2.2 п.п. Зная эти значения, при чтении результатов опроса с известным числом респондентов можно прикинуть, укладывается ли разница между двумя вариантами ответа в пределы погрешности.

Поправка на конечную генеральную совокупность

Формула выше предполагает очень большую генеральную совокупность. Если генеральная совокупность N мала и выборка составляет заметную её часть, требуемая выборка уменьшается. Это называется поправкой на конечную совокупность (FPC).

  • n = n₀ / (1 + (n₀ − 1) / N)

Здесь n₀ — значение, полученное по предыдущей формуле (до округления). В некоторых учебниках знаменатель записывают как 1 + n₀/N; при N от нескольких сотен результаты почти не различаются.

Для опроса в компании из 2,000 сотрудников при 95% и ±5 п.п. получаем следующее.

  1. n₀ ≈ 384.15
  2. n = 384.15 / (1 + 383.15 / 2000) = 384.15 / 1.1916 ≈ 322.39
  3. Округляем вверх: 323 человека

Эффект поправки виден по тому, как меняется результат в зависимости от размера генеральной совокупности (95%, ±5 п.п.).

Генеральная совокупность NНеобходимая выборка
500218
2,000323
10,000370
100,000383
Очень большая385

Когда генеральная совокупность превышает несколько десятков тысяч, необходимая выборка почти не зависит от её размера. Именно поэтому для опроса с одинаковой точностью в стране с населением 50 миллионов и в городе с населением 500 тысяч нужны примерно одинаковые выборки. Общепринятый критерий — применять поправку, когда доля выборки (n/N) превышает 5%.

Учёт доли ответивших

Формула даёт итоговое число ответов. Число людей, которым нужно разослать анкету или с которыми нужно связаться, находят делением на ожидаемую долю ответивших.

  • число рассылок = нужное число ответов / ожидаемая доля ответивших

Если нужно 385 ответов, а ожидаемая доля ответивших — 30%, то 385 / 0.30 ≈ 1,283.3 → нужно разослать 1,284 человекам. Для примера с компанией (323 человека) при доле ответов 30% получится 1,077 человек, то есть рассылать придётся более чем половине всех сотрудников.

Однако чем ниже доля ответивших, тем выше вероятность, что не ответившие отличаются от ответивших (смещение из-за неответов). Увеличение выборки уменьшает только случайную ошибку, но не это смещение.

Если планируется анализ подгрупп

Если вы собираетесь публиковать не только общие результаты, но и результаты по возрастным группам или регионам, нужную выборку необходимо обеспечить отдельно внутри каждой подгруппы. Если разделить 385 человек на 5 возрастных групп, в каждой окажется около 77 человек, и погрешность внутри группы при 95% вырастет примерно до ±11 п.п. Если для каждой подгруппы нужна погрешность ±5 п.п., в каждой группе потребуется около 385 человек.

Предпосылки формулы

  • Предполагается простой случайный отбор. При стратифицированном или кластерном отборе нужно умножить на эффект плана (design effect).
  • Формула предназначена для оценки доли. Для оценки среднего или для критериев сравнения двух групп используются другие формулы (со стандартным отклонением, размером эффекта и мощностью).
  • К удобной (неслучайной) выборке, например по открытой онлайн-ссылке, само понятие предельной погрешности строго не применимо.

Если ввести в калькулятор объёма выборки на этом сайте доверительную вероятность, погрешность, размер генеральной совокупности и долю ответивших, он вычислит и нужное число ответов, и число рассылок.

Главное

  • Необходимая выборка равна n = z² × p(1−p) / E², результат всегда округляется вверх.
  • Если p неизвестно, берут 0.5, при котором p(1−p) максимально, и считают консервативно.
  • При 95% для ±5 п.п. нужно 385 человек, для ±3 п.п. — 1,068, для ±1 п.п. — 9,604.
  • Для малой генеральной совокупности применяют поправку n₀ / (1 + (n₀−1)/N). При N=2,000 получается 323 человека.
  • Число рассылок находят делением нужного числа ответов на долю ответивших; помните, что смещение из-за неответов не уменьшается с ростом выборки.

→ Рассчитать сейчас: Объём выборки

Обновлено 2026-09-23