При планировании опроса первым делом встаёт вопрос: «скольких людей нужно опросить?». Если слишком мало, погрешность результатов будет так велика, что толку от них не будет; если слишком много — впустую тратятся деньги и время. Объём выборки для опроса, оценивающего долю, находится по простой формуле, если задать лишь желаемую предельную погрешность и доверительную вероятность.
Основная формула
Чтобы оценить долю генеральной совокупности p с погрешностью не больше E, нужен следующий объём выборки.
n = z² × p(1−p) / E²
Обозначения таковы.
z: критическое значение стандартного нормального распределения для выбранной доверительной вероятности (для 90% около 1.645, для 95% около 1.960, для 99% около 2.576)p: ожидаемая доля ответовE: допустимая погрешность (в виде десятичной дроби; для ±3 п.п. это 0.03)
Эта формула получается, если в доверительном интервале доли p̂ ± z × √(p̂(1−p̂)/n) приравнять предельную погрешность к E и решить относительно n. Результат всегда округляют вверх. Если округлить вниз, желаемая погрешность не будет достигнута.
Почему берут p = 0.5
До опроса истинная доля неизвестна, а в формуле есть p. В этом случае обычно берут p = 0.5, потому что p(1−p) достигает максимума 0.25 при p = 0.5.
| p | p(1−p) |
|---|---|
| 0.1 или 0.9 | 0.09 |
| 0.2 или 0.8 | 0.16 |
| 0.3 или 0.7 | 0.21 |
| 0.5 | 0.25 |
То есть объём выборки, рассчитанный при p=0.5, — самое консервативное значение, обеспечивающее нужную погрешность при любой истинной доле. Если в одном опросе задаётся много вопросов, такой объём подходит для всех вопросов сразу. Если по прошлым опросам есть надёжные сведения, что доля около 20%, можно рассчитать при p=0.2 и уменьшить выборку. При 95% и ±5 п.п. для p=0.5 нужно 385 человек, а для p=0.2 — 246.
Пример: доверительная вероятность 95%, погрешность ±5 п.п.
z = 1.96,p = 0.5,E = 0.05n = 1.96² × 0.25 / 0.05² = 3.8415 × 0.25 / 0.0025 ≈ 384.15- Округляем вверх: 385 человек
Формулировка вроде «при доверительной вероятности 95% погрешность ±3.1 п.п.», которую часто видят в предвыборных опросах, соответствует выборке примерно из 1,000 человек.
Необходимый объём выборки по доверительной вероятности и погрешности
Значения для достаточно большой генеральной совокупности и p=0.5 (все округлены вверх).
| Доверительная вероятность | ±1 п.п. | ±3 п.п. | ±5 п.п. |
|---|---|---|---|
| 90% | 6,764 | 752 | 271 |
| 95% | 9,604 | 1,068 | 385 |
| 99% | 16,588 | 1,844 | 664 |
Из таблицы видны две закономерности.
- Чтобы уменьшить погрешность вдвое, выборка нужна примерно в 4 раза больше, поскольку n обратно пропорционально E². Чтобы перейти от ±5 п.п. к ±1 п.п., то есть повысить точность в 5 раз, нужна выборка в 25 раз больше.
- Повышение доверительной вероятности с 95% до 99% требует примерно в 1.73 раза больше наблюдений:
(2.576/1.960)² ≈ 1.73.
Обратная задача: погрешность по объёму выборки
Если объём выборки уже задан, формулу используют в обратную сторону и находят погрешность.
E = z × √(p(1−p) / n)
При 95% и p=0.5 для 200 респондентов получаем 1.96 × √(0.25/200) ≈ 0.0693 (около ±6.9 п.п.), для 500 — около ±4.4 п.п., для 2,000 — около ±2.2 п.п. Зная эти значения, при чтении результатов опроса с известным числом респондентов можно прикинуть, укладывается ли разница между двумя вариантами ответа в пределы погрешности.
Поправка на конечную генеральную совокупность
Формула выше предполагает очень большую генеральную совокупность. Если генеральная совокупность N мала и выборка составляет заметную её часть, требуемая выборка уменьшается. Это называется поправкой на конечную совокупность (FPC).
n = n₀ / (1 + (n₀ − 1) / N)
Здесь n₀ — значение, полученное по предыдущей формуле (до округления). В некоторых учебниках знаменатель записывают как 1 + n₀/N; при N от нескольких сотен результаты почти не различаются.
Для опроса в компании из 2,000 сотрудников при 95% и ±5 п.п. получаем следующее.
n₀ ≈ 384.15n = 384.15 / (1 + 383.15 / 2000) = 384.15 / 1.1916 ≈ 322.39- Округляем вверх: 323 человека
Эффект поправки виден по тому, как меняется результат в зависимости от размера генеральной совокупности (95%, ±5 п.п.).
| Генеральная совокупность N | Необходимая выборка |
|---|---|
| 500 | 218 |
| 2,000 | 323 |
| 10,000 | 370 |
| 100,000 | 383 |
| Очень большая | 385 |
Когда генеральная совокупность превышает несколько десятков тысяч, необходимая выборка почти не зависит от её размера. Именно поэтому для опроса с одинаковой точностью в стране с населением 50 миллионов и в городе с населением 500 тысяч нужны примерно одинаковые выборки. Общепринятый критерий — применять поправку, когда доля выборки (n/N) превышает 5%.
Учёт доли ответивших
Формула даёт итоговое число ответов. Число людей, которым нужно разослать анкету или с которыми нужно связаться, находят делением на ожидаемую долю ответивших.
число рассылок = нужное число ответов / ожидаемая доля ответивших
Если нужно 385 ответов, а ожидаемая доля ответивших — 30%, то 385 / 0.30 ≈ 1,283.3 → нужно разослать 1,284 человекам. Для примера с компанией (323 человека) при доле ответов 30% получится 1,077 человек, то есть рассылать придётся более чем половине всех сотрудников.
Однако чем ниже доля ответивших, тем выше вероятность, что не ответившие отличаются от ответивших (смещение из-за неответов). Увеличение выборки уменьшает только случайную ошибку, но не это смещение.
Если планируется анализ подгрупп
Если вы собираетесь публиковать не только общие результаты, но и результаты по возрастным группам или регионам, нужную выборку необходимо обеспечить отдельно внутри каждой подгруппы. Если разделить 385 человек на 5 возрастных групп, в каждой окажется около 77 человек, и погрешность внутри группы при 95% вырастет примерно до ±11 п.п. Если для каждой подгруппы нужна погрешность ±5 п.п., в каждой группе потребуется около 385 человек.
Предпосылки формулы
- Предполагается простой случайный отбор. При стратифицированном или кластерном отборе нужно умножить на эффект плана (design effect).
- Формула предназначена для оценки доли. Для оценки среднего или для критериев сравнения двух групп используются другие формулы (со стандартным отклонением, размером эффекта и мощностью).
- К удобной (неслучайной) выборке, например по открытой онлайн-ссылке, само понятие предельной погрешности строго не применимо.
Если ввести в калькулятор объёма выборки на этом сайте доверительную вероятность, погрешность, размер генеральной совокупности и долю ответивших, он вычислит и нужное число ответов, и число рассылок.
Главное
- Необходимая выборка равна
n = z² × p(1−p) / E², результат всегда округляется вверх. - Если p неизвестно, берут 0.5, при котором
p(1−p)максимально, и считают консервативно. - При 95% для ±5 п.п. нужно 385 человек, для ±3 п.п. — 1,068, для ±1 п.п. — 9,604.
- Для малой генеральной совокупности применяют поправку
n₀ / (1 + (n₀−1)/N). При N=2,000 получается 323 человека. - Число рассылок находят делением нужного числа ответов на долю ответивших; помните, что смещение из-за неответов не уменьшается с ростом выборки.