p-значение встречается повсюду — в исследовательских отчётах, результатах A/B-тестов, научных статьях, — но это и одна из самых часто неверно понимаемых статистик. Американская статистическая ассоциация (ASA) в 2016 году даже выпустила отдельное официальное заявление о правильном использовании p-значений. В этой статье мы начнём с точного определения p-значения, а затем на примерах разберём частые заблуждения и правильный способ представления результатов.
Определение p-значения
p-значение определяется так.
Вероятность получить результат, столь же экстремальный, как наблюдаемый, или ещё более экстремальный, при условии, что нулевая гипотеза верна
Ключевое здесь — условие в начале. p-значение вычисляется в предположении «если нулевая гипотеза верна», поэтому оно ничего не говорит о вероятности того, что само это предположение верно. Малое p-значение означает: «если бы нулевая гипотеза была верна, такие данные встречались бы редко», то есть данные плохо согласуются с нулевой гипотезой.
Пример: сравнение средних двух групп
Пусть баллы группы A, занимавшейся по новой методике, и группы B, занимавшейся по старой, таковы (по 8 человек).
- A:
72, 75, 78, 80, 74, 77, 79, 81 - B:
70, 71, 74, 73, 69, 72, 75, 68
Нулевая гипотеза: «средние генеральных совокупностей двух групп равны», альтернативная — «различаются». Используем t-критерий Уэлча, не предполагающий равенства дисперсий.
- Средние:
x̄_A = 77.0,x̄_B = 71.5, разность5.5 - Выборочные стандартные отклонения:
s_A ≈ 3.1168,s_B ≈ 2.4495 - Стандартная ошибка:
SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015 - Статистика критерия:
t = 5.5 / 1.4015 ≈ 3.924 - Степени свободы по Уэлчу: около
13.26 - Двустороннее p-значение: около
0.0017
Интерпретация такова: «Если средние генеральных совокупностей для двух методик действительно равны, вероятность того, что разность выборочных средних составит 5.5 балла и более (в любую сторону), — около 0.17%». Это намного меньше уровня значимости 0.05, поэтому нулевая гипотеза отвергается.
Уровень значимости α
Уровень значимости α — критерий, который задают до того, как смотреть на данные. Если p ≤ α, нулевая гипотеза отвергается. α — это максимальная допустимая доля ошибок, когда нулевая гипотеза верна, но её отвергают (ошибка первого рода); по традиции чаще всего берут 0.05, но в зависимости от области и ситуации используют и 0.01 или 0.10.
α и p-значение — разные понятия. α — долгосрочная частота ошибок процедуры проверки, а p-значение показывает, насколько данные именно этого исследования расходятся с нулевой гипотезой.
5 частых заблуждений
1. «p-значение — это вероятность того, что нулевая гипотеза верна»
Нет. p = 0.0017 не означает, что «вероятность истинности нулевой гипотезы — 0.17%». p-значение — вероятность данных при условии, что нулевая гипотеза верна, а вероятность истинности нулевой гипотезы — это вероятность гипотезы при заданных данных. Эти две условные вероятности направлены в противоположные стороны, и чтобы найти вторую, нужен байесовский вывод с априорной вероятностью.
2. «1 − p — это вероятность того, что верна альтернативная гипотеза» или «вероятность воспроизведения»
Это перевёрнутое первое заблуждение, и оно тоже неверно. p = 0.03 не означает, что эффект существует с вероятностью 97% или что при повторении того же эксперимента результат с вероятностью 97% снова окажется значимым.
3. «Если p > 0.05, эффекта нет»
Незначимый результат — это не «доказательство отсутствия эффекта», а «недостаточно данных, чтобы утверждать, что эффект есть». При малой выборке p-значение легко оказывается большим, даже если эффект реально существует. Например, если при 100 бросках монеты орёл выпал 60 раз, двустороннее p-значение точного биномиального критерия для нулевой гипотезы о честной монете — около 0.0569. Это чуть больше 0.05, но на этом основании нельзя заключить, что монета честная.
4. «Чем меньше p-значение, тем больше эффект»
p-значение определяется совместно размером эффекта и объёмом выборки. При достаточно большой выборке значимой становится даже очень малая разница. Даже если разность средних двух групп составляет 0.02 стандартного отклонения (практически бессмысленная разница), при 100,000 человек в каждой группе получится z ≈ 4.47, p ≈ 0.0000077. Поэтому вместе с p-значением нужно приводить размер эффекта. В примере с методиками обучения размер эффекта (d Коэна, рассчитанный через среднее двух выборочных дисперсий) — около 1.96, что по традиции считается «большим эффектом».
5. «p = 0.049 и p = 0.051 ведут к противоположным выводам»
0.05 — не закон природы, а условный порог для удобства. Сила свидетельства у этих двух значений практически одинакова. Кроме того, если провести множество проверок и сообщить только о значимых (множественные сравнения) или собирать данные, пока результат не станет значимым (p-хакинг), реальная частота ошибок первого рода намного превысит α.
Мощность критерия и объём выборки
Интерпретируя незначимый результат, нужно учитывать мощность критерия (вероятность обнаружить эффект как значимый, если он действительно есть). Например, если истинная разница двух групп соответствует размеру эффекта d = 0.5 (средний) и применяется двусторонний критерий при α = 0.05, то при 20 человеках в группе мощность составит лишь около 34%. При 64 человеках в группе — около 80%. Если исследование с 20 участниками в группе дало незначимый результат, скорее всего, дело не в отсутствии эффекта, а в том, что изначально не хватало мощности его обнаружить.
Ключевые положения заявления ASA
Принципы, изложенные в заявлении ASA 2016 года, сводятся к следующему.
- p-значение может показывать, насколько данные несовместимы с определённой статистической моделью.
- p-значение не измеряет вероятность того, что гипотеза верна, или вероятность того, что данные возникли случайно.
- Научные выводы и решения не должны основываться только на том, превысило ли p-значение определённый порог.
- Корректный вывод требует прозрачного отчёта обо всех этапах анализа.
- p-значение не измеряет величину эффекта или важность результата.
- Само по себе p-значение не является хорошей мерой свидетельства в пользу модели или гипотезы.
Двусторонний и односторонний критерий
- Двусторонний критерий: проверяет «есть различие (в любую сторону)». Учитываются экстремальные значения в обоих хвостах.
- Односторонний критерий: проверяет гипотезу с заданным направлением, например «A больше B». Учитывается только один хвост.
Для симметричных распределений, таких как t-распределение, если наблюдаемое направление совпадает с альтернативной гипотезой, одностороннее p-значение вдвое меньше двустороннего. В примере выше одностороннее p-значение для гипотезы «у A выше» — около 0.00084. Односторонний критерий используют только тогда, когда направление выбрано до просмотра данных на теоретических основаниях. Переходить на односторонний критерий после того, как увидели результат, чтобы уменьшить p-значение вдвое, — неправильное использование.
Как правильно сообщать результаты
- Указывайте точное p-значение (
p = 0.0017вместоp < 0.05). - Приводите вместе с ним размер эффекта и доверительный интервал.
- Указывайте использованный критерий, двусторонний он или односторонний, объём выборки и число проведённых проверок.
В калькуляторе t-критерия на этом сайте можно увидеть сразу значение t, степени свободы, двустороннее и одностороннее p-значения и размер эффекта.
Главное
- p-значение — вероятность получить результат, не менее экстремальный, чем наблюдаемый, при условии, что нулевая гипотеза верна.
- p-значение не является ни вероятностью истинности нулевой гипотезы, ни вероятностью наличия эффекта, ни вероятностью воспроизведения.
- Незначимый результат не доказывает отсутствие эффекта, а малое p-значение не означает большой эффект.
- В примере сравнения двух групп (t Уэлча) t ≈ 3.924, степеней свободы около 13.26, двустороннее p ≈ 0.0017, одностороннее p ≈ 0.00084.
- Сообщайте точное p-значение вместе с размером эффекта и доверительным интервалом, а направление одностороннего критерия задавайте заранее.