تظهر القيمة الاحتمالية p في تقارير الأبحاث ونتائج اختبارات A/B والأوراق العلمية في كل مكان، وهي أيضًا أكثر الإحصاءات عرضة لسوء الفهم. حتى إن الجمعية الأمريكية للإحصاء (ASA) أصدرت عام 2016 بيانًا رسميًا بشأن استخدامها الصحيح. يبدأ هذا الدليل من التعريف الدقيق، ثم يستعرض المفاهيم الخاطئة الشائعة وممارسات الإبلاغ الجيدة من خلال مثال.
تعريف القيمة الاحتمالية p
تُعرَّف القيمة الاحتمالية p كما يلي:
احتمال الحصول، بافتراض أن الفرضية الصفرية صحيحة، على نتيجة متطرفة بقدر النتيجة المشاهدة على الأقل
المفتاح هو الشرط الوارد في البداية. تُحسب القيمة p بافتراض «أن الفرضية الصفرية صحيحة»، فلا يمكنها أن تخبرك باحتمال صحة هذا الافتراض نفسه. والقيمة p الصغيرة تعني «لو كانت الفرضية الصفرية صحيحة لكانت بيانات كهذه نادرة»، أي أن البيانات لا تتوافق جيدًا مع الفرضية الصفرية.
مثال: مقارنة وسطَي مجموعتين
استخدمت المجموعة A طريقة دراسة جديدة، والمجموعة B الطريقة المعتادة. درجاتهما (8 أشخاص في كل منهما) هي:
- A:
72, 75, 78, 80, 74, 77, 79, 81 - B:
70, 71, 74, 73, 69, 72, 75, 68
الفرضية الصفرية هي «وسطا المجتمعين متساويان»، والفرضية البديلة هي «يختلفان». نستخدم اختبار t لويلش، الذي لا يفترض تساوي التباينات.
- الوسطان:
x̄_A = 77.0،x̄_B = 71.5، والفرق5.5 - الانحرافان المعياريان للعينتين:
s_A ≈ 3.1168،s_B ≈ 2.4495 - الخطأ المعياري:
SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015 - إحصاءة الاختبار:
t = 5.5 / 1.4015 ≈ 3.924 - درجات الحرية لويلش: نحو
13.26 - القيمة p ثنائية الطرف: نحو
0.0017
التفسير: «لو كان للطريقتين فعلًا وسطا مجتمع متساويان، لحدث فرق بين وسطي العينتين قدره 5.5 درجة أو أكثر (في أي اتجاه) في نحو 0.17% من الحالات». وهذا أقل بكثير من 0.05، فنرفض الفرضية الصفرية.
مستوى الدلالة α
مستوى الدلالة α عتبة تُحدَّد قبل النظر في البيانات. إذا كانت p ≤ α تُرفض الفرضية الصفرية. وα هو أقصى معدل تقبل به لرفض فرضية صفرية صحيحة (خطأ من النوع الأول). والقيمة 0.05 اصطلاحية، لكن تُستخدم أيضًا 0.01 أو 0.10 بحسب المجال والموقف.
α والقيمة p شيئان مختلفان. فα هو معدل الخطأ طويل الأمد لإجراء الاختبار، بينما تقيس القيمة p مدى ابتعاد هذه المجموعة بعينها من البيانات عن الفرضية الصفرية.
خمسة مفاهيم خاطئة شائعة
1. «القيمة p هي احتمال صحة الفرضية الصفرية»
ليست كذلك. فالقيمة p = 0.0017 لا تعني «أن هناك احتمالًا قدره 0.17% لصحة الفرضية الصفرية». القيمة p هي احتمال البيانات بشرط الفرضية الصفرية، بينما احتمال الفرضية الصفرية هو احتمال الفرضية بشرط البيانات. هذان الاحتمالان الشرطيان يسيران في اتجاهين متعاكسين، والثاني يتطلب استدلالًا بايزيًا باحتمالات قبلية.
2. «1 − p هو احتمال صحة الفرضية البديلة» أو «فرصة تكرار النتيجة»
هذا مجرد قلب للمفهوم الخاطئ الأول، فهو خاطئ أيضًا. القيمة p = 0.03 لا تعني احتمالًا قدره 97% بأن الأثر حقيقي، ولا احتمالًا قدره 97% للحصول على نتيجة دالة إذا أُعيدت التجربة.
3. «p > 0.05 يعني أنه لا يوجد أثر»
النتيجة غير الدالة ليست «دليلًا على انعدام الأثر»، بل تعني «عدم كفاية الأدلة لادعاء وجود أثر». ومع عينة صغيرة، قد تكون p كبيرة بسهولة حتى مع وجود أثر حقيقي. فمثلًا، الحصول على 60 صورة في 100 رمية لعملة يعطي قيمة p ثنائية الطرف دقيقة (ذات الحدين) قدرها نحو 0.0569 مقابل عملة متوازنة. وهذا أعلى قليلًا من 0.05، لكنه بالتأكيد لا يثبت أن العملة متوازنة.
4. «كلما صغرت القيمة p كان الأثر أكبر»
القيمة p نتاج مشترك لحجم الأثر وحجم العينة. فمع عينة كبيرة بما يكفي، يصبح حتى الفرق الضئيل دالًا. فالفرق بين مجموعتين بمقدار 0.02 انحراف معياري، وهو فرق عديم الأهمية عمليًا، يعطي z ≈ 4.47 وp ≈ 0.0000077 مع 100,000 شخص في كل مجموعة. ولهذا ينبغي الإبلاغ عن حجم الأثر مع كل قيمة p. وفي مثال طريقة الدراسة، يبلغ حجم الأثر (d لكوهين، باستخدام متوسط تبايني العينتين) نحو 1.96، وهو أثر «كبير» وفق الاصطلاح.
5. «p = 0.049 وp = 0.051 تؤديان إلى استنتاجين متعاكسين»
القيمة 0.05 اصطلاح للتيسير لا قانون طبيعي، والقيمتان تحملان قوة دليل متقاربة جدًا. كذلك فإن إجراء اختبارات كثيرة والإبلاغ عن الدالة منها فقط (المقارنات المتعددة)، أو جمع البيانات حتى تصبح النتيجة دالة (p-hacking)، يرفع المعدل الحقيقي للخطأ من النوع الأول إلى ما يتجاوز α بكثير.
قوة الاختبار وحجم العينة
عند قراءة نتيجة غير دالة، فكّر أيضًا في قوة الاختبار، أي احتمال اكتشاف أثر حقيقي بوصفه دالًا. لنفترض أن الفرق الحقيقي حجم أثر قدره d = 0.5 (متوسط) وأنك تجري اختبارًا ثنائي الطرف عند α = 0.05. مع 20 شخصًا في كل مجموعة لا تتجاوز قوة الاختبار نحو 34%، ومع 64 في كل مجموعة تبلغ نحو 80%. فإذا لم تجد دراسة بـ 20 شخصًا في كل مجموعة نتيجة دالة، فالأرجح أنها افتقرت إلى القوة الكافية لاكتشاف أثر، لا أنها أثبتت انعدامه.
النقاط الرئيسية في بيان ASA
يمكن تلخيص مبادئ بيان ASA لعام 2016 كما يلي:
- يمكن للقيم p أن تشير إلى مدى عدم توافق البيانات مع نموذج إحصائي محدد.
- لا تقيس القيم p احتمال صحة فرضية ما، ولا احتمال أن تكون البيانات ناتجة عن الصدفة وحدها.
- لا ينبغي أن تُبنى الاستنتاجات العلمية والقرارات على مجرد تجاوز القيمة p لعتبة معينة.
- يتطلب الاستدلال السليم إبلاغًا كاملًا وشفافًا.
- لا تقيس القيمة p حجم الأثر ولا أهمية النتيجة.
- لا توفر القيمة p وحدها مقياسًا جيدًا للدليل بشأن نموذج أو فرضية.
الاختبار ثنائي الطرف وأحادي الطرف
- الاختبار ثنائي الطرف: يختبر «وجود فرق (في أي اتجاه)»، وتُحتسب القيم المتطرفة في الطرفين كليهما.
- الاختبار أحادي الطرف: يختبر اتجاهًا محددًا، مثل «A أكبر من B»، ولا يُحتسب إلا طرف واحد.
في توزيع متماثل مثل t، وعندما يطابق الاتجاه المشاهد الفرضية البديلة، تكون القيمة p أحادية الطرف نصف القيمة ثنائية الطرف. ففي المثال، تبلغ القيمة p أحادية الطرف للفرضية «A أعلى» نحو 0.00084. لا تستخدم الاختبار أحادي الطرف إلا إذا حُدد الاتجاه على أسس نظرية قبل رؤية البيانات. أما التحول إلى أحادي الطرف بعد الواقعة لتنصيف القيمة p فهو سوء استخدام.
كيف تُبلغ عن النتائج جيدًا
- اذكر القيمة p الدقيقة (
p = 0.0017بدلًا منp < 0.05). - أبلغ عن حجم الأثر وفترة الثقة.
- اذكر الاختبار المستخدم، وهل كان أحادي الطرف أم ثنائيه، وأحجام العينات، وعدد الاختبارات التي أُجريت.
تعرض حاسبة اختبار t في هذا الموقع قيمة t ودرجات الحرية والقيمتين p أحادية الطرف وثنائية الطرف وحجم الأثر معًا.
خلاصة
- القيمة p هي احتمال نتيجة متطرفة بقدر النتيجة المشاهدة على الأقل، بافتراض صحة الفرضية الصفرية.
- ليست احتمال صحة الفرضية الصفرية، ولا احتمال أن يكون الأثر حقيقيًا، ولا احتمال تكرار النتيجة.
- النتيجة غير الدالة ليست دليلًا على انعدام الأثر، والقيمة p الصغيرة لا تعني أثرًا كبيرًا.
- يعطي مثال المجموعتين (t لويلش) t ≈ 3.924، ونحو 13.26 درجة حرية، وp ثنائية الطرف ≈ 0.0017، وp أحادية الطرف ≈ 0.00084.
- أبلغ عن القيم p الدقيقة مع أحجام الأثر وفترات الثقة، وحدد اتجاه الاختبار أحادي الطرف مسبقًا.