أول سؤال في تصميم الاستطلاعات عادةً هو «كم شخصًا أحتاج؟». فإذا كان العدد قليلًا جدًا كانت النتائج كثيرة التذبذب فلا تصلح للاستخدام، وإذا كان كبيرًا جدًا أهدرت المال والوقت. وفي الاستطلاع الذي يقدّر نسبة، يُستخرج حجم العينة من صيغة بسيطة بمجرد اختيار هامش الخطأ ومستوى الثقة.
الصيغة الأساسية
لتقدير نسبة المجتمع p ضمن هامش خطأ E، يكون حجم العينة المطلوب:
n = z² × p(1−p) / E²
والرموز هي:
z: القيمة الحرجة من التوزيع الطبيعي المعياري لمستوى الثقة (نحو 1.645 لـ 90%، و1.960 لـ 95%، و2.576 لـ 99%)p: النسبة المتوقعةE: هامش الخطأ الذي تقبله، في صورة عدد عشري (0.03 لـ ±3 نقاط مئوية)
تأتي الصيغة من فترة الثقة للنسبة p̂ ± z × √(p̂(1−p̂)/n): اجعل جزء الهامش مساويًا لـ E ثم حُلّ المعادلة بالنسبة إلى n. قرّب النتيجة دائمًا إلى الأعلى، فالتقريب إلى الأدنى يعني أن هامش الخطأ المطلوب لن يتحقق.
لماذا نستخدم p = 0.5؟
قبل الاستطلاع لا تعرف النسبة الحقيقية، ومع ذلك تحتاج الصيغة إلى p. والاختيار المعتاد هو p = 0.5، لأن p(1−p) يبلغ قيمته العظمى 0.25 عند p = 0.5.
| p | p(1−p) |
|---|---|
| 0.1 أو 0.9 | 0.09 |
| 0.2 أو 0.8 | 0.16 |
| 0.3 أو 0.7 | 0.21 |
| 0.5 | 0.25 |
لذلك يكون حجم العينة المحسوب بـ p = 0.5 هو القيمة الأكثر تحفظًا: فهو يحقق هامش الخطأ أيًّا كانت النسبة الحقيقية. كما يصلح لجميع الأسئلة حين يطرح الاستطلاع الواحد أسئلة كثيرة. وإذا كان لديك من استطلاع سابق دليل موثوق على أن النسبة نحو 20%، يمكنك استخدام p = 0.2 وتحتاج إلى عدد أقل. فعند 95% و±5 نقاط، تتطلب p = 0.5 عدد 385 مستجيبًا، بينما لا تتطلب p = 0.2 إلا 246.
مثال: ثقة 95% و±5 نقاط
z = 1.96،p = 0.5،E = 0.05n = 1.96² × 0.25 / 0.05² = 3.8415 × 0.25 / 0.0025 ≈ 384.15- بالتقريب إلى الأعلى: 385 مستجيبًا
والعبارة المألوفة في استطلاعات الرأي الانتخابية، «±3.1 نقطة عند مستوى ثقة 95%»، تقابل عينة من نحو 1,000 شخص.
حجم العينة المطلوب حسب مستوى الثقة وهامش الخطأ
قيم لمجتمع كبير جدًا مع p = 0.5 (جميعها مقرّبة إلى الأعلى):
| مستوى الثقة | ±1 نقطة | ±3 نقاط | ±5 نقاط |
|---|---|---|---|
| 90% | 6,764 | 752 | 271 |
| 95% | 9,604 | 1,068 | 385 |
| 99% | 16,588 | 1,844 | 664 |
يبرز نمطان.
- تنصيف هامش الخطأ يتطلب نحو أربعة أضعاف العينة، لأن n تتناسب عكسيًا مع E². فالانتقال من ±5 إلى ±1 نقطة، أي دقة أعلى بخمس مرات، يتطلب 25 ضعف العينة.
- رفع الثقة من 95% إلى 99% يتطلب نحو 1.73 ضعف العينة، لأن
(2.576/1.960)² ≈ 1.73.
العمل بالعكس: هامش الخطأ من حجم العينة
إذا كان حجم العينة محددًا سلفًا، اعكس الصيغة لتحصل على هامش الخطأ.
E = z × √(p(1−p) / n)
عند 95% مع p = 0.5، يعطي 200 مستجيب 1.96 × √(0.25/200) ≈ 0.0693 (نحو ±6.9 نقاط)، ويعطي 500 نحو ±4.4 نقاط، ويعطي 2,000 نحو ±2.2 نقطة. ومعرفة هذه القيم تساعدك على الحكم على ما إذا كان الفرق بين إجابتين في استطلاع منشور يقع ضمن هامش الخطأ.
تصحيح المجتمع المحدود
تفترض الصيغة أعلاه مجتمعًا كبيرًا جدًا. أما حين يكون المجتمع N صغيرًا وتمثل العينة حصة معتبرة منه، فتحتاج إلى عدد أقل من المستجيبين. وهذا هو تصحيح المجتمع المحدود (FPC).
n = n₀ / (1 + (n₀ − 1) / N)
حيث n₀ هي القيمة الناتجة من الصيغة الأساسية (قبل التقريب). تستخدم بعض الكتب المدرسية 1 + n₀/N في المقام، ومع N تبلغ بضع مئات أو أكثر يكون الفرق ضئيلًا.
لشركة فيها 2,000 موظف عند 95% و±5 نقاط:
n₀ ≈ 384.15n = 384.15 / (1 + 383.15 / 2000) = 384.15 / 1.1916 ≈ 322.39- بالتقريب إلى الأعلى: 323 مستجيبًا
أثر التصحيح بحسب حجم المجتمع (95%، ±5 نقاط):
| حجم المجتمع N | العينة المطلوبة |
|---|---|
| 500 | 218 |
| 2,000 | 323 |
| 10,000 | 370 |
| 100,000 | 383 |
| كبير جدًا | 385 |
بمجرد أن يتجاوز المجتمع عشرات الآلاف، يكاد حجم العينة المطلوب لا يتوقف على حجمه. ولهذا يحتاج استطلاع وطني في بلد عدد سكانه 50 مليونًا واستطلاع في مدينة عدد سكانها 500,000 إلى عينتين متقاربتين للدقة نفسها. والقاعدة الشائعة هي تطبيق التصحيح حين يتجاوز كسر المعاينة n/N نسبة 5%.
مراعاة معدلات الاستجابة
تعطي الصيغة عدد الاستجابات المكتملة. أما عدد الأشخاص الذين يجب دعوتهم فهو هذا العدد مقسومًا على معدل الاستجابة المتوقع.
عدد الدعوات = الاستجابات المطلوبة / معدل الاستجابة المتوقع
مع 385 استجابة مطلوبة ومعدل استجابة متوقع 30%، 385 / 0.30 ≈ 1,283.3 → ادعُ 1,284 شخصًا. وفي مثال الشركة (323 استجابة)، يعني معدل استجابة 30% توجيه 1,077 دعوة، أي أكثر من نصف جميع الموظفين.
لكن كلما انخفض معدل الاستجابة، زاد احتمال اختلاف غير المستجيبين عن المستجيبين (تحيز عدم الاستجابة). والعينة الأكبر لا تقلل إلا الخطأ العشوائي، ولا تفعل شيئًا حيال هذا التحيز.
إذا كنت تخطط لتحليل المجموعات الفرعية
إذا كنت تنوي عرض النتائج حسب الفئة العمرية أو المنطقة إضافة إلى النتيجة الإجمالية، فكل مجموعة فرعية تحتاج إلى عينة كافية خاصة بها. فتقسيم 385 مستجيبًا على 5 فئات عمرية يترك نحو 77 في كل فئة، ويتسع هامش الخطأ داخل الفئة إلى نحو ±11 نقطة عند 95%. وللحصول على ±5 نقاط في كل مجموعة فرعية، تحتاج كل منها إلى ما يقارب 385.
الافتراضات التي تقوم عليها الصيغة
- تفترض المعاينة العشوائية البسيطة. أما المعاينة الطبقية أو العنقودية فتحتاج إلى تعديل بأثر التصميم.
- وهي مخصصة لـ تقدير نسبة. فتقدير وسط أو مقارنة مجموعتين يستخدم صيغًا أخرى تتضمن الانحراف المعياري وحجم الأثر وقوة الاختبار.
- وفي عينات الملاءمة (مثل رابط إلكتروني مفتوح للجميع)، لا ينطبق هامش الخطأ بالمعنى الدقيق أصلًا.
أدخل مستوى الثقة وهامش الخطأ وحجم المجتمع ومعدل الاستجابة في حاسبة حجم العينة في هذا الموقع لتحصل على عدد الاستجابات المطلوبة وعدد الدعوات معًا.
خلاصة
- العينة المطلوبة هي
n = z² × p(1−p) / E²، مقرّبة دائمًا إلى الأعلى. - إذا كانت p مجهولة، فاستخدم 0.5، التي تجعل
p(1−p)في أقصى قيمة، للحصول على إجابة متحفظة. - عند 95%، يتطلب ±5 نقاط عدد 385، و±3 نقاط عدد 1,068، و±1 نقطة عدد 9,604.
- للمجتمعات الصغيرة، صحّح بالصيغة
n₀ / (1 + (n₀−1)/N)، فمع N = 2,000 تكون النتيجة 323. - اقسم الاستجابات المطلوبة على معدل الاستجابة لتحصل على عدد الدعوات، وتذكّر أن العينة الأكبر لا تعالج تحيز عدم الاستجابة.