الانحراف المعياري هو أكثر المقاييس استخدامًا للتعبير عن مدى تشتت البيانات حول وسطها الحسابي. ومع ذلك، كثيرًا ما تعرض الآلة الحاسبة أو جداول البيانات قيمتين مختلفتين له. إحداهما تقسم مجموع مربعات الانحرافات على n، والأخرى على n−1. يشرح هذا الدليل معنى كل صيغة، ولماذا تستخدم العينات n−1، وكيف تختار بينهما عمليًا.
الصيغتان
عندما تكون لديك بيانات المجتمع الإحصائي كاملة، يكون الانحراف المعياري للمجتمع:
- الانحراف المعياري للمجتمع:
σ = √(Σ(x−μ)² / N)
وعندما تستخدم عينة لتقدير تشتت مجتمع أكبر، تستخدم:
- الانحراف المعياري للعينة:
s = √(Σ(x−x̄)² / (n−1))
هناك فرقان. الأول أن المركز هو الوسط الحسابي للعينة x̄ بدلًا من وسط المجتمع μ. والثاني أن المقسوم عليه هو n−1 بدلًا من n. ويُسمّى التغيير الثاني تصحيح بيسل.
لماذا نقسم على n−1؟
يُحسب وسط العينة x̄ من العينة نفسها، لذا يقع أقرب ما يمكن إلى نقاط تلك البيانات. والواقع أن مجموع المربعات Σ(x−c)² يبلغ أصغر قيمة له عندما تكون c هي وسط العينة. لذلك فإن قياس الانحرافات عن x̄ بدلًا من μ الحقيقي يجعل مجموع المربعات أصغر من اللازم بصورة منهجية.
رياضيًا، القيمة المتوقعة للتباين المقسوم على n هي (n−1)/n × σ². فمع عينة من 5 قيم مثلًا، لا يتجاوز متوسط التباين المقسوم على n نسبة 4/5 = 80% من التباين الحقيقي. والضرب في n/(n−1) يزيل هذا التقدير الناقص، وهو ما يعادل القسمة على n−1. والنتيجة s² هي مقدِّر غير متحيز لـ σ².
ويمكن فهم ذلك أيضًا من خلال درجات الحرية. فمجموع الانحرافات الـ n أي (x−x̄) يساوي صفرًا دائمًا. فإذا عُرفت n−1 منها، تحدد الأخير تلقائيًا. أي أن n−1 فقط من المعلومات حرة التغير، ولذلك نقسم على n−1.
ملاحظة:
s²مقدِّر غير متحيز لـσ²، لكن جذره التربيعيsليس مقدِّرًا غير متحيز لـσ. ولأن دالة الجذر التربيعي مقعرة، تكونsفي المتوسط أصغر قليلًا منσ. غير أن هذا الفرق يصبح ضئيلًا مع كبر العينة، لذا تُستخدمsكما هي في التطبيق العملي.
مثال محلول يدويًا
لنأخذ هذه القيم الثماني:
2, 4, 4, 4, 5, 5, 7, 9
الخطوة 1: الوسط الحسابي
x̄ = (2+4+4+4+5+5+7+9) / 8 = 40 / 8 = 5
الخطوة 2: الانحرافات ومربعاتها
| القيمة x | الانحراف x−x̄ | المربع |
|---|---|---|
| 2 | −3 | 9 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 5 | 0 | 0 |
| 5 | 0 | 0 |
| 7 | 2 | 4 |
| 9 | 4 | 16 |
مجموع الانحرافات −3−1−1−1+0+0+2+4 = 0، وهذا يؤكد القيد المذكور أعلاه. ومجموع المربعات 9+1+1+1+0+0+4+16 = 32.
الخطوة 3: التباينان والانحرافان المعياريان
| الأساس | التباين | الانحراف المعياري |
|---|---|---|
| المجتمع (÷n) | 32 / 8 = 4 | √4 = 2 |
| العينة (÷(n−1)) | 32 / 7 ≈ 4.5714 | √4.5714 ≈ 2.1381 |
إذا كانت هذه القيم الثماني هي كل ما يهمك، فالانحراف المعياري 2. أما إذا سُحبت من مجموعة أكبر وتريد تقدير تشتتها، فاذكر القيمة 2.1381 تقريبًا. ومع n صغيرة مثل 8 يبلغ الفرق نحو 7%. وعند n = 100 يتقلص إلى نحو 0.5%، وعند n = 1,000 إلى نحو 0.05%.
أيهما تستخدم؟
السؤال ببساطة: هل بياناتك هي المجموعة المستهدفة كلها أم جزء منها؟
- المجتمع (÷n): عند وصف تشتت درجات الاختبار لفصل واحد من 30 طالبًا بخصوص ذلك الفصل وحده، أو توزيع رواتب جميع موظفي شركة واحدة.
- العينة (÷(n−1)): عند تقدير الرأي العام على مستوى البلد من 500 مشارك في استطلاع، أو تقدير تقلب عملية إنتاج كاملة من 20 قطعة مسحوبة.
معظم البيانات في الواقع عينات. وتفترض فترات الثقة واختبارات t وحسابات حجم العينة جميعها استخدام الانحراف المعياري للعينة s. وعند الشك، تكون صيغة العينة هي الخيار المتحفظ.
المقابلات في جداول البيانات ولغات البرمجة
| الأداة | العينة (÷(n−1)) | المجتمع (÷n) |
|---|---|---|
| Excel وGoogle Sheets | STDEV.S، VAR.S (القديمة STDEV) | STDEV.P، VAR.P (القديمة STDEVP) |
| R | sd()، var() | تعديل يدوي |
| Python pandas | Series.std() الافتراضي ddof=1 | std(ddof=0) |
| Python NumPy | np.std(x, ddof=1) | np.std(x) الافتراضي ddof=0 |
القيم الافتراضية في NumPy وpandas متعاكسة، وهذا سبب شائع لاختلاف النتائج على البيانات نفسها. تحقق من الصيغة المستخدمة قبل مقارنة الأرقام.
قراءة الانحراف المعياري
للانحراف المعياري وحدة البيانات نفسها: درجات لنتائج الاختبارات، وسنتيمترات للأطوال. أما التباين فوحدته مربعة ويصعب تفسيره، لذا تُذكر التقارير عادةً الانحراف المعياري. وإذا كانت البيانات قريبة من التوزيع الطبيعي، يقع نحو 68% من القيم ضمن انحراف معياري واحد من الوسط، ونحو 95% ضمن انحرافين. ولمقارنة تشتت مجموعات أوساطها متباينة جدًا، يُعرض غالبًا معامل الاختلاف (CV) أيضًا، وهو الانحراف المعياري مقسومًا على الوسط.
أخطاء شائعة
- عدم ذكر الصيغة المستخدمة: مع العينات الصغيرة تختلف القيمتان بوضوح، فاكتب
sأوσ، أو قل «الانحراف المعياري للعينة». - الخلط بين الانحراف المعياري والخطأ المعياري: الخطأ المعياري
SE = s / √nيصف تشتت وسط العينة لا تشتت القيم المفردة. وتستخدم فترات الثقة الخطأ المعياري. - حساب الانحراف المعياري للعينة مع n = 1: تصبح n−1 صفرًا فيكون غير معرَّف. وينبغي للآلة الحاسبة أن تُرجع خطأ.
- تجاهل القيم الشاذة: لأن الانحرافات تُربَّع، يمكن لقيمة متطرفة واحدة أن تغيّر الانحراف المعياري كثيرًا. وإذا اشتبهت في وجود قيم شاذة، فانظر إلى المدى الربيعي (IQR) أيضًا.
الصق بياناتك في حاسبة الإحصاء الوصفي في هذا الموقع لترى الانحراف المعياري للعينة وللمجتمع جنبًا إلى جنب.
خلاصة
- اقسم على n عندما تكون البيانات هي المجموعة كلها، وعلى n−1 عندما تكون جزءًا من مجموعة أكبر.
- للتباين المقسوم على n قيمة متوقعة
(n−1)/n × σ²، والقسمة على n−1 تصحح ذلك (تصحيح بيسل). - بالنسبة إلى
2, 4, 4, 4, 5, 5, 7, 9، الانحراف المعياري 2 كمجتمع ونحو 2.1381 كعينة. - يفصل Excel بين
STDEV.S(العينة) وSTDEV.P(المجتمع)، وتختلف القيم الافتراضية في NumPy وpandas. - لا تخلط بين الانحراف المعياري (تشتت البيانات) والخطأ المعياري (تشتت الوسط).