إطار لاتخاذ القرارات في ظل عدم اليقين
يتقدم العلم باختبار الأفكار في مواجهة الأدلة. لديك ادعاء — دواء فعّال، عملة معدنية عادلة، خوارزمية جديدة أسرع — وتجمع البيانات لتقييمه. لكن البيانات مشوشة. حتى العملة المعدنية العادلة تماماً قد تُنتج 7 صور في 10 رميات. كيف تميز بين الأثر الحقيقي والصدفة العشوائية؟
يوفر اختبار الفرضيات إطاراً منهجياً قابلاً للتكرار لاتخاذ هذا الحكم. بدلاً من السؤال «هل الأثر حقيقي؟» مباشرةً (وهو ما يستلزم معرفة الحالة الحقيقية للعالم)، يطرح سؤالاً أكثر قابلية للحل: كم سيكون مفاجئاً أن تجد بياناتي هذه لو لم يكن ثمة أثر؟ إذا كانت البيانات ستكون مفاجئة جداً في سيناريو «لا أثر»، فلدينا دليل ضده.
يغطي هذا الدرس البنية المفاهيمية لاختبار الفرضيات: الفرضية الصفرية والبديلة، إحصاء الاختبار، القيمة الاحتمالية، مستوى الدلالة، نوعَي الخطأ، القوة الإحصائية، والاختيار بين الاختبارات أحادية وثنائية الذيل.
الفرضية الصفرية والفرضية البديلة
يُبنى كل اختبار فرضيات على فرضيتين متنافستين. الفرضية الصفرية، التي يُرمز لها بـ H₀، تمثل الموقف الافتراضي المتشكك — عادةً أنه لا يوجد أثر أو فرق أو علاقة. الفرضية البديلة، التي يُرمز لها بـ H₁ (أو Ha)، هي ما تسعى إلى إيجاد دليل عليه.
تجربة الدواء: H₀: الدواء لا يؤثر على وقت الشفاء | H₁: الدواء يقلل وقت الشفاء
عدالة العملة: H₀: p = 0.5 (العملة عادلة) | H₁: p ≠ 0.5 (العملة متحيزة)
سرعة الخوارزمية: H₀: متوسط وقت التشغيل = 100 مللي ثانية | H₁: متوسط وقت التشغيل < 100 مللي ثانية
تفاوت جوهري: لا نُثبت H₀ أبداً. إما أن نرفض H₀ (الدليل ضده قوٍّ بما يكفي) أو نفشل في رفض H₀ (الدليل غير كافٍ). هذا مشابه لمحاكمة جنائية — الأحكام إما «مذنب» أو «غير مذنب»، وليس «بريء» أبداً. الفشل في رفض H₀ لا يعني أن H₀ صحيحة؛ يعني أن البيانات لم تقدم دليلاً كافياً لتفنيدها.
إحصاء الاختبار
إحصاء الاختبار هو رقم واحد يُحسب من البيانات ويلخص الدليل ضد H₀. يُصمَّم بحيث تشير القيم المتطرفة (البعيدة عما تتنبأ به H₀) إلى دليل قوي ضد H₀.
لاختبار متوسط مجتمع μ حين يكون الانحراف المعياري للمجتمع σ معروفاً، يكون إحصاء الاختبار الطبيعي هو درجة Z لمتوسط العينة:
تحت H₀، يتبع هذا الإحصاء توزيعاً طبيعياً معيارياً (بموجب مبرهنة النهاية المركزية). تشير القيم المطلقة الكبيرة لـ Z إلى أن متوسط العينة المشاهد بعيد جداً عما تتنبأ به H₀ — وهذا دليل ضد H₀.
تستلزم سيناريوهات الاختبار المختلفة إحصاءات مختلفة: إحصاء t حين يكون σ مجهولاً، وإحصاء كاي تربيع للبيانات الفئوية، وإحصاء F لمقارنة متوسطات مجموعات متعددة. المنطق الأساسي دائماً واحد: قياس مدى انحراف البيانات عن H₀.
القيمة الاحتمالية (p-value)
القيمة الاحتمالية هي الاحتمال، المحسوب بافتراض أن H₀ صحيحة، لمشاهدة إحصاء اختبار متطرف على الأقل بقدر الإحصاء المشاهد فعلياً. وهي تقيس مدى مفاجأة البيانات في ظل الفرضية الصفرية.
ما ليست عليه القيمة الاحتمالية: ليست احتمال أن H₀ صحيحة، وليست احتمال حدوث النتيجة بالصدفة. هذه سوء فهم شائع. القيمة الاحتمالية هي خاصية للبيانات في ظل H₀، وليست ادعاءً عن H₀ في ضوء البيانات.
خطأ: «p = 0.03 تعني أن احتمال صحة H₀ هو 3%.»
خطأ: «p = 0.03 تعني أن احتمال أن النتيجة حقيقية هو 97%.»
صحيح: «لو كانت H₀ صحيحة، سأرى بيانات بهذا القدر من التطرف أو أكثر في 3% فقط من الأوقات.»
مستوى الدلالة α
قبل رؤية البيانات، تختار مستوى الدلالة α — العتبة التي تعتبر دونها القيمة الاحتمالية صغيرة بما يكفي لرفض H₀. الاختيارات الأكثر شيوعاً هي α = 0.05 وα = 0.01 وα = 0.001.
قاعدة القرار بسيطة: إذا كانت p ≤ α، ارفض H₀ وأعلن النتيجة «ذات دلالة إحصائية.» وإذا كانت p > α، افشل في رفض H₀. يجب اختيار α قبل التجربة، وليس بعد رؤية البيانات.
لماذا α = 0.05؟ لا يوجد في 0.05 أي قدسية رياضية. أصبحت العتبة التقليدية إلى حد كبير من خلال السابقة التاريخية (استخدمها ر. أ. فيشر في عشرينيات القرن الماضي). في المجالات التي تكون فيها الاكتشافات الكاذبة مكلفة — فيزياء الجسيمات مثلاً — تُستخدم عتبات صغيرة مثل 5 × 10−7. العتبة الصحيحة تعتمد على تكلفة الإيجابي الكاذب مقارنةً بتكلفة السلبي الكاذب.
خطأ النوع الأول وخطأ النوع الثاني
أي إجراء قرار في وجود عدم اليقين سيكون خاطئاً أحياناً. يُحدث اختبار الفرضيات نوعين من الأخطاء:
خطأ النوع الأول (الإيجابي الكاذب) يحدث حين تكون H₀ صحيحة في الواقع لكننا نرفضها. احتمال خطأ النوع الأول هو α تحديداً — بحكم التصميم، نرفض H₀ في نسبة α من الوقت حين تكون صحيحة. هذا ثمن الحساسية.
خطأ النوع الثاني (السلبي الكاذب) يحدث حين تكون H₀ كاذبة لكننا نفشل في رفضها. يُرمز لاحتمال خطأ النوع الثاني بـ β. خلافاً لـ α، يعتمد β على حجم الأثر الحقيقي وحجم العينة — وليس محدداً بعتبة الدلالة.
| H₀ صحيحة | H₀ كاذبة | |
|---|---|---|
| خطأ النوع الأول (احتمال = α) | قرار صحيح (احتمال = 1 − β) | رفض H₀ |
| قرار صحيح (احتمال = 1 − α) | خطأ النوع الثاني (احتمال = β) | الفشل في رفض H₀ |
ثمة مقايضة متأصلة: تخفيض α (جعل رفض H₀ أصعب) يقلل أخطاء النوع الأول لكنه يزيد أخطاء النوع الثاني. لا يمكنك تقليل كلا النوعين في آنٍ واحد لحجم عينة ثابت. الطريقة الوحيدة لتقليلهما معاً هي زيادة حجم العينة.
القوة الإحصائية
القوة هي احتمال رفض H₀ بشكل صحيح حين تكون كاذبة: القوة = 1 − β. الاختبار ذو القوة العالية حساسٌ — يكتشف الآثار الحقيقية بشكل موثوق. الاختبار ذو القوة المنخفضة كثيراً ما يُخفق في اكتشاف الآثار الحقيقية.
تعتمد القوة على أربعة عوامل: مستوى الدلالة α (كلما ارتفع α → قوة أكبر)، حجم الأثر الحقيقي (الآثار الأكبر أسهل اكتشافاً)، حجم العينة n (بيانات أكثر ← قوة أكبر)، والتباين في البيانات σ (ضوضاء أقل ← إشارة أوضح). هذه العلاقات تدفع تحليل القوة — ممارسة حساب حجم العينة المطلوب قبل جمع البيانات لضمان قدرة الدراسة على اكتشاف الأثر المنشود.
الاختبارات أحادية وثنائية الذيل
الفرضية البديلة تحدد اتجاه الاختبار. الاختبار ثنائي الذيل يأخذ في الاعتبار الانحرافات في كلا الاتجاهين من H₀: H₁: μ ≠ μ0. القيمة الاحتمالية هي احتمال مشاهدة |Z| ≥ |zobs| في أي من ذيلَي التوزيع. هذا هو الخيار المناسب حين لا تملك فرضية اتجاهية مسبقة.
الاختبار أحادي الذيل (الاتجاهي) يأخذ في الاعتبار الانحرافات في اتجاه واحد فقط: H₁: μ > μ0 (الذيل العلوي) أو H₁: μ < μ0 (الذيل السفلي). تُحسب القيمة الاحتمالية من ذيل واحد فقط، مما يجعلها تساوي نصف القيمة ثنائية الذيل لنفس البيانات. الاختبارات أحادية الذيل لها قوة أكبر لاكتشاف الأثر الاتجاهي المحدد لكنها لا تقدم دليلاً على الآثار في الاتجاه الآخر.
استخدم ثنائي الذيل (الافتراضي): لا تملك فرضية اتجاهية مسبقة، أو سيكون الأثر في أي اتجاه ذا أهمية (مثل اختبار ما إذا كانت عملية جديدة تغيّر الإنتاج).
استخدم أحادي الذيل: الاتجاه مُبرَّر نظرياً قبل جمع البيانات، والأثر في الاتجاه المعاكس سيكون غير ذي معنى (مثل اختبار ما إذا كان دواء جديد يخفّض — لا يغيّر — ضغط الدم).
تحذير: اختيار اختبار أحادي الذيل بعد رؤية أن البيانات تميل لاتجاه معين هو تحيز في البيانات ويُبطل الاختبار.
الإجراء الكامل للاختبار
يتبع اختبار الفرضيات الصارم تسلسلاً محدداً من الخطوات، جميعها تُحدَّد قبل تحليل البيانات:
1. صِغ الفرضيات: حدد H₀ وH₁ من حيث المعامل المعني.
2. اختر مستوى الدلالة: حدد α قبل رؤية البيانات (مثلاً 0.05).
3. اختر الاختبار: اختر إحصاء الاختبار المناسب لنوع بياناتك وفرضيتك.
4. تحقق من الافتراضات: تأكد من استيفاء شروط الاختبار (مثل الطبيعية والاستقلالية).
5. احسب إحصاء الاختبار والقيمة الاحتمالية: طبّق الصيغة على بياناتك.
6. قرّر وفسّر: إذا كانت p ≤ α، ارفض H₀. أبلغ عن حجم الأثر إلى جانب القيمة الاحتمالية.
- H₀ مقابل H₁: H₀ هي الافتراض المتشكك (لا أثر)؛ H₁ هي ما تبحث عن دليل له. لا تُثبت H₀ أبداً — فقط ترفضها أو تفشل في رفضها.
- إحصاء الاختبار: رقم يلخص مدى انحراف البيانات عن H₀. لاختبار متوسط المجتمع: Z = (x̄ − μ0) / (σ/√n).
- القيمة الاحتمالية: احتمال بيانات متطرفة على الأقل بقدر المشاهَدة، بافتراض صحة H₀. وليست احتمال صحة H₀.
- مستوى الدلالة α: عتبة محددة مسبقاً (مثلاً 0.05). ارفض H₀ إذا كانت p ≤ α.
- خطأ النوع الأول: رفض H₀ الصحيحة؛ الاحتمال = α. خطأ النوع الثاني: الفشل في رفض H₀ الكاذبة؛ الاحتمال = β.
- القوة = 1 − β: احتمال اكتشاف أثر حقيقي. ترتفع مع n أكبر وحجم أثر أكبر وα أعلى.
- الاختبار ثنائي الذيل: H₁: μ ≠ μ0 (الافتراضي). أحادي الذيل: H₁: μ > أو < μ0 (يستلزم مبرراً اتجاهياً مسبقاً).