الأرقام في كل مكان، والفهم غائب
تملأ الادعاءات الإحصائية الأخبار كل يوم. تُعلن إحدى العناوين أن نظامًا غذائيًا جديدًا يُخفّض خطر الإصابة بأمراض القلب بنسبة 40%. وتُصرّح دراسة بأن الأشخاص الذين ينامون أكثر من ثماني ساعات يعيشون لفترة أطول. ويؤكد سياسي أن معدل الجريمة انخفض 25% في عهده. كل هذه الادعاءات قد تكون صحيحة، أو مضللة، أو خاطئة تمامًا — والفارق بينها بالغ الأهمية لقرارات تؤثر على حياة حقيقية.
الهدف من هذا الدرس ليس جعلك تشك في كل ادعاء كمّي، بل تزويدك بالأدوات اللازمة لتقييمها بصورة نقدية. بعد أحد عشر وحدة من الإحصاء، أصبحت مجهزًا لطرح الأسئلة الصحيحة: ما تصميم الدراسة؟ هل توجد مجموعة مقارنة؟ ما حجم العينة؟ وماذا يعني حجم الأثر فعليًا من الناحية العملية؟
عند مواجهة أي ادعاء إحصائي، اطرح ثلاثة أسئلة قبل قبوله: مقارنةً بماذا؟ (هل توجد مجموعة ضابطة؟) ما حجم الأثر؟ (هل النتيجة ذات دلالة إحصائية مهمة عمليًا أيضًا؟) من هم المقيَّسون؟ (هل تُعمَّم العينة على المجتمع الذي يهمّك؟)
الأخطاء الشائعة في الواقع
الخلط بين الارتباط والسببية هو أكثر الأخطاء انتشارًا. فالعنوان القائل إن شاربي القهوة يُعانون من معدلات أقل لمرض الزهايمر لا يعني أن القهوة تمنع الزهايمر. قد يختلف شاربو القهوة عن غير الشاربين في عشرات العوامل — النظام الغذائي، والدخل، والتعليم، والرياضة — وقد يُفسّر أيٌّ منها العلاقة. التجارب العشوائية وحدها تُثبت السببية؛ الدراسات الرصدية لا تُثبت سوى الارتباط.
تجاهل معدل الانتشار الأساسي يُفضي إلى مغالطة المعدل الأساسي. افترض أن مرضًا يُصيب شخصًا واحدًا من كل 1000 شخص، وأن اختبارًا تشخيصيًا له دقة 99% (معدل إيجابية كاذبة 1%). إذا أعطى الاختبار نتيجة إيجابية، فما احتمال إصابتك فعلًا؟ يُخمّن معظم الناس 99%، لكن الإجابة الصحيحة تقريبًا 9%. من كل 1000 شخص يخضعون للاختبار، سيظهر نحو 10 إيجابيات كاذبة (1% من الـ999 غير المصابين)، في حين تُتوقع إيجابية حقيقية واحدة فقط. ليس الاختبار خاطئًا في الغالب لأنه غير دقيق، بل لأن المرض نادر.
تحيز الناجين يحدث حين نرى فقط الحالات التي اجتازت عملية انتقاء، مما يجعل الناجين يبدون مختلفين جوهريًا عن المجموعة الأصلية. المثال الكلاسيكي: خلال الحرب العالمية الثانية، لاحظ المحللون أن الطائرات العائدة كانت تحمل ثقوب رصاص مُركّزة في الجسم والأجنحة، فأوصوا بتعزيز تلك المناطق — حتى أشار إبراهيم والد إلى أنهم يجب أن يُعزّزوا المناطق الخالية من الثقوب، لأن الطائرات التي أُصيبت هناك لم تعد أبدًا. نحن لم نرَ سوى الناجين.
دواء يُخفّض خطر النوبة القلبية من 2% إلى 1% يمتلك تخفيضًا نسبيًا للخطر بنسبة 50% (يبدو مثيرًا) وتخفيضًا مطلقًا للخطر بنقطة مئوية واحدة (متواضع). اطلب دائمًا كلا الرقمين. كثيرًا ما تستخدم العناوين الأخبارية التخفيض النسبي لأنه يبدو أكبر.
العدد اللازم لعلاج (NNT) = 1 ÷ التخفيض المطلق للخطرسوء تفسير القيمة الاحتمالية (p-value) لا يزال وباءً حتى في الأوراق العلمية. قيمة p تساوي 0.03 لا تعني أن احتمال صحة الفرضية الصفرية هو 3%. بل تعني: لو كانت الفرضية الصفرية صحيحة، لكان احتمال مشاهدة بيانات متطرفة بهذا القدر أو أكثر 3% فحسب. هذان بيانان مختلفان تمامًا. لا تُخبرك قيمة p شيئًا عن احتمال صحة فرضية، ولا عن حجم الأثر، ولا عن الأهمية العملية للنتيجة.
قابلية الاستنساخ والعلم المفتوح
أزمة قابلية الاستنساخ — المعروفة أيضًا بأزمة التكرار — تُشير إلى الاكتشاف الواسع الانتشار منذ عام 2011 تقريبًا بأن جزءًا كبيرًا من النتائج العلمية المنشورة لا يمكن تكرارها عند إعادة إجراء التجارب. وقد نشرت تعاونية العلم المفتوح دراسة مرجعية عام 2015 حاولت فيها إعادة إنتاج 100 تجربة نفسية، ووجدت أن 39% منها فقط أعطت نتائج متوافقة مع الأصل. وقد وُثّقت مشكلات مماثلة في الطب والاقتصاد وعلم الأعصاب.
ثمة عوامل عدة تُغذّي عدم قابلية الاستنساخ. تحيز النشر يعني أن المجلات تُفضّل النشر للنتائج الإيجابية؛ أما النتائج السلبية فتختفي في أدراج الباحثين. اصطياد القيمة p (المعروف بـ"الصيد") يُشير إلى تشغيل تحليلات متعددة والإبلاغ انتقائيًا عن التحليل الذي تجاوز عتبة الدلالة. وHARKing (صياغة الفرضية بعد معرفة النتائج) يعني توليد فرضية لتفسير النتائج بعد رؤية البيانات، ثم تقديمها وكأنها مُعدّة سلفًا. كل هذه الممارسات تُضخّم عدد الإيجابيات الكاذبة في الأدبيات العلمية.
العلم المفتوح هو مجموعة من الممارسات المصممة لجعل البحث أكثر شفافية وقابلية للاستنساخ. تشمل ركائزه: مشاركة البيانات الخام ورمز التحليل؛ والتسجيل المسبق للفرضيات وخطط التحليل قبل جمع البيانات؛ ونشر النتائج السلبية؛ وتكرار النتائج الأساسية قبل اعتبارها مثبتة؛ واستخدام النشر التمهيدي (pre-prints) لتسريع الوصول إلى النتائج. هذه ليست مجرد عادات جيدة — بل هي أساس الأدبيات العلمية الموثوقة.
التسجيل المسبق
التسجيل المسبق يعني الالتزام علنًا بفرضياتك وحجم العينة ومعايير الإدراج وخطة التحليل قبل جمع أي بيانات — ثم الالتزام بتلك الخطة. توفر سجلات مثل إطار العلم المفتوح (OSF) وموقع ClinicalTrials.gov سجلات مُوثَّقة بالتاريخ لا يمكن تعديلها بعد بدء جمع البيانات.
لا يمنع التسجيل المسبق التحليل الاستكشافي — بل يتطلب فقط تسميته بصدق. التحليل التأكيدي المُسجَّل مسبقًا دليلٌ قوي؛ أما التحليل الاستكشافي الذي نشأ بعد الاطلاع على البيانات فهو توليدٌ للفرضيات لا تأكيدٌ لها. إن انضباط تصنيف كل تحليل بشكل صحيح هو من أقوى الإصلاحات في الإحصاء الحديث.
يرى المنتقدون أن التسجيل المسبق يُقيّد الإبداع بإلزام الباحثين بخطة قبل فهم البيانات. والردّ على ذلك أنه لا يمنع الاستكشاف — بل يتطلب فقط إعداد تقارير صادقة. كان التمييز بين التحليل التأكيدي والاستكشافي مهمًا دائمًا؛ التسجيل المسبق يجعله صريحًا وقابلًا للتحقق.
التحليل التلوي: تجميع الدراسات
لا توجد دراسة واحدة حاسمة. كل دراسة لها حجم عينة محدود، وخصائص سكانية معينة، وبروتوكولات خاصة، وعيوب فردية محتملة. التحليل التلوي هو التوليف الإحصائي للنتائج عبر دراسات مستقلة متعددة تتناول السؤال ذاته. عند إجرائه بشكل صحيح، ينتج التقدير الأكثر موثوقية للأثر الذي يمكن للأدبيات الموجودة دعمه.
الفكرة المحورية للتحليل التلوي هي حساب متوسط مرجّح لأحجام الأثر عبر الدراسات، مع منح الدراسات ذات الأخطاء المعيارية الأصغر (أي التقديرات الأكثر دقة) وزنًا أكبر. في ظل نموذج التأثيرات الثابتة، يكون التقدير المجمع:
يفترض نموذج التأثيرات الثابتة أن جميع الدراسات تُقدّر الأثر الحقيقي ذاته. أما نموذج التأثيرات العشوائية فيُخفّف هذا الافتراض: إذ يسمح لكل دراسة بتقدير أثر حقيقي مختلف قليلًا (بسبب تباين السكان والبروتوكولات والسياقات)، والهدف هو تقدير متوسط الأثر عبر هذا التوزيع. التحليل التلوي بالتأثيرات العشوائية أكثر شيوعًا في الممارسة لأن أحجام الأثر تتباين فعلًا عبر سياقات الدراسات.
تُعرض التحليلات التلوية بصريًا باستخدام مخططات الغابة: تظهر كل دراسة على هيئة فترة ثقة أفقية على محور عمودي، بحيث يكون حجم المربع المركزي متناسبًا مع وزن الدراسة. يظهر التقدير المجمع في الأسفل على شكل ماسة. يُتيح مخطط الغابة رؤية فورية لما إذا كانت الدراسات متسقة (الفترات متداخلة) أو غير متجانسة (متباعدة عبر قيم مختلفة جدًا).
يمكن أن تُضلَّل التحليلات التلوية بالمشكلات ذاتها التي تُفسد الدراسات الأولية. إذا كانت النتائج الإيجابية أكثر قابلية للنشر، فإن مجموعة الدراسات التي تدخل التحليل التلوي ستكون مُنحازة بالفعل. المخططات القمعية — التي ترسم حجم الأثر مقابل دقة الدراسة — يمكنها الكشف عن عدم التماثل الذي يُشير إلى تحيز النشر: دراسات صغيرة غير دقيقة تُظهر آثارًا كبيرة في جانب واحد، دون دراسات موازنة في الجانب الآخر.
كيف تقرأ الادعاءات الإحصائية بشكل نقدي
بحوزتك الآن المفاهيم من هذه الدورة، إليك قائمة تحقق عملية لتقييم أي ادعاء إحصائي تصادفه — سواء في عنوان إخباري أو ورقة علمية أو تقرير سياساتي.
1. ما تصميم الدراسة؟ — رصدي أم عشوائي؟ الادعاءات السببية من الدراسات الرصدية تستوجب الشك.
2. ما مجموعة المقارنة؟ — كل ادعاء بفارق يتطلب نقطة مرجعية. مقارنةً بماذا؟
3. ما حجم الأثر؟ — هل تُعرض النتيجة بالأرقام المطلقة، أم بالنسب النسبية فحسب؟ هل هي ذات أهمية عملية؟
4. ما حجم العينة؟ — العينات الصغيرة تُعطي تقديرات متذبذبة. العينات الكبيرة تجعل الآثار التافهة ذات دلالة إحصائية.
5. هل سُجّلت مسبقًا؟ — الدراسات المُسجَّلة مسبقًا أقل عرضة لاصطياد قيمة p و HARKing.
6. هل جرى تكرارها؟ — نتيجة واحدة لافتة يجب أن تُعامَل كنتيجة أولية حتى يتم تكرارها باستقلالية.
7. من موّلها؟ — الدراسات التي تموّلها الصناعة أكثر ميلًا للإبلاغ عن نتائج مواتية للراعي، ليس بسبب الاحتيال، بل من خلال خيارات التصميم والتحليل.
القراءة النقدية لا تعني رفض كل ادعاء إحصائي، بل طرح هذه الأسئلة قبل تحديث قناعاتك. حين تُجيب دراسة على معظمها بشكل جيد — تصميم عشوائي، قدرة كافية، تسجيل مسبق، تكرار مستقل — فهي تستحق وزنًا كبيرًا. وحين تُجيب على القليل منها، فهي تستحق وزنًا أقل بالقدر ذاته.
- الارتباط ليس سببية. الدراسات الرصدية تُثبت الارتباطات؛ التجارب العشوائية وحدها تُثبت السببية. اسأل دائمًا عن العوامل المُربِكة.
- مغالطة المعدل الأساسي تُوضح أن الاختبارات الدقيقة للغاية تُعطي في الغالب إيجابيات كاذبة حين تكون الحالة نادرة. الخطر المطلق والخطر النسبي يحكيان قصصًا مختلفة تمامًا.
- تحيز الناجين ينشأ حين نرى فقط الوحدات التي اجتازت عملية انتقاء. البيانات المفقودة هي في الغالب أكثر البيانات إفادةً.
- قيم p لا تقيس احتمال صحة فرضية. تقيس مدى غرابة البيانات لو كانت الفرضية الصفرية صحيحة. الدلالة الإحصائية لا تعني الأهمية العملية.
- أزمة قابلية الاستنساخ تعكس تحيز النشر واصطياد قيمة p و HARKing. التسجيل المسبق والبيانات المفتوحة والتكرار هي الحلول البنيوية.
- التحليل التلوي يجمع الأدلة عبر الدراسات باستخدام الترجيح العكسي للتباين. مخططات الغابة تعرض النتائج بصريًا؛ اختبارات عدم تماثل المخطط القمعي تكشف تحيز النشر. التحليلات التلوية بقدر موثوقية الدراسات التي تُوليفها.