مجموعة أدوات الاختبار
أرست الدرس السابق منطق اختبار الفرضيات: صياغة H₀ وH₁، وحساب إحصاء الاختبار، وإيجاد القيمة الاحتمالية p، ومقارنتها بعتبة الدلالة. لكن بقي السؤال الجوهري مفتوحًا — أيّ اختبار تستخدم؟
تعتمد الإجابة على ثلاثة عوامل: ما الذي تقارنه (متوسطات أم نسب أم ارتباطات)، عدد المجموعات، وما تعرفه عن المجتمع (هل الانحراف المعياري معروف؟). يستعرض هذا الدرس الاختبارات الأكثر شيوعًا: اختبار Z، واختبارات t بأنواعها، واختبارات النسب، واختبار كاي تربيع. وختامًا نناقش حجم الأثر الذي يضع الدلالة الإحصائية في سياق عملي.
| الاختبار | متى يُستخدم | الإحصاء الرئيسي |
|---|---|---|
| اختبار Z (متوسطات) | متوسط عينة واحدة، σ معروف | Z = (x̄ − μ₀) / (σ/√n) |
| اختبار t أحادي | متوسط عينة واحدة، σ مجهول | t = (x̄ − μ₀) / (s/√n) |
| اختبار t ثنائي | متوسطا مجموعتين مستقلتين | t = (x̄₁ − x̄₂) / SE |
| اختبار t المزدوج | عينتان مترابطتان/متطابقتان | t = d̄ / (sₜ/√n) |
| Z النسبة الواحدة | نسبة واحدة مقابل p₀ | Z = (p̂ − p₀) / √(p₀(1−p₀)/n) |
| Z النسبتين | نسبتان من مجموعتين مستقلتين | Z = (p̂₁ − p̂₂) / SE |
| كاي تربيع (χ²) | الارتباط بين متغيرين فئويين | χ² = Σ(O−E)²/E |
اختبار Z للمتوسطات (انحراف σ معروف)
عندما يكون الانحراف المعياري للمجتمع σ معروفًا، يكون اختبار Z دقيقًا حتى مع عينات صغيرة (بافتراض التوزيع الطبيعي)، وتقريبيًا صحيحًا للعينات الكبيرة استنادًا إلى نظرية النهاية المركزية. في الواقع العملي، نادرًا ما يُعرف σ؛ ويظهر اختبار Z أساسًا في الكتب الدراسية أو حين توفّر بيانات تاريخية قيمةً موثوقة لـ σ.
يدّعي مصنّع أن قضبانه لها متوسط قطر 10 مم بانحراف σ = 0.2 مم (من سجلات الإنتاج التاريخية). عينة من 40 قضيبًا أعطت x̄ = 10.06 مم. هل ثمة دليل على انحراف المتوسط؟
Z = (10.06 − 10) / (0.2 / √40) = 0.06 / 0.0316 ≈ 1.90. بما أن |Z| = 1.90 < 1.96، نفشل في رفض H₀ عند α = 0.05 (وإن كانت p ≈ 0.057 على حافة الدلالة).
اختبار t أحادي العينة (انحراف σ مجهول)
في الحالة الأكثر شيوعًا حيث يكون σ مجهولًا، نُقدِّره بالانحراف المعياري للعينة s ونستخدم إحصاء t. يمتلك توزيع t ذيولًا أثقل من التوزيع الطبيعي المعياري، وهو ما يعكس الشك الإضافي الناجم عن تقدير σ. مع ازدياد حجم العينة، يتقارب توزيع t نحو التوزيع الطبيعي المعياري.
الافتراضات: أن يكون المجتمع طبيعيًا تقريبًا (أو n ≥ 30 استنادًا إلى النهاية المركزية). استقلالية المشاهدات. غياب القيم الشاذة الحادة التي تُشوّه s.
اختبار t ثنائي العينة (مجموعتان مستقلتان)
عند مقارنة متوسطَي مجموعتين مستقلتين — مجموعة علاج ومجموعة ضبط، أو ذكور وإناث، أو آلتان مختلفتان — نستخدم اختبار t الثنائي. H₀: μ₁ = μ₂.
أشيع نسخة منه تفترض تساوي التباينات (σ₁² = σ₂²) وتستخدم تقديرًا مجمّعًا للتباين المشترك:
يمكن استخدام اختبار ليفين للتحقق من تساوي التباينات. بيد أن كثيرًا من الإحصائيين يوصون باستخدام اختبار ويلش افتراضيًا — إذ يؤدي أداءً جيدًا حتى عند تساوي التباينات، وهو الأكثر أمانًا عند اختلافها.
اختبار t المزدوج (العينات المتزاوجة)
حين تأتي القياسات في أزواج طبيعية — قبل/بعد، اليد اليمنى/اليسرى، مريض يتلقى دواءً ثم دواءً آخر (التصميم التقاطعي) — لا تكون العينتان مستقلتين. ويستغل اختبار t المزدوج هذا الهيكل بالعمل على الفروقات داخل كل زوج: dᵢ = xᵢ₁ − xᵢ₂.
بتحليل الفروقات، نُزيل التباين بين الأفراد، مما يمنح الاختبار المزدوج قوةً أكبر من اختبار t الثنائي عندما يكون الارتباط بين الأزواج قويًا.
قُيِّس ضغط الدم لـ 12 مريضًا قبل دواء جديد وبعده. كان متوسط الفرق d̄ = −8.3 ملم زئبق مع sₜ = 5.1 ملم زئبق. t = −8.3 / (5.1/√12) ≈ −5.65. عند df = 11 و|t| = 5.65، القيمة p < 0.001 — دليل قوي على أن الدواء يخفض ضغط الدم.
اختبارات النسب
حين تكون النتيجة فئوية (نجاح/فشل، نعم/لا)، نعمل مع النسب بدلًا من المتوسطات. يُطبَّق تقريب Z عندما تكون العينة كبيرة بما يكفي لتوفير تقريب جيد من التوزيع الطبيعي للتوزيع ذي الحدين.
اختبار Z للنسبة الواحدة: اختبار ما إذا كانت النسبة تساوي قيمة افتراضية p₀.
اختبار Z للنسبتين: مقارنة النسب من مجموعتين مستقلتين. النسبة المجمّعة p̄ = (x₁ + x₂) / (n₁ + n₂) تُستخدم في الخطأ المعياري تحت H₀: p₁ = p₂.
اختبار كاي تربيع للاستقلالية
يجيب اختبار كاي تربيع عن السؤال: هل متغيران فئويان مستقلان؟ نُرتّب البيانات في جدول تقاطعي ونقارن التكرارات الملاحَظة O بالتكرارات المتوقعة E لو كانت المتغيرات مستقلة.
الشروط: التكرار المتوقع ≥ 5 في كل خلية (وإلا استخدم اختبار فيشر الدقيق). أخذ عشوائي واستقلالية المشاهدات.
في تجربة سريرية، يتلقى 200 مريض أحد دواءين (A أو B)، ويُسجَّل ظهور (أو عدم ظهور) أعراض جانبية. هل يرتبط ظهور الأعراض بنوع الدواء؟
يلخص χ² مدى انحراف جدول 2×2 عمّا نتوقعه في غياب الارتباط. قيمة χ² كبيرة مع p صغيرة تعني أن الدواءين يختلفان في ملفات أعراضهما الجانبية.
حجم الأثر: أبعد من الدلالة الإحصائية
تُخبرك القيمة p إن كان الأثر قابلًا للاكتشاف، لا إن كان مهمًا. مع عينة كبيرة بما فيه الكفاية، حتى فرق ضئيل جدًا سيكون ذا دلالة إحصائية. يقيس حجم الأثر حجم الفرق الفعلي بوحدة موحّدة وقابلة للتفسير.
d كوهين هو أشيع مقياس لحجم الأثر عند مقارنة متوسطَين. يُعبّر عن الفرق بين المتوسطين كمضاعف للانحراف المعياري المجمّع:
نسبة الأرجحية (Odds Ratio، OR) هي مقياس الأثر الطبيعي للنتائج الثنائية، ومُستخدمة على نطاق واسع في علم الأوبئة والتجارب السريرية. تقارن أرجحية حدث في مجموعة بأرجحيته في مجموعة أخرى:
احرص دائمًا على الإبلاغ عن القيمة p وحجم الأثر معًا. قد تكون النتيجة ذات دلالة عالية (p صغيرة جدًا) لكنها لا قيمة عملية لها (d صغير جدًا)، أو ذات أهمية عملية (d كبير) لكن غير دالة إحصائيًا بسبب صغر العينة. لا تكتمل الصورة بأحد المقياسَين دون الآخر.
- اختبار Z (σ معروف): Z = (x̄ − μ₀) / (σ/√n). استخدمه حين يكون انحراف المجتمع معروفًا. القيم الحرجة من التوزيع الطبيعي المعياري.
- اختبار t أحادي (σ مجهول): t = (x̄ − μ₀) / (s/√n)، df = n − 1. الأداة الأساسية لاختبار المتوسط في مجموعة واحدة.
- اختبار t الثنائي: يقارن متوسطَي مجموعتين مستقلتين باستخدام تباين مجمّع أو طريقة ويلش. يُفضَّل اختبار ويلش افتراضيًا.
- اختبار t المزدوج: يُحلّل الفروقات dᵢ = xᵢ₁ − xᵢ₂ للأزواج المتطابقة. أكثر قوةً من الثنائي عند وجود ارتباط قوي داخل الأزواج.
- اختبارات Z للنسب: النسبة الواحدة تختبر p̂ مقابل p₀. النسبتان تقارنان p̂₁ بـ p̂₂ باستخدام خطأ معياري مجمّع.
- اختبار كاي تربيع: χ² = Σ(O−E)²/E يختبر الاستقلالية بين متغيرين فئويين. df = (r−1)(c−1). يشترط E ≥ 5 في كل خلية.
- حجم الأثر: d كوهين يُوحّد فروق المتوسطات. نسبة الأرجحية تقارن معدلات الأحداث الثنائية. أبلغ دائمًا عن كليهما إلى جانب القيمة p.