قراءة
وضع القصص

طرق البوتستراب

~20 دقيقة قراءة الدرس 3 من 3 في الوحدة 5

الفكرة الجريئة

الاستدلال الكلاسيكي — فترات z وt — يعمل باشتقاق التوزيع العيني الدقيق أو التقريبي لإحصاء ما في ظل افتراضات نموذجية محددة. لكن ماذا تفعل حين يكون الإحصاء وسيطاً، أو نسبة تباينين، أو معامل ارتباط، أو شيئاً أكثر تعقيداً؟ اشتقاق التوزيع العيني يدوياً سرعان ما يصبح أمراً صعب التحقيق أو يستلزم افتراضات يتعذر التحقق منها.

في عام 1979، اقترح الإحصائي برادلي إيفرون فكرة بسيطة بشكل مذهل: إذا كنت لا تعرف توزيع المجتمع، استخدم العينة نفسها بديلاً عنه. أعد أخذ العينات من بياناتك باستبدال، واحسب الإحصاء على كل عينة معادة أخذها، ودع التوزيع الناتج للإحصاءات المعاد حسابها يقرّب التوزيع العيني الحقيقي. أسمى هذا البوتستراب — مستوحى من عبارة «انتشلت نفسك بأحذيتك»، في إشارة إلى رفع نفسك بيانياً بواسطة بياناتك.

يغطي هذا الدرس خوارزمية البوتستراب، وكيف تنتج فترات ثقة، ولماذا تنطبق على أي إحصاء تقريباً، والفرق بين البوتستراب المعلمي واللامعلمي، والحالات المعروفة التي تُخفق فيها الطريقة.

خوارزمية البوتستراب

لنفترض أن لدينا عينة x = (x1, x2, …, xn) من توزيع مجهول F، ونريد فترة ثقة لمعامل θ مقدَّر بإحصاء T(x) (مثل المتوسط أو الوسيط أو الارتباط).

خوارزمية البوتستراب اللامعلمية

الخطوة 1: اسحب عينة بوتستراب x* = (x*1, …, x*n) بأخذ n مشاهدة من x باستبدال.

الخطوة 2: احسب إحصاء البوتستراب T* = T(x*).

الخطوة 3: كرّر الخطوتين 1 و2 عدداً كبيراً من المرات B (عادةً B = 1,000 إلى 10,000).

الخطوة 4: استخدم القيم الـ B التي هي T*1، T*2، …، T*B لتقدير التوزيع العيني لـ T.

لأن كل عينة بوتستراب تُسحب باستبدال من n مشاهدة، تظهر بعض المشاهدات الأصلية مرات متعددة وأخرى لا تظهر أبداً. في المتوسط، تحتوي أي عينة بوتستراب على نحو 63.2% من المشاهدات المميزة (الباقي نسخ مكررة).

الخطأ المعياري بالبوتستراب

الاستخدام الأساسي لعينات البوتستراب المعادة هو تقدير الخطأ المعياري لأي إحصاء — الكمية التي تستلزم عادةً اشتقاقاً تحليلياً في الإحصاء الكلاسيكي.

الخطأ المعياري بالبوتستراب
\widehat{\mathrm{SE}}_{\mathrm{boot}} = \sqrt{\dfrac{1}{B-1}\sum_{b=1}^{B}\left(T^*_b - \bar{T}^*\right)^2}
T̄* هو متوسط إحصاءات البوتستراب الـ B. هذا يقدر الانحراف المعياري للتوزيع العيني لـ T — دون الحاجة إلى اشتقاق أي صيغة.

هذا مُحرِّر: لأي إحصاء — مهما كان غير مألوف — فإن الخطأ المعياري هو مجرد الانحراف المعياري لتوزيع البوتستراب الخاص به. لن تحتاج أبداً إلى اشتقاق صيغة.

فترات الثقة بالبوتستراب

ثمة عدة طرق لتحويل عينات البوتستراب المعادة إلى فترات ثقة. الأكثر شيوعاً هما طريقة الشريحة المئوية والطريقة الأساسية (المحورية).

فترة الشريحة المئوية: بكل بساطة، خذ شريحتي α/2 و1 − α/2 من توزيع البوتستراب كحدي الفترة:

فترة بوتستراب الشريحة المئوية
\left[\, T^*_{(\alpha/2)},\; T^*_{(1-\alpha/2)}\,\right]
T*(α/2) و T*(1−α/2) هما شريحتا α/2 و(1−α/2) لإحصاءات البوتستراب الـ B مرتبة تصاعدياً. لفترة 95%: خذ الشريحتين المئويتين 2.5 و97.5.

الفترة الأساسية (طريقة الانعكاس): بدلاً من استخدام شريحات T* مباشرة، استخدمها لتصحيح التحيز وإنشاء فترة منعكسة:

فترة بوتستراب الانعكاس الأساسية
\left[\, 2\hat{T} - T^*_{(1-\alpha/2)},\; 2\hat{T} - T^*_{(\alpha/2)}\,\right]
T̂ هو الإحصاء على العينة الأصلية. الفترة الأساسية لها خصائص نظرية أفضل حين يكون توزيع البوتستراب منحرفاً، على حساب تعقيد أكبر.

تشمل المتغيرات الأكثر تقدماً فترة BCa (المصححة للتحيز والمسرَّعة)، التي تصحح كلاً من التحيز والانحراف في توزيع البوتستراب، وهي الطريقة الأكثر توصية في الممارسة الحديثة.

البوتستراب لأي إحصاء

أقوى ميزة للبوتستراب هي عموميته. الطرق المعلمية الكلاسيكية توفر صيغاً للمتوسط والنسبة، لكن لكل شيء آخر تقريباً، البوتستراب هو الأسلوب الأمثل. إليك أمثلة رئيسية:

البوتستراب في الممارسة

الوسيط: لا توجد صيغة مغلقة للخطأ المعياري للتوزيعات غير الطبيعية — البوتستراب يوفره بسهولة.

معامل الارتباط: البوتستراب أكثر قوة من تحويل z لفيشر للبيانات غير الطبيعية والعينات الصغيرة.

نسبة المتوسطات: لا توجد صيغة بسيطة؛ البوتستراب يعمل مباشرة.

معاملات الانحدار: فترات بوتستراب أكثر قوة من فترات الثقة الكلاسيكية عند وجود بواقٍ غير طبيعية أو غير متجانسة التباين.

مقاييس نماذج التعلم الآلي: مساحة تحت المنحنى (AUC)، الدقة، F1 — البوتستراب هو الطريقة القياسية لتقدير عدم اليقين في هذه المقاييس.

البوتستراب المعلمي في مقابل اللامعلمي

الخوارزمية الموضحة أعلاه هي البوتستراب اللامعلمي — لا تفترض أي شيء عن شكل التوزيع الأساسي F، وتعيد أخذ العينات مباشرة من التوزيع التجريبي للبيانات. هذا المتغير هو الأكثر استخداماً.

البوتستراب المعلمي يُلائم نموذجاً معلمياً مع البيانات (مثلاً يفترض أن البيانات طبيعية بمتوسط وتباين مقدَّرين)، ثم يولّد عينات بوتستراب بالسحب من النموذج المُلائم بدلاً من إعادة أخذ العينات من البيانات الأصلية. يكون مفيداً حين:

• لديك معرفة مسبقة قوية بالعائلة التوزيعية.
• عينتك صغيرة والتوزيع التجريبي تقريب ضعيف لـ F.
• تحتاج عينات بوتستراب تتجاوز نطاق البيانات المشاهدة (البوتستراب اللامعلمي لا يمكنه أبداً إنتاج قيم خارج العينة الأصلية).

التمييز الرئيسي

اللامعلمي: يعيد أخذ العينات من البيانات. لا افتراض توزيعي. قابل للتطبيق عالمياً. يتطلب أن يكون n كبيراً كفاية لكي يمثّل التوزيع التجريبي F بشكل جيد.

المعلمي: يعيد أخذ العينات من نموذج مُلائم. يستغل المعرفة التوزيعية لكفاءة أعلى. يُخفق بشكل سيء حين يكون النموذج المفترض خاطئاً.

لماذا يعمل البوتستراب؟

المبرر النظري يرتكز على مبدأ التعويض: استبدال التوزيع المجهول F بالتوزيع التجريبي F̂ (الذي يعطي احتمال 1/n لكل نقطة بيانات مشاهدة). أي دالة لـ F يمكن تقديرها بنفس الدالة لـ F̂.

مع n → ∞، يتقارب F̂ نحو F بموجب نظرية جليفنكو–كانتيلي. يتقارب توزيع بوتستراب T* − T نحو التوزيع العيني الحقيقي لـ T − θ. لذا فإن فترات ثقة البوتستراب صالحة مقارباً — تحقق احتمال التغطية الصحيحة مع نمو n.

للعينات المحدودة، تعتمد جودة تقريب البوتستراب على مدى جودة تمثيل F̂ لـ F. لهذا تظل العينات الصغيرة تحدياً: مع n = 10 لا يوجد سوى نحو 10 مشاهدات مميزة في التوزيع التجريبي، قد يكون بديلاً ضعيفاً للتوزيع المستمر الحقيقي.

متى يُخفق البوتستراب؟

البوتستراب ليس عصا سحرية. ثمة حالات إخفاق معروفة:

قيود البوتستراب

الشريحات المئوية الطرفية والأعظم/الأصغر: تقدير الحد الأقصى للتوزيع يفشل — الحد الأقصى للبوتستراب لا يمكن أن يتجاوز الحد الأقصى المشاهد.

التوزيعات ذات الذيول الثقيلة: حين يكون التباين لا نهائياً (مثل توزيع كوشي)، قد لا يتقارب البوتستراب بشكل صحيح.

العينات الصغيرة جداً (n < 15): التوزيع التجريبي تقريب خشن لـ F؛ التغطية قد تكون غير موثوقة.

البيانات غير المستقلة: السلاسل الزمنية والبيانات المكانية والعنقودية تستلزم متغيرات بوتستراب متخصصة (بوتستراب الكتل، بوتستراب المجموعات).

اختيار النموذج والتناثر: تطبيق البوتستراب على إجراء اختيار نموذج (مثل LASSO) قد يعطي نتائج مضللة.

التطبيق الحوسبي

التكلفة الرئيسية للبوتستراب حوسبية: يجب تشغيل حساب الإحصاء B مرة. مع B = 1,000 وإحصاء سريع (مثل وسيط n = 100 مشاهدة)، هذا يستغرق ميلي ثوانٍ على الحاسوب الحديث. مع B = 10,000 وإحصاء مكثوف حوسبياً (مثل AUC محسوبة بالتحقق المتقاطع لشبكة عصبية)، قد يستغرق ساعات.

في Python، فترة ثقة بوتستراب لأي إحصاء سهلة التنفيذ:

نمط Python

import numpy as np
rng = np.random.default_rng(42)
B = 5000
boot_stats = [np.median(rng.choice(x, n, replace=True)) for _ in range(B)]
ci = np.percentile(boot_stats, [2.5, 97.5])

تتضمن SciPy 1.7+ الدالة scipy.stats.bootstrap التي تطبق طرق الشريحة المئوية والأساسية وBCa باستدعاء دالة واحدة. حزمة boot في R هي التطبيق المرجعي، وتدعم جميع المتغيرات الرئيسية والحوسبة المتسارعة.

النقاط الرئيسية
  • الفكرة الجوهرية: عامل العينة كبديل عن المجتمع؛ اسحب B عينة بوتستراب لتقريب التوزيع العيني لأي إحصاء.
  • الخطأ المعياري بالبوتستراب: الانحراف المعياري لإحصاءات البوتستراب الـ B — لا يتطلب أي صيغة تحليلية.
  • فترة الشريحة المئوية: [T*(α/2)، T*(1−α/2)] — الأبسط والأوسع استخداماً.
  • العمومية: تعمل للوسيط والارتباط ومعاملات الانحدار وAUC وأي كمية قابلة للتقدير تقريباً.
  • البوتستراب اللامعلمي: يعيد أخذ العينات من التوزيع التجريبي؛ لا يحتاج افتراض نموذج؛ صالح مقارباً.
  • البوتستراب المعلمي: يعيد أخذ العينات من نموذج مُلائم؛ أكفأ حين النموذج صحيح؛ مضلل حين النموذج خاطئ.
  • الإخفاقات المعروفة: إحصاءات الترتيب الطرفية، الذيول الثقيلة، n الصغير جداً، البيانات غير المستقلة (استخدم بوتستراب الكتل للسلاسل الزمنية).
السابق فترات الثقة نظرة عامة على الوحدة الوحدة التالية منطق اختبار الفرضيات