اختيار النماذج والضبط
اختيار النموذج الأنسب وإيجاد أفضل معاملاته الفائقة — العلم المنهجي وراء استخلاص الأداء الحقيقي من خط أنابيب تعلم الآلة.
لا يوجد فائز وحيد
بمعدّل على جميع المسائل الممكنة، تؤدي كل خوارزمية بنفس المستوى. لا يوجد نموذج أفضل بشكل عالمي — الاختيار الصحيح يعتمد على بياناتك وحجمها وميزاتها وقيودها.
التحقق المتقاطع
تقسيم واحد للتدريب/الاختبار قد يكون محظوظًا أو غير محظوظ. يُدوِّر التحقق المتقاطع K-طيّي المجموعة المحجوزة ويحسب متوسط النقاط:
طابق CV مع نوع بياناتك
- K-طيّي الطبقي — يحافظ على نسب الفئات. استخدم للتصنيف
- تقسيم السلسلة الزمنية — نافذة توسّعية: درّب على الماضي، تحقق من المستقبل دائمًا
- K-طيّي المجموعة — احتفظ بجميع صفوف كيان واحد (مستخدم، مريض) في الطيّة ذاتها
- اترك واحدًا خارجًا — K = N؛ لمجموعات البيانات الصغيرة جدًّا فقط
البحث الشبكي مقابل العشوائي
- البحث الشبكي — يجرّب كل تركيبة. الأفضل على الشبكة مضمون، لكن التكلفة أسّية
- البحث العشوائي — يسحب تهيئات عشوائيًّا. يغطي قيمًا أكثر للمعاملات المهمة بنفس الميزانية
- لـ≤3 معاملات بشبكات صغيرة: البحث الشبكي. وإلا: البحث العشوائي
- Bergstra & Bengio (2012): البحث العشوائي يجد نتائج أفضل في الممارسة
التغطية مقابل الاستنفاد
مع n تجربة و d معاملات، يُسقط البحث الشبكي n^(1/d) قيمة مميزة فقط لكل محور. يُسقط البحث العشوائي n قيمة مميزة — أكثر بكثير حين يكون d كبيرًا.
التحسين البايزي
يبني نموذجًا بديلًا للدالة الهدف ويختار التهيئة التالية بالموازنة بين الاستغلال (بالقرب من أفضل نتيجة حالية) والاستكشاف (المناطق غير المؤكدة).
استخدمه حين تكون التقييمات مكلفة (التعلم العميق، التدريب الطويل). الأدوات: Optuna، Hyperopt، scikit-optimize.
ادمج من أجل القوة
- التصويت / المتوسط — درّب نماذج متنوعة بشكل مستقل، خذ متوسط التنبؤات
- التكديس — متعلم تلوي مدرَّب على تنبؤات خارج الطيّة (OOF) للنماذج الأساسية
- المزج — متعلم تلوي مدرَّب على مجموعة محجوزة ثابتة. أبسط لكنه يُضيّع البيانات
- الرؤية الأساسية: التنوع يتفوق على الدقة للنماذج الأساسية الفردية
تنبؤات خارج الطيّة
لا تُغذِّ أبدًا المتعلم التلوي بتنبؤات من نماذج أساسية درّبت على نفس الصفوف. استخدم تنبؤات خارج الطيّة (OOF): لكل طيّة، درّب على الأخريات، تنبّأ على هذه.
خطوط أنابيب آلية
- Auto-sklearn — تحسين بايزي عبر خطوط أنابيب scikit-learn
- TPOT — برمجة جينية؛ يُصدِّر كودًا نظيفًا
- H2O AutoML — يُكدِّس GBMs والشبكات العصبية؛ جاهز للإنتاج
- AutoGluon — إعدادات افتراضية قوية للبيانات الجدولية من AWS
- استخدمه كخط أساسي ومعيار — افهم ما يفعله
عملية منهجية
- حدّد مقياسك — ماذا تُحسِّن بالضبط؟
- اضبط استراتيجية التحقق المتقاطع الصحيحة
- أنشئ خطًّا أساسيًّا تافهًا أولًا
- قارن 3–4 عائلات خوارزميات بمعاملات افتراضية
- بحث عشوائي خشن ← بحث بايزي دقيق
- ادمج أفضل النماذج إن كان التعقيد مقبولًا
- قيّم على مجموعة الاختبار مرة واحدة بالضبط في النهاية
الخلاصة الرئيسية
- لا غداء مجاني — قارن الخوارزميات تجريبيًّا على بياناتك
- اختر استراتيجية CV حسب نوع البيانات: طبقي، سلسلة زمنية، أو مجموعة
- بحث شبكي للفضاءات الصغيرة؛ بحث عشوائي لمعاملات كثيرة
- تحسين بايزي حين تكون التقييمات مكلفة
- المجموعات (تصويت، تكديس، مزج) تُحسِّن الأداء دائمًا تقريبًا
- قيّم على مجموعة الاختبار مرة واحدة بالضبط — أي تغييرات إضافية تُبطل التقدير