الرئيسية / ML 101 / الوحدة 10 / الدرس 2

اختيار النماذج والضبط

اختيار النموذج الأنسب وإيجاد أفضل معاملاته الفائقة — العلم المنهجي وراء استخلاص الأداء الحقيقي من خط أنابيب تعلّم الآلة.

~15 دقيقة قراءة الوحدة 10 · الدرس 2 متوسط

لا غداء مجاني

نتيجة أساسية في نظرية تعلّم الآلة — مبرهنة لا غداء مجاني (NFL) — تنص على أنه لا يوجد خوارزمية واحدة تتفوق على جميع الأخريات في كل مسألة ممكنة. بمعدّل على جميع التوزيعات الممكنة للبيانات، يتمتع كل خوارزمية تعلّم بنفس الأداء المتوقع. لا يعني هذا تشاؤمًا: بل يخبرنا أن اختيار النموذج يجب أن يستند إلى البنية المحددة لبياناتك ومهمتك.

في الممارسة العملية، تفوز عائلة صغيرة من الخوارزميات — الأشجار المعزَّزة بالتدرج، والشبكات العصبية المضبوطة جيدًا، والمجموعات — في معظم المعايير القائمة على البيانات المنظّمة. لكن "أي نموذج" يعتمد دائمًا على حجم بياناتك، وأنواع الميزات، وقيود الكمون، ومتطلبات القابلية للتفسير. المقارنة التجريبية على مشكلتك المحددة هي الدليل الموثوق الوحيد.

قائمة التحقق لاختيار النموذج

قبل الضبط: أنشئ خطًّا أساسيًا قويًّا (مثل التنبؤ بالمتوسط للانحدار، أو الفئة الأكثر شيوعًا للتصنيف). يجب أن يتفوق أي نموذج على هذا الخط لكي يستحق النشر. ثم قارن بين 2–3 عائلات من الخوارزميات قبل الغوص في ضبط معاملات أي نموذج منفرد.

التحقق المتقاطع

حجر الأساس للتقييم الصادق للنموذج. تقسيم واحد للتدريب/الاختبار قد يكون هشًّا — قد يكون الأداء مرتفعًا أو منخفضًا بحسب الحظ وفقًا للعينات التي تقع في كل مجموعة. التحقق المتقاطع يستخدم البيانات بشكل أكمل من خلال تدوير الجزء المحجوز كمجموعة اختبار.

التحقق المتقاطع K-طيّي

قسّم البيانات إلى K طيّات متساوية. درّب على K−1 طيّة، وقيّم على الطيّة المتبقية. دوّر عبر جميع K احتمالات. اتخذ متوسط نقاط K. والنتيجة تقدير أكثر استقرارًا للأداء التعميمي مقارنةً بتقسيم واحد.

نقاط التحقق المتقاطع K-طيّي
\text{CV Score} = \frac{1}{K}\sum_{k=1}^{K} \text{Score}_k
احسب متوسط مقياس التقييم عبر جميع K طيّات. الاختيار الشائع: K = 5 أو K = 10. K الأكبر يُعطي تحيزًا أقل لكن تباينًا أعلى وتكلفة حوسبة أكبر.

التحقق المتقاطع K-طيّي الطبقي

للتصنيف، قد ينتج التقسيم K-طيّي القياسي طيّات بتوزيعات فئوية مختلفة جدًّا بالصدفة. التحقق المتقاطع الطبقي يضمن أن كل طيّة تحتوي على نسب الفئات التقريبية ذاتها الموجودة في مجموعة البيانات الكاملة. استخدم دائمًا التطبيق الطبقي لمسائل التصنيف غير المتوازن.

استراتيجيات التحقق المتقاطع حسب نوع البيانات

Standard K-Fold
البيانات الجدولية المستقلة
الاختيار الافتراضي عندما تكون الصفوف مستقلة. K=5 أو K=10. استخدم التطبيق الطبقي للتصنيف.
Time Series Split
البيانات التسلسلية
نافذة توسّعية: درّب على الماضي، تحقق من المستقبل. لا تخلط أبدًا — لا يمكن للمستقبل أن يُخبر الماضي.
Group K-Fold
الملاحظات المجمّعة
حين تشترك الصفوف في كيان واحد (مستخدم، مريض، متجر)، احتفظ بجميع صفوف مجموعة واحدة في الطيّة ذاتها لمنع التسرب.
Leave-One-Out
مجموعات البيانات الصغيرة جدًّا
K = N (كل عينة طيّة بذاتها). يُعظّم بيانات التدريب لكنه مكلف حوسبيًّا.

البحث عن المعاملات الفائقة

المعاملات الفائقة للنموذج — معدل التعلم، عمق الشجرة، قوة التنظيم، عدد الطبقات — لا تُتعلم من البيانات؛ بل تُحدَّد قبل التدريب. إيجاد قيم جيدة لها هو مسألة بحث في فضاء عالي الأبعاد.

البحث الشبكي (Grid Search)

حدّد شبكة منفصلة من القيم المرشّحة لكل معامل فائق وقيّم كل تركيبة باستخدام التحقق المتقاطع. بسيط، شامل، ومضمون لإيجاد أفضل نقطة على الشبكة — لكن التكلفة تنمو بشكل أسّي مع عدد المعاملات الفائقة.

البحث الشبكي عملي عند وجود ≤3 معاملات فائقة ومجموعة مرشحة صغيرة لكل معامل. لمعدل تعلم في {0.001، 0.01، 0.1}، وعمق أقصى في {3، 5، 7}، وعدد المُقدِّرات في {100، 300، 500}، يُقيّم البحث الشبكي 3 × 3 × 3 = 27 تركيبة — ممكن. أضف معاملين آخرين وقد يصبح الأمر آلافًا.

البحث العشوائي (Random Search)

بدلًا من تجربة كل تركيبة بشكل شامل، اسحب تهيئات عشوائيًا من فضاء المعاملات الفائقة. بشكل مفاجئ، كثيرًا ما يجد البحث العشوائي تهيئات أفضل من البحث الشبكي لنفس ميزانية الحوسبة. السبب: معظم فضاءات المعاملات الفائقة لها أبعاد فعّالة منخفضة — عدد قليل فقط من المعاملات مهم للغاية، والبحث العشوائي يستكشف قيمًا أكثر لتلك المعاملات الحرجة.

لماذا يفوز البحث العشوائي
\text{Distinct values per axis} = \begin{cases} n^{1/d} & \text{grid} \\ n & \text{random} \end{cases}
مع n تجربة و d معاملات فائقة، يُسقط البحث العشوائي n قيمة مميزة على كل محور. يُسقط البحث الشبكي بنفس الميزانية ⌊n^(1/d)⌋ قيمة مميزة فقط لكل محور — أقل بكثير حين يكون d كبيرًا.

التحسين البايزي (Bayesian Optimization)

كل من البحث الشبكي والعشوائي غير مُوجَّهَيْن — كل تجربة تتجاهل ما كشفته التجارب السابقة. التحسين البايزي يبني نموذجًا احتماليًّا بديلًا (عادةً عملية غاوسية أو مُقدِّر باروسي الشجرة) للدالة الهدف ويستخدمه لاختيار التهيئة التالية التي توازن بين الاستغلال (التجربة بالقرب من أفضل نتيجة حالية) والاستكشاف (المناطق غير المؤكدة).

هذا أكثر كفاءةً في استخدام العينات من البحث العشوائي بكثير حين تكون كل تقييم مكلفًا (مثل تدريب شبكة عصبية عميقة يستغرق ساعات). المكتبات: Optuna، Hyperopt، scikit-optimize. قاعدة إبهام: استخدم التحسين البايزي حين لديك ≤50 تجربة لإنفاقها.

الطريقةالأنسب لـالميزة الرئيسيةالقيد الرئيسي
البحث الشبكي ≤3 معاملات، شبكات صغيرة، قابلية الاستنساخ شامل — يجد الأفضل على الشبكة تكلفة أسّية مع الأبعاد
البحث العشوائي معاملات كثيرة، ميزانية محدودة تغطية أفضل للأبعاد المهمة غير موجّه — يتجاهل النتائج السابقة
التحسين البايزي تقييمات مكلفة، تجارب محدودة الأكثر كفاءةً في استخدام العينات عبء ضبط نموذج الاستبدال

أساليب المجموعات

لا يجب أن ينتهي اختيار النموذج بفائز واحد. المجموعات تدمج تنبؤات نماذج متعددة وتتفوق دائمًا تقريبًا على أي نموذج منفرد — بتكلفة التعقيد الإضافي ووقت الاستدلال.

التصويت والمتوسط

أبسط مجموعة: درّب عدة نماذج متنوعة بشكل مستقل وخذ متوسط تنبؤاتها (للانحدار) أو التصويت بالأغلبية (للتصنيف). يعمل بشكل أفضل حين تُقدِّم النماذج الأساسية أنواعًا مختلفة من الأخطاء — التنوع هو المكوّن الرئيسي. استخدم نماذج مدرَّبة بخوارزميات مختلفة، أو مجموعات فرعية مختلفة من الميزات، أو بذور عشوائية مختلفة.

التكديس (Stacking)

درّب مجموعة من المتعلمين الأساسيين على بيانات التدريب. ثم درّب متعلمًا تلويًّا (في الغالب نموذج بسيط مثل الانحدار اللوجستي أو نموذج خطي) على تنبؤات المتعلمين الأساسيين خارج الطيّة. يتعلم المتعلم التلوي كيفية الجمع الأمثل بين التنبؤات الأساسية.

قاعدة مكافحة تسرب البيانات في التكديس

لا تُغذِّ المتعلم التلوي أبدًا تنبؤات من نماذج أساسية رأت نفس الصفوف أثناء التدريب. استخدم تنبؤات خارج الطيّة (OOF): لكل طيّة، درّب النموذج الأساسي على الطيّات الأخرى، ثم تنبّأ على الطيّة المحجوزة. هذا يُعطي مجموعة نظيفة من التنبؤات يستطيع المتعلم التلوي التعلم منها بأمان.

المزج (Blending)

نسخة أبسط من التكديس: احجز مجموعة مزج ثابتة (مثلًا 20% من بيانات التدريب)، ودرّب النماذج الأساسية على الـ80% المتبقية، وتنبّأ على مجموعة المزج، وادرّب المتعلم التلوي على تلك التنبؤات. أقل تكلفةً حوسبيًّا من التكديس لكنه يُضيّع بعض بيانات التدريب.

Voting / Averaging
أبسط مجموعة
متوسط التنبؤات أو التصويت بالأغلبية. التنوع بين النماذج الأساسية أساسي.
Stacking
دمج مُتعلَّم
متعلم تلوي مدرَّب على تنبؤات OOF. أقوى لكن أكثر تعقيدًا.
Blending
تكديس مبسّط
متعلم تلوي مدرَّب على مجموعة محجوزة ثابتة. أسرع لكنه يُضيّع البيانات.
Bagging
تقليل التباين
عينات Bootstrap + متوسط. الغابات العشوائية هي المثال النموذجي.

AutoML

أدوات تعلم الآلة الآلي (AutoML) تُؤتمت خط الأنابيب الكامل: معالجة الميزات المسبقة، واختيار النموذج، وضبط المعاملات الفائقة، والتجميع. تُديمقراطية تعلم الآلة بتقليل الخبرة المطلوبة — لكن فهم ما تفعله لا يزال ضروريًّا لتشخيص الأعطال والنشر الموثوق.

أدوات شائعة ومجالات تركيزها:

متى تستخدم AutoML

يتفوق AutoML في إنشاء خط أساسي قوي بسرعة وفي إيجاد خطوط أنابيب جيدة حين تكون الخبرة في المجال محدودة. يُعاني في فهم القيود التجارية (الكمون، حجم النموذج، قابلية التفسير) وفي تصحيح مشكلات جودة البيانات. استخدمه كنقطة بداية ومعيار مرجعي — لا كبديل لفهم بياناتك.

تجميع الأمور: سير عمل الضبط

عملية موثوقة لاختيار النموذج وضبطه:

  1. حدّد مقياسك — ماذا تُحسِّن بالضبط؟ الدقة؟ AUC-ROC؟ RMSE؟ المقياس التجاري؟ المقاييس غير المتوافقة تُؤدي إلى نماذج غير متوافقة.
  2. اضبط التحقق المتقاطع — اختر استراتيجية CV الصحيحة لنوع بياناتك. لا تستخدم مجموعة الاختبار أبدًا أثناء البحث.
  3. خط أساسي تافه — التنبؤ بالمتوسط، أو الفئة الأكثر شيوعًا. يجب أن يتفوق أي نموذج على هذا.
  4. قارن عائلات الخوارزميات — شغّل 3–4 خوارزميات مرشّحة بمعاملات افتراضية. اختر أفضل 1–2.
  5. بحث خشن — بحث عشوائي بنطاقات واسعة لتحديد أهم المعاملات ومناطقها الأمثل التقريبية.
  6. بحث دقيق — بحث شبكي أو تحسين بايزي في المنطقة المُضيَّقة.
  7. مجموعة — ادمج أفضل النماذج إن كان التعقيد الإضافي يستحق لحالة استخدامك.
  8. تقييم نهائي — قيّم على مجموعة الاختبار مرة واحدة بالضبط. أي تغييرات إضافية تُبطل هذا التقدير.

الخلاصة الرئيسية

لا يوجد خوارزمية تفوز على جميع المسائل — قارن دائمًا تجريبيًّا. استخدم التحقق المتقاطع المناسب لنوع بياناتك (طبقي للتصنيف، تقسيم سلسلة زمنية للتسلسلات، تقسيم مجموعة للبيانات المجمّعة). للبحث عن المعاملات الفائقة: بحث شبكي للفضاءات الصغيرة، وبحث عشوائي لمعاملات كثيرة، وتحسين بايزي حين تكون التقييمات مكلفة. المجموعات (التصويت، التكديس، المزج) تُحسِّن الأداء دائمًا تقريبًا بتكلفة التعقيد. AutoML أداة أساسية قوية — افهم ما تفعله قبل أن تثق بها.

السابق الوحدة 10-الدرس 1: هندسة الميزات نظرة عامة على الوحدة الدرس التالي الوحدة 10-الدرس 3: خط أنابيب ML