ML 101
M06 · L04
الوحدة السادسة

تدريب الشبكات العصبية

الانتشار الخلفي يمنحك التدرجات. الآن تأتي الحِرفة: اختيار الخسارة الصحيحة، والمحسِّن الصحيح، ومعدل التعلم الصحيح، والتنظيم الصحيح لجعل هذه التدرجات تُحدث فارقًا.

1 / 13
ML 101
M06 · L04
دوال الخسارة

ماذا نُقلِّل؟

دالة الخسارة هي الرقم الوحيد الذي يسعى التدريب لتقليله. يجب أن يتطابق اختيارها مع المهمة: MSE للانحدار، والإنتروبيا المتقاطعة للتصنيف. استخدام خسارة خاطئة يُفضي إلى مشكلات تدرج خفية تُعيق التعلم.

الانحدار
MSE / MAE
التصنيف
إنتروبيا متقاطعة
2 / 13
ML 101
M06 · L04
خسارة الانحدار

متوسط مربع الخطأ

يُعاقب MSE الأخطاء الكبيرة تربيعيًا. في مهام التصنيف يُسبِّب مشكلة التشبع — تتجنب الإنتروبيا المتقاطعة هذا بإنتاج تدرج يتناسب دائمًا مع خطأ التنبؤ.

MSE والإنتروبيا المتقاطعة
\mathcal{L}_{\text{MSE}}=\tfrac{1}{n}\sum(\hat{y}_i-y_i)^2 \qquad \mathcal{L}_{\text{CE}}=-\log\hat{p}_{\text{true}}
3 / 13
ML 101
M06 · L04
المحسِّنات

النزول العشوائي على التدرج

أبسط المحسِّنات: اطرح جزءًا η من التدرج من كل وزن. فعّال لكنه بطيء على سطوح الخسارة سيئة التكييف — يتأرجح عبر المنحدرات الحادة بدلًا من التحرك على طولها.

تحديث SGD
w \leftarrow w - \eta\,\nabla_w L(w)
4 / 13
ML 101
M06 · L04
المحسِّنات الحديثة

Adam وAdamW

يتتبع Adam المتوسطات المتحركة للتدرجات (الزخم) ومربعاتها (التباين). التدرجات الكبيرة المتسقة تحصل على خطوة أصغر؛ الصغيرة المتشعشعة تحصل على خطوة أكبر. يفصل AdamW تراجع الأوزان لكي يعمل التنظيم كما ينبغي.

الإعدادات الافتراضية
β1=0.9, β2=0.999, ε=10−8
5 / 13
ML 101
M06 · L04
معدل التعلم

الجداول والإحماء

معدل تعلم ثابت نادرًا ما يكون مثاليًا. ابدأ كبيرًا للتقارب السريع، واختتم صغيرًا للضبط الدقيق. يتبع التبريد بالجيب التمام منحنى نصف جيب تمام. الإحماء يرفع المعدل خطيًا خلال المئات الأولى من الخطوات — وهو أمر حاسم مع Adam.

التبريد بالجيب التمام
\eta_t = \eta_{\min}+\tfrac{1}{2}(\eta_{\max}-\eta_{\min})\!\left(1+\cos\!\frac{t\pi}{T}\right)
6 / 13
ML 101
M06 · L04
حجم الدُّفعة

كبير أم صغير؟

  • دُفعات كبيرة — استخدام فعّال للـ GPU وتدرجات دقيقة، لكنها تخاطر بالحدود الحادة التي تُعمِّم بشكل ضعيف
  • دُفعات صغيرة — تدرجات أكثر ضجيجًا تهرب من الحدود الحادة وتجد حدودًا مسطحة قابلة للتعميم
  • قاعدة التحجيم الخطي — اضرب معدل التعلم في k عند مضاعفة حجم الدفعة k مرة
7 / 13
ML 101
M06 · L04
التنظيم

التسرب: الضجيج دفاعًا

أصفر كل خلية عصبية باحتمال p أثناء التدريب. يُضرَّب في 1/(1−p) للحفاظ على متوسط التنشيط. يمنع التعاون الضار. وقت الاختبار تكون جميع الخلايا نشطة — تتصرف الشبكة كمتوسط لعدد كبير من الشبكات الفرعية.

معدل نموذجي
p = 0.1–0.5
الاستنتاج
مُعطَّل
8 / 13
ML 101
M06 · L04
الاستقرار

تطبيع الدُّفعة

طبِّع التنشيطات السابقة لكل طبقة عبر الدفعة الصغيرة لتكون بمتوسط صفر وتباين وحدي. ثم طبِّق مقياسًا قابلًا للتعلم γ وإزاحة β. يُزيل انزياح التغاير الداخلي، ويسمح بمعدلات تعلم أعلى، ويعمل كتنظيم خفيف.

تطبيع الدفعة
\hat{x}=\frac{x-\mu_B}{\sqrt{\sigma_B^2+\epsilon}}\quad y=\gamma\hat{x}+\beta
9 / 13
ML 101
M06 · L04
الجمع معًا

الوصفة الافتراضية

  • الخسارة: إنتروبيا متقاطعة (تصنيف) أو MSE (انحدار)
  • المحسِّن: AdamW، β1=0.9، β2=0.999، تراجع الأوزان 0.01–0.1
  • معدل التعلم: تبريد بالجيب التمام مع إحماء خطي (5–10% من الخطوات)
  • الدفعة: 32–256؛ قياس معدل التعلم بالتناسب
  • التنظيم: تسرب + تطبيع الدفعة + تراجع الأوزان
10 / 13
ML 101
اختبار سريع

تحقّق ممّاترسّخ

أربعة أسئلة عن حِرفة التدريب — اختيار الخسارة، وخطوة SGD، وحجم الدفعة، والتسرب.

السؤال 1 من 0
النتيجة 0/0

11 / 13
ML 101
M06 · L04
ممارسة الضبط

الاستئصال المنهجي

الوصفة نقطة بداية، لا معادلة جاهزة. غيِّر مكونًا واحدًا في المرة مع تثبيت الباقي. مجموعات البيانات الكبيرة تتحمل تنظيمًا أقل؛ النماذج الكبيرة غالبًا تحتاج أكثر. المنهج العلمي مُطبَّق على المعاملات الفائقة.

قاعدة إبهام
غيِّر شيئًا واحدًا في المرة وقس أثره على خسارة التحقق
12 / 13
ML 101
ملخص
مراجعة

ما تعلّمته

يجب أن تتطابق الخسارة مع المهمة. SGD هو الأساس؛ Adam يُكيِّف معدلات لكل معامل؛ AdamW يُصلح تراجع الأوزان. يُحسِّن التبريد بالجيب التمام مع الإحماء الأداء النهائي. الدفعات الصغيرة تُعمِّم أفضل. التسرب وتطبيع الدفعة يُنظِّمان ويُستقِرّان. استئصل بمنهجية لفهم كل قطعة.

اكتملت الوحدة
الوحدة السابعة: التنظيم ←
13 / 13