ML 101
M14 · L04
الوحدة 14

طرق السياسة

درّب تعلّم القيمة Q قيمًا ثم قرأ سياسةً منها. كانت السياسة ناتجًا ثانويًا. هذا الدرس يدرّب السياسة نفسها — وينتهي بأين يُستخدم التعلّم المعزَّز فعلًا، وأين لا يُستخدم.

01 / 13
ML 101
M14 · L04
حين تخسر القيم

تعلّم السياسة مباشرة

  • الأفعال المتصلة — maxa Q على زاوية توجيه هو تحسين بنفسه، داخل كل تحديث
  • الأمثلية العشوائية — أفضل سياسة في حجر-ورقة-مقص عشوائية؛ وargmax لا تقول ذلك
  • النعومة — تغيّر قيمة ضئيل يقلب argmax؛ أما الاحتمالات فتتحرك بلطف
02 / 13
ML 101
M14 · L04
المبرهنة

تدرّج السياسة

اجعل الأفعال الجيدة أكثر احتمالًا، بنسبة جودتها. ولاحظ الغائب: لا حدّ يفاضل البيئة، فيبقى هذا خاليًا من النموذج. وهذه هي الصيغة غير المخصومة — فمع الخصم يحمل الحدُّ عند الخطوة t وزنًا مقداره γt، وهو ما يُسقَط عمليًا. ساتون وبارتو (2018)، فصل تدرّج السياسة.

تدرّج السياسة
\nabla_{\theta} J(\theta) = \mathbb{E}_{\pi_{\theta}}\left[ \nabla_{\theta} \log \pi_{\theta}(a \mid s) \, Q^{\pi}(s,a) \right]
03 / 13
ML 101
M14 · L04
ويليامز، 1992

REINFORCE

أبسط تمثيل. العب حلقة؛ واستخدم العائد Gt الذي تبع كل خطوة فعلًا بدلًا من Q. صعود تدرّجي — الإشارة موجَبة، لأن المكافأة تُعظَّم لا الخسارة تُصغَّر.

REINFORCE
\theta \leftarrow \theta + \alpha \, G_t \, \nabla_{\theta} \log \pi_{\theta}(A_t \mid S_t)
04 / 13
ML 101
M14 · L04
المأزق

غير متحيزة، ومشوّشة بلا حدّ

تجمع Gt كل مكافأة بعد الفعل، فتمتصّ كل حادث عشوائي تبعه. فعلان متطابقان قد يسحبان عائدين مختلفين جذريًا — أحدهما يُعزَّز بقوة والآخر يُثبَّط بقوة.

وعيب ثانٍ
إذا كانت كل مكافأة موجَبة، فكل فعل أُخذ يومًا يُعزَّز. ولا يحدث التعلّم إلا لأن الجيدة تُعزَّز بقوة أكبر.
05 / 13
ML 101
M14 · L04
الحل

خطوط الأساس والأفضلية

اطرح أي شيء يعتمد على الحالة لا على الفعل: يبقى التدرّج غير متحيز، ويهبط التباين. استخدم V(s) وتحصل على الأفضلية — فتصير الدرجات المطلقة نسبية.

الأفضلية
A^{\pi}(s,a) = Q^{\pi}(s,a) - V^{\pi}(s)
06 / 13
ML 101
M14 · L04
شبكتان

الفاعل والناقد

الفاعل هو السياسة ويتبع تدرّج السياسة. والناقد يقدّر V(s) بانحدار فرق زمني عادي — استنهاض الدرس 14.3، مُعادًا استخدامه. ومع ناقد تصبح الأفضلية خطأ الفرق الزمني، فلا حاجة إلى حلقة منتهية.

REINFORCE
غير متحيزة، مشوّشة
الفاعل-الناقد
متحيّز، عملي
07 / 13
ML 101
M14 · L04
شولمان وآخرون، 2017

الدالة الهدف المقصوصة لـPPO

خطوة واحدة مفرطة الحجم تُخرّب السياسة — والسياسة تولّد البيانات، فلا تستطيع التعافي. يقصّ PPO نسبة الاحتمال rt(θ) في [1−ε، 1+ε]. ولأنه يأخذ الأصغر، يستوي عائد الدفع أكثر.

الدالة الهدف المقصوصة
L^{\text{CLIP}}(\theta) = \mathbb{E}_t\!\left[ \min\!\left( r_t \hat{A}_t, ; \text{clip}(r_t, 1-\epsilon, 1+\epsilon)\hat{A}_t \right) \right]
08 / 13
ML 101
M14 · L04
لماذا صار افتراضيًا

مُمِلّ، ويعمل

  • الرتبة الأولى فقط — طرق منطقة الثقة الأسبق احتاجت معلومات انحناء؛ وقصٌّ وأصغر يعطيان أثرًا مقاربًا
  • وسائط فائقة قليلة — مدى قصّ، ومعدل تعلّم، وعدد دورات
  • إعادة استخدام البيانات — القصّ هو ما يجعل عدة دورات على حزمة واحدة آمنة
  • الخصائص التي دعا إليها شولمان وآخرون — وأوضحُ مكان يلتقي فيه معظم الناس به هو RLHF (الشريحة التالية)
  • ملاحظة: ε هذه مدى قصّ، لا علاقة لها بإبسيلون الاستكشاف
09 / 13
ML 101
M14 · L04
الدرس 9.3، كما ينبغي

RLHF

لا توجد دالة مكافأة لـ«جواب مفيد»، لذا تُتعلَّم. أرسى كريستيانو وآخرون (2017) هذا؛ وطبّقه أويانغ وآخرون (2022) على نماذج اللغة.

  • بيانات التفضيل — البشر يرتّبون الأزواج، لا يمنحونها درجات
  • نموذج المكافأة — ملاءمة مُشرَفة على تلك الترتيبات
  • ضبط دقيق بـPPO — مع عقوبة على الانحراف عن النموذج الأصلي
10 / 13
ML 101
M14 · L04
قُلها صريحةً

حدود صريحة

  • عدم كفاءة العيّنات — ملايين الحلقات لمهام يتعلمها الإنسان في دقائق
  • تحديد المكافأة — الوكيل يُحسّن ما كتبتَه، لا ما قصدتَه
  • المحاكاة إلى الواقع — السياسة المدرَّبة في محاكٍ تعلّمت المحاكي، بأخطائه
  • قابلية إعادة الإنتاج — بذور مختلفة، منحنيات مختلفة جدًا. تشغيل واحد ليس دليلًا
11 / 13
ML 101
اختبار سريع

تحقّق ممّا ثبت

أربعة أسئلة من هذا الدرس. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت. ولا شيء يُسجَّل أو يُحفَظ.

السؤال 1 من 0
النتيجة 0/0

12 / 13
ML 101
ملخص
مراجعة

إلى أين يمضي هذا

طرق السياسة تدرّب πθ مباشرة، وهو ما لا تستطيعه القيم مع الأفعال المتصلة أو العشوائية فعلًا. REINFORCE غير متحيزة ومشوّشة؛ وخط الأساس يعطي الأفضلية؛ والناقد يجعل التحديثات بخطوة واحدة ممكنة؛ وPPO يقصّ الخطوة لينجو التشغيل. وRLHF هو تلك الطبقات كلها موجَّهةً إلى التفضيل البشري. وإذا كانت لديك أمثلة مُسمّاة للسلوك الصحيح، فاستخدم التعلّم المُشرَف بدلًا منه.

اكتملت الوحدة 14
وصلت إلى نهاية دورة ML 101
13 / 13