قراءة
وضع القصص

طرق السياسة وأين يكون التعلّم المعزَّز حقيقيًا

~٢٤ دقيقة قراءة الدرس 4 من 4 في الوحدة 14

تجاوز جدول القيم

تعلّم الدرس 14.3 قيم الأفعال ثم قرأ سياسةً منها: في كل حالة، خُذ الفعل ذا أعلى قيمة Q. ولم تُدرَّب السياسة قطّ — كانت ناتجًا ثانويًا. وهذا الدرس يدرّب السياسة نفسها.

السياسة ذات المعاملات πθ(a | s) هي دالة بأوزان θ تأخذ حالة وتُخرج احتمالًا لكل فعل، أو معاملات توزيع على الأفعال. ثم تُعدّل θ لتجعل الأفعال الجيدة أكثر احتمالًا. لا جدول Q، ولا argmax، ولا إبسيلون. وكتاب ساتون وبارتو Reinforcement Learning: An Introduction (الطبعة الثانية، 2018) يخصّص فصل تدرّج السياسة لهذا الانتقال بالضبط، وهو المرجع المعياري للمادة أدناه.

ثلاثة أوضاع تجعل هذا أفضل بوضوح من تعلّم القيم.

الأفعال المتصلة. على وكيل تعلّم القيمة Q أن يحسب maxa Q(s, a). فإذا كان الفعل زاوية توجيه أو عزمًا على مِفصل — عددًا حقيقيًا، أو متجهًا من أربعين منها — فذلك التعظيم هو بنفسه مسألة تحسين، تُحلّ داخل كل تحديث على حِدة. أما شبكة السياسة فتتجنّبه كليًا: هي تُخرج الفعل، أو متوسط توزيع على الأفعال وانتشاره.

السياسات المثلى العشوائية. السياسات الجشعة على القيم حتمية بحكم البناء. وأحيانًا لا تكون السياسة المثلى حتمية فعلًا. في لعبة مثل حجر-ورقة-مقص، أي سياسة حتمية قابلة للاستغلال والسياسة المثلى عشوائية منتظمة. وفي بيئة مرصودة جزئيًا تبدو فيها حالتان مختلفتان متطابقتين، فالعشوائية هي أفضل ما تستطيع. والسياسة التي تُخرج احتمالات تستطيع تمثيل هذا؛ وargmax لا تستطيع.

النعومة. تغيّر ضئيل في قيمة Q قد يقلب argmax فيغيّر السياسة بشكل غير متصل. أما تدرّج السياسة فيزيح احتمالات الأفعال قليلًا في كل مرة، وهو أسهل في التثبيت.

فكرة تدرّج السياسة

الدالة الهدف J(θ) هي العائد المتوقع تحت السياسة — أي مقدار المكافأة التي يجمعها الوكيل في المتوسط إذا تصرّف وفق πθ. ونريد زيادتها، فنريد تدرّجها بالنسبة إلى θ. والعقبة أن θ لا تؤثر في العائد إلا بتغيير المسارات التي تحدث، وإسهام البيئة في ذلك مجهول. ومبرهنة تدرّج السياسة هي ما يجعل التدرّج قابلًا للحساب رغم ذلك.

تدرّج السياسة
\nabla_{\theta} J(\theta) = \mathbb{E}_{\pi_{\theta}}\left[ \nabla_{\theta} \log \pi_{\theta}(a \mid s) \, Q^{\pi}(s,a) \right]
تدرّج العائد المتوقع هو توقّع لشيء يستطيع الوكيل حسابه فعلًا: تدرّج لوغاريتم احتمال الفعل الذي أخذه، مرجَّحًا بمدى جودة ذلك الفعل. والأهم أن لا حدّ فيه يفاضل البيئة — فديناميكيات الانتقال لا تظهر، إذن هذا خالٍ من النموذج بالمعنى نفسه الذي كان عليه الدرس 14.3. وهذه هي الصيغة غير المخصومة؛ ففي الإعداد الحلقي المخصوم يرجّح التدرّجُ الدقيقُ الحدَّ عند الخطوة t بالعامل γt، وهو عامل تُسقطه عمليًا كل التطبيقات تقريبًا (سوتون وبارتو، 2018).

تستحق صورة ذلك التعبير وقفة، لأنها تفسّر كل خوارزمية في باقي هذا الدرس. فـ∇θ log πθ(a | s) هي الاتجاه في فضاء الأوزان الذي يجعل الفعل a أكثر احتمالًا في الحالة s. وضربه في Qπ(s, a) يقيس ذلك الاتجاه بمدى جودة الفعل. اجمع على الخبرة وتحصل على: اجعل الأفعال الجيدة أكثر احتمالًا، بنسبة جودتها. ولأنه توقّع، فيمكن تقديره بالمعاينة — شغّل السياسة وخُذ المتوسط.

REINFORCE ومشكلة التباين فيها

أعطى ويليامز (1992) أبسط تمثيل لها. العب حلقة كاملة، ولكل خطوة استخدم العائد الفعلي الذي تبعها — سمّه Gt — بدلًا من Qπ(s, a). العائد حدث فعلًا، فهو عيّنة غير متحيزة لقيمة الفعل.

تحديث REINFORCE
\theta \leftarrow \theta + \alpha \, G_t \, \nabla_{\theta} \log \pi_{\theta}(A_t \mid S_t)
صعود تدرّجي، لا نزول — الإشارة موجَبة لأن الهدف مكافأة تُعظَّم لا خسارة تُصغَّر. فإذا سارت الحلقة جيدًا كانت Gt كبيرة وموجَبة وعُزّز كل فعل أُخذ على الطريق. ولاحظ أن الخوارزمية كلها تحتاج حلقة منتهية، فهي بخلاف طرق الفرق الزمني في الدرس 14.3 لا تستطيع التعلّم من خطوة واحدة.

REINFORCE غير متحيزة، وهي عمليًا مشوّشة إلى حدّ يجعلها غير قابلة للاستخدام في الغالب. والمشكلة هي التباين. فـGt هي مجموع كل مكافأة في بقية الحلقة، فتمتصّ كل حادث عشوائي وقع بعد الفعل — تشويش البيئة، وكل اختيار لاحق اتخذته السياسة العشوائية. فيمكن أن يتبع فعلين متطابقين في حالتين متطابقتين عائدان مختلفان بشكل جذري، فيُعزَّز أحدهما بقوة ويُثبَّط الآخر بقوة. تقدير التدرّج يشير في الاتجاه الصحيح تقريبًا في المتوسط، لكن أي تقدير منفرد قد يشير إلى أي مكان تقريبًا، وتخفيض ذلك بالمتوسط يستلزم عددًا هائلًا من الحلقات.

وهناك عيب ثانٍ أدقّ. افترض أن كل مكافأة في مهمة ما موجَبة — مثلًا كل فعل يكسب بين +1 و+10. إذن Gt موجَبة دائمًا، فيُعزَّز كل فعل أُخذ يومًا، بما فيه السيئ. ولا يحدث التعلّم إلا لأن الأفعال الجيدة تُعزَّز بقوة أكبر. وهذه طريقة مُهدِرة لاستخدام إشارة تدرّج، وهي ما تعالجه الفكرة التالية.

خطوط الأساس والأفضلية

اطرح خطّ أساس b(s) من العائد قبل استخدامه: استبدل Gt بـGt − b(St). فطالما اعتمد خط الأساس على الحالة فقط لا على الفعل، يبقى التدرّج غير متحيز — يُثبت ذلك ساتون وبارتو، والسبب أن الحدّ الزائد يجمع إلى صفر عند الجمع على الأفعال. لكنه قد يقلّص التباين بشكل كبير، لأن الكمية التي تضرب لوغاريتم الاحتمال صارت مقارنةً لا درجةً مطلقة.

وخط الأساس الطبيعي هو قيمة الحالة Vπ(s) — أي مدى ما توقّع الوكيل تحقيقه من تلك الحالة تحت سياسته الحالية. وطرحها يُنتج الأفضلية.

دالة الأفضلية
A^{\pi}(s,a) = Q^{\pi}(s,a) - V^{\pi}(s)
كم كان هذا الفعل أفضل من قيمة الحالة في المتوسط. الأفضلية الموجَبة تعني أن الفعل تجاوز التوقعات وينبغي أن يصبح أكثر احتمالًا؛ والسالبة تعني أنه أقلّ منها وينبغي أن يصبح أقل احتمالًا. وفي حالة تؤدي فيها كل الأفعال إلى نتيجة جيدة، تكون كل الأفضليات قرب الصفر وتُترك السياسة وشأنها كما يجب — وهذا بالضبط ما لم يستطع عائد غير معدَّل التعبير عنه.

وهذا يتخلّص أيضًا من مشكلة المكافآت الموجَبة كلها. ففي مهمة يكسب فيها كل فعل بين +1 و+10، فعلٌ بمكافأة +2 في حالة قيمتها +6 له أفضلية −4 فيصبح أقل احتمالًا. الدرجات المطلقة صارت نسبية.

الفاعل والناقد

تحتاج الأفضلية إلى Vπ(s)، ولا أحد يعرفها. إذن تعلّمها هي أيضًا. درّب شبكتين جنبًا إلى جنب:

شبكتان، وظيفتان

الفاعل (actor) هو السياسة πθ(a | s). يختار الأفعال، ويُحدَّث في اتجاه تدرّج السياسة، مقيسًا بالأفضلية التي يبلّغ عنها الناقد.

الناقد (critic) يقدّر V(s). ويُحدَّث بانحدار فرق زمني عادي — فكرة الاستنهاض بخطوة واحدة نفسها من الدرس 14.3، بتصغير مربّع خطأ الفرق الزمني لا دالة هدف سياسة.

والناقد يشتري أكثر من تقليل التباين. فلأنه يستطيع تقدير قيمة الحالة التالية، يمكن تقريب الأفضلية من انتقال واحد: Rt+1 + γV(St+1) − V(St) — وهذا هو خطأ الفرق الزمني مرة أخرى. فطرق الفاعل والناقد، بخلاف REINFORCE، لا تحتاج حلقة منتهية. وهذا يجعلها قابلة للتطبيق على مهام مستمرة بلا حدّ حلقة على الإطلاق.

والكلفة هي التحيّز. فتقدير الناقد لـV خاطئ، خصوصًا في بداية التدريب، فالأفضلية التي يبلّغ عنها خاطئة، فالتدرّج متحيّز. كانت REINFORCE غير متحيزة ومشوّشة إلى حدّ مستحيل؛ والفاعل-الناقد متحيّز وقابل للعمل. وكل طريقة تدرّج سياسة عملية تقع في مكان ما على هذه المفاضلة، والمقبض الذي يحدّد موقعها هو عدد خطوات المكافأة الحقيقية التي تستخدمها قبل أن تسلّم الأمر إلى تقدير الناقد.

PPO: لماذا صار الخيار الافتراضي

لطرق تدرّج السياسة هشاشة محددة. فالتدرّج يخبرك باتجاه لا بمقدار المسافة، وتحديث واحد مفرط الحجم قد يُخرّب السياسة. وهذا أسوأ مما يبدو: فالسياسة هي أيضًا ما يولّد البيانات. والسياسة المخرَّبة تجمع خبرة رديئة لا تستطيع التعافي منها، فقد تنهي خطوة سيئة واحدة التشغيل كله.

اقترح شولمان وآخرون (2017) تحسين السياسة القريب (Proximal Policy Optimization، أو PPO)، الذي يعالج هذا برفض السماح للسياسة بالانتقال بعيدًا عن السياسة التي جمعت البيانات. فهو يعرّف نسبة احتمال — كم تجعل السياسة الجديدة الفعل أكثر احتمالًا مما جعلته القديمة — ويقصّها.

نسبة الاحتمال
r_t(\theta) = \frac{\pi_{\theta}(a_t \mid s_t)}{\pi_{\theta_{\text{old}}}(a_t \mid s_t)}
تساوي 1 عندما تتفق السياسة المحدَّثة مع السياسة التي جمعت البيانات. وفوق 1 تعني أن الفعل صار أكثر احتمالًا؛ ودون 1 أقل احتمالًا. والنسبة هي مقياس مدى ما انتقله التحديث، معبَّرًا عنه بالوحدات الوحيدة المهمة هنا — احتمالات الأفعال.
الدالة الهدف المقصوصة
L^{\text{CLIP}}(\theta) = \mathbb{E}_t\!\left[ \min\!\left( r_t(\theta)\hat{A}_t, \; \text{clip}\!\left(r_t(\theta),\, 1-\epsilon,\, 1+\epsilon\right)\hat{A}_t \right) \right]
خُذ الأصغر من الدالة الهدف غير المقصوصة ونسخة تُحصر نسبتها في [1 − ε، 1 + ε]، وε شائعة حول 0.1 إلى 0.2. ولأنه الأصغر، تتوقف الدالة الهدف عن مكافأة التحديث بمجرد أن تخرج النسبة من منطقة الثقة — فيستوي التدرّج ولا يبقى حافز للدفع أكثر. ولاحظ أن ε هنا مدى قصّ ولا علاقة لها بإبسيلون الاستكشاف في الدرس 14.3.

فلماذا صار خيارًا افتراضيًا شائعًا؟ ليس لأنه الخيار الأكثر تطورًا، بل بسبب الخصائص العملية التي سعى شولمان وآخرون إلى تحقيقها — الخصائص التي تهم عندما يكون عليك أن تُنجح شيئًا:

ما جعل PPO الافتراضي

استقرار بلا آلات ثقيلة. طرق منطقة الثقة الأسبق فرضت قيدًا مشابهًا لكنها احتاجت معلومات من الرتبة الثانية عن انحناء الدالة الهدف. أما PPO فيحصل على أثر مقارب من قصّ وأصغر، مستخدمًا تدرّجات من الرتبة الأولى فقط — فيندرج في أي إطار تفاضل تلقائي قياسي.

وسائط فائقة قليلة، وقيم افتراضية متسامحة. مدى قصّ، ومعدل تعلّم، وعدد دورات. والطرق التي تحتاج عشرة إعدادات مضبوطة بعناية لا تنجو من الاصطدام بمسائل جديدة.

إعادة استخدام البيانات. القصّ هو ما يجعل أخذ عدة دورات تدرّج على حزمة الخبرة المجمّعة نفسها آمنًا، وهذا مهم حين يكون التفاعل مع البيئة هو الجزء المكلف.

ومكانته كخيار افتراضي أوضحُ ما تكون في مسار RLHF أدناه، حيث يستخدم عمل InstructGPT (أويانغ وآخرون، 2022) خوارزمية PPO لضبط نموذج لغوي ضبطًا دقيقًا من التغذية الراجعة البشرية — وهو الإعداد الذي يلتقي فيه معظم الممارسين بها الآن.

RLHF: حيث يلتقي معظم الناس بالتعلّم المعزَّز فعلًا

قدّم الدرس 9.3 التعلّم المعزَّز من التغذية الراجعة البشرية كالخطوة التي حوّلت متنبئًا بالكلمة التالية إلى مساعد. ومع تدرّجات السياسة بين يديك، يمكن بيان الآلية كما ينبغي. فالعقبة التي يحلّها RLHF هي أنه لا توجد دالة مكافأة لـ«جواب مفيد». لا تستطيع كتابتها، والتعلّم المعزَّز يحتاج واحدة. لذا تُتعلَّم دالة المكافأة من مقارنات بشرية.

أرسى كريستيانو وآخرون (2017) هذا النهج، فدرّبوا عوامل من تفضيلات بشرية بين أزواج من مقاطع السلوك بدلًا من مكافأة مكتوبة يدويًا. وطبّق أويانغ وآخرون (2022)، أي ورقة InstructGPT، البنية نفسها على نماذج اللغة. ثلاث مراحل:

بيانات التفضيل ← نموذج المكافأة ← PPO

1. بيانات التفضيل. عايِن عدة استجابات للمُوجِّه نفسه واسأل مُعلِّقين بشريين أيّها يفضّلون. ولاحظ ما يُجمَع: ترتيب، لا درجة. فالناس أكثر اتساقًا بكثير في قول أيّ الجوابين أفضل من وضع رقم على أيٍّ منهما.

2. نموذج المكافأة. درّب نموذجًا ليتنبأ بتلك التفضيلات — يأخذ مُوجِّهًا واستجابةً ويُخرج قيمة عددية، مُلائَمةً بحيث تحصل الاستجابات المفضّلة على درجة أعلى. هذا تعلّم مُشرَف عادي، وهو يحوّل كومًا من الأحكام البشرية إلى دالة المكافأة التي يطلبها التعلّم المعزَّز.

3. الضبط الدقيق بـPPO. الآن صارت مسألة تدرّج سياسة: السياسة هي نموذج اللغة، والفعل هو إصدار وحدة لغوية، والمكافأة تأتي من نموذج المكافأة. يُحسّنها PPO، مع عقوبة على الانحراف بعيدًا عن النموذج الأصلي — وهي التي تمنع نموذج اللغة من الانهيار إلى أي نصّ متآكل يصادف أن يبالغ نموذج المكافأة في تقديره.

تستحق عقوبة المرحلة الثالثة تلك انتباهًا، لأنها مشكلة قرصنة المكافأة من الدرس 14.1 وهي تصل إلى الإنتاج. فنموذج المكافأة بديل ناقص عن الحكم البشري، والسياسة التي تُحسَّن بقوة كافية بمواجهته ستجد أخطاءه بدلًا من أن ترضي البشر الذين لُوئم عليهم. والقيد هو ما يُبقي التحسين نزيهًا. ودورة GenAI-101 تغطي هذا المسار من جهة نموذج اللغة؛ أما التعلّم المعزَّز الذي في داخله فهو مادة هذا الدرس.

حدود صريحة

أنتج التعلّم المعزَّز نتائج مذهلة فعلًا، وهو في الوقت نفسه أقلّ أدوات هذه الدورة موثوقية. وأربعة حدود تستحق البيان الصريح، لأن النجاحات المنشورة لا تُعلن عنها عادةً.

عدم كفاءة العيّنات. تحتاج عوامل التعلّم المعزَّز كميات مذهلة من التفاعل — ملايين الحلقات في الغالب على مهام يتقنها الإنسان في دقائق. وحيث يكون التفاعل رخيصًا وسريعًا، كما في محاكٍ أو لعبة، يكون هذا مجرد إزعاج. وحيث تكلّف كل عيّنة حركة روبوت حقيقية أو جلسة مستخدم حقيقية أو دولارًا حقيقيًا، يكون مُسقِطًا في الغالب. وهذا وحده أكبر سبب لكون التعلّم المعزَّز أندر في الإنتاج مما تُشير سمعته.

تحديد المكافأة. التعلّم المُشرَف يطلب منك تسميات. والتعلّم المعزَّز يطلب منك دالة مكافأة، وذلك أصعب في الإصابة، لأن الوكيل يُحسّن بالضبط ما كتبتَه لا ما قصدتَه. وقرصنة المكافأة في الدرس 14.1 ليست نمط فشل غريبًا؛ بل هي النتيجة الافتراضية لدالة مكافأة خاطئة قليلًا.

فجوة المحاكاة إلى الواقع. الرد المعياري على عدم كفاءة العيّنات هو التدريب في محاكاة، حيث العيّنات رخيصة والأخطاء مجانية. لكن السياسة المدرَّبة في محاكاة تعلّمت المحاكي، بما في ذلك أخطاؤه. فاحتكاك التلامس وتشويش المستشعرات والكمون والديناميكيات غير المنمذجة كلها تختلف في العالم الحقيقي، وقد تستغل السياسة قطعةً مصطنعة في المحاكي لا وجود لها خارجه. وتعشية المجال — أي تنويع معاملات المحاكي عمدًا حتى لا يمكن الاعتماد على أي شذوذ واحد — هي التخفيف المعتاد، وهي تضيّق الفجوة لا تغلقها.

قابلية إعادة الإنتاج. تتفاوت نتائج التعلّم المعزَّز بين التشغيلات أكثر بكثير من نتائج التعلّم المُشرَف، لأن الوكيل يولّد بياناته: فاستكشاف محظوظ مبكر قد يقود إلى سياسة جيدة، وآخر غير محظوظ إلى فشل، من الكود نفسه. والخوارزمية نفسها على المهمة نفسها ببذور عشوائية مختلفة قد تنتج منحنيات تعلّم مختلفة جدًا. فالإبلاغ عن تشغيل واحد ليس دليلًا، والمقارنات بين الخوارزميات تستلزم بذورًا متعددة وإبلاغًا عن التشتت.

اختبار مفيد

قبل أن تمتدّ يدك إلى التعلّم المعزَّز، اسأل هل المسألة تستلزم فعلًا التعلّم من النتائج. فإذا كانت لديك أمثلة مُسمّاة للسلوك الصحيح، فالتعلّم المُشرَف أرخص وأكثر استقرارًا وأسهل في التنقيح. والتعلّم المعزَّز يستحق كلفته حين لا يكون الفعل الصحيح معروفًا مسبقًا لكن النتيجة قابلة للتقييم — الألعاب، والتحكم، وتحسين التفضيل مثل RLHF. وحيث يُستخدم التعلّم المعزَّز فعلًا على نطاق واسع، يكون عادةً المرحلة الأخيرة من مسار مُشرَف فيما عداها، وهذا بالضبط شكل RLHF.

أهم النقاط
  • طرق السياسة تدرّب πθ(a | s) مباشرة بدلًا من استنباط سياسة من قيم الأفعال. وهي تفوز مع الأفعال المتصلة، حيث يكون maxa Q مسألة تحسين بنفسه، وحين تكون السياسة المثلى عشوائية فعلًا.
  • تدرّج السياسة توقّع لـ∇θ log πθ(a | s) مرجَّحًا بمدى جودة الفعل: اجعل الأفعال الجيدة أكثر احتمالًا، بنسبة جودتها. ولا حدّ فيه يفاضل البيئة.
  • REINFORCE (ويليامز، 1992) تستخدم عائد الحلقة الفعلي وهي غير متحيزة لكن تباينها عالٍ جدًا، لأن العائد يمتصّ كل حادث عشوائي تبع الفعل. وهي تحتاج حلقة منتهية كذلك.
  • طرح خطّ أساس يعتمد على الحالة يُبقي التدرّج غير متحيز ويقلّص التباين. والاختيار الطبيعي يعطي الأفضلية A = Q − V: كم كان الفعل أفضل من قيمة الحالة.
  • الفاعل-الناقد يتعلم السياسة ودالة القيمة معًا. والناقد يجعل التحديثات بخطوة واحدة ممكنة — إذ تصبح الأفضلية خطأ الفرق الزمني — بكلفة تحيّز من ناقد ناقص.
  • PPO (شولمان وآخرون، 2017) يقصّ نسبة الاحتمال حتى لا يبتعد التحديث عن السياسة التي جمعت البيانات. وقد صار خيارًا افتراضيًا شائعًا لأسباب هندسية: الرتبة الأولى فقط، ووسائط فائقة قليلة، وإعادة استخدام آمنة لحزمة على عدة دورات.
  • RLHF هو بيانات تفضيل، ثم نموذج مكافأة مُلائَم على تلك الترتيبات، ثم ضبط دقيق بـPPO مع عقوبة على الانحراف عن النموذج الأصلي — كريستيانو وآخرون (2017) وأويانغ وآخرون (2022).
  • الحدود الصريحة: عدم كفاءة العيّنات، وتحديد المكافأة، وفجوة المحاكاة إلى الواقع، وضعف قابلية إعادة الإنتاج عبر البذور العشوائية. وإذا كانت لديك أمثلة مُسمّاة للسلوك الصحيح، فاستخدم التعلّم المُشرَف بدلًا منه.
السابق تعلّم القيمة Q نظرة عامة الختام اكتملت الدورة