قراءة
وضع القصص

التعلم من المكافأة

~٢٠ دقيقة قراءة الدرس 1 من 4 في الوحدة 14

الوعد الذي قطعه الدرس 1.2

سمّى الدرس 1.2 ثلاثة أنواع من تعلُّم الآلة، وقال عن الثالث إن «التعلم المعزَّز مختلف اختلافًا جوهريًا عن التعلم الخاضع للإشراف وغير الخاضع للإشراف على حدٍّ سواء». ثم وضع هذا النوع الثالث جانبًا. وكل وحدة بعده كانت عن مجموعة بيانات ثابتة: صفوف جُمِعت قبل أن تأتي، ونموذج مهمته أن يربط كل صف بجواب. هذه الوحدة تعود إلى ذلك الوعد.

التحوُّل ليس عائلة نماذج جديدة، بل صياغة جديدة للمشكلة. لا توجد مجموعة بيانات. يوجد موقف، ومجموعة من الأشياء التي يجوز لك فعلها، ورقم يصل بعد ذلك ليخبرك بمدى نجاح ما فعلته. وعليك أن تستنتج من هذا الرقم وحده ما ينبغي فعله — والطريقة الوحيدة لمعرفة ما يدفعه فعل لم تجرّبه هي أن تجرّبه.

المرجع القياسي لكل ما في هذه الوحدة هو كتاب ساتون وبارتو Reinforcement Learning: An Introduction (الطبعة الثانية، 2018). والترميز المستخدم هنا هو ترميزهما، حتى يُقرأ الكتاب امتدادًا لهذه الدروس الأربعة لا تمرينًا في الترجمة.

الحلقة: ست كلمات تُعرّف الصياغة

للتعلم المعزَّز رسمٌ واحد، وهو حلقة بمربّعَين. الوكيل هو الذي يقرر. والبيئة هي كل ما عداه — العالم الذي يعمل فيه الوكيل، بما في ذلك أجزاؤه التي لا يستطيع رؤيتها. وتدور الحلقة في خطوات زمنية منفصلة.

في كل خطوة يرصد الوكيل حالة St، وهي وصف للموقف الآن. ثم يختار فعلًا At من الأفعال المتاحة في تلك الحالة. تستجيب البيئة بـمكافأة Rt+1، وهي عدد قياسي واحد، وبحالة تالية St+1. ثم تدور الحلقة من جديد. والحلقة الواحدة هي تشغيلة واحدة من حالة البداية إلى حالة نهائية — مباراة واحدة، أو رحلة توصيل واحدة، أو محادثة واحدة. وبعض المشكلات لا حالة نهائية لها أصلًا، وتُسمّى مستمرة.

المسار
S_0,\, A_0,\, R_1,\, S_1,\, A_1,\, R_2,\, S_2,\, A_2,\, R_3,\, \ldots
ينتج التفاعل تسلسلًا واحدًا متشابكًا، لا جدولًا. لاحظ اصطلاح الدليل، وهو اصطلاح ساتون وبارتو ويستحق التبنّي من الآن: المكافأة عن الفعل في الزمن t تحمل الدليل t+1، لأنها تصل مع الحالة التالية. حالة، ثم فعل، ثم مكافأة والحالة التالية.

القاعدة التي يتبعها الوكيل هي سياسته. السياسة الحتمية تسمّي فعلًا واحدًا لكل حالة؛ والسياسة الاحتمالية تمنح كل فعل احتمالًا. والتعلم في هذه الصياغة يعني تغيير السياسة حتى يتجاوز مجموعُ المكافآت التي تجمعها ما كان عليه قبلًا.

أين يُرسَم الحد

يُرسم الخط بين الوكيل والبيئة عند حدّ سيطرة الوكيل، لا عند حدّ معرفته. فمحرّكات الروبوت ومفاصله جزء من البيئة: الوكيل يأمرها ثم يكتشف ما حدث. وكل ما لا يستطيع الوكيل تغييره بمشيئته يقع في جانب البيئة، مهما كان وثيق الصلة بالروبوت نفسه.

لا خاضع للإشراف ولا غير خاضع له — لسببين لا سبب واحد

التفسير المعتاد أن التعلم المعزَّز بلا تسميات. هذا صحيح، وهو النصف الأسطح. التعلم الخاضع للإشراف يُخبَر بالفعل الصحيح الذي يتخذه؛ أما التعلم المعزَّز فلا يُخبَر إلا بقيمة الفعل الذي اتخذه، ولا شيء عن الأفعال التي لم يتخذها. مكافأة قيمتها 3 لا تقول إن كان 10 متاحًا. هذا هو الفرق بين التغذية الراجعة الإرشادية والتغذية الراجعة التقييمية، وهو سبب اضطرار الوكيل إلى التجريب بدلًا من مجرد الملاءمة.

أما النصف الأعمق فيُترك عادةً دون ذكر: توزيع البيانات يعتمد على السياسة. في التعلم الخاضع للإشراف مجموعة التدريب ثابتة، وكل افتراض في الدورة حتى الآن يقوم على ذلك — تقسيم التدريب والاختبار، والتحقق المتقاطع، وحتى معنى فرط التخصيص. أما في التعلم المعزَّز فسياسة الوكيل الحالية هي التي تقرر أي الحالات يزورها، وبالتالي أي خبرة يجمعها. حسّن السياسة فيتحرك توزيع البيانات. مشكلة التعلم هنا غير مستقرة بحكم البناء، وعدم استقرارها ناتج عن شيء فعله المتعلم نفسه.

ويتبع ذلك نتيجتان فورًا. الأولى: السياسة التي لا تزور منطقة من فضاء الحالات لا تجمع عنها أي معلومة، فيمكن أن تكون خاطئة فيها خطأً تعسفيًا إلى الأبد دون أن يناقضها شيء. والثانية: حلقة التحسين قد تتغذى على نفسها، فسياسة أفضل قليلًا تزور حالات مختلفة قليلًا، وهذا يغيّر ما يُتعلَّم لاحقًا. ومعظم الصعوبة العملية في التعلم المعزَّز — ومعظم سمعته في عدم الاستقرار — سببها هذا الاقتران، لا غياب التسميات.

وليس هذا تعلمًا غير خاضع للإشراف كذلك. فالتجميع وتقليل الأبعاد في الوحدة 5 يبحثان عن بنية في بيانات موجودة سلفًا. أما هنا فهناك هدف مصوغ كرقم، والوكيل يُحاكَم عليه. ويقول ساتون وبارتو الشيء نفسه: التعلم المعزَّز نموذج ثالث، لا حالة خاصة من أحد النموذجين الآخرين.

المكافأة المتأخرة ومشكلة إسناد الفضل

لو كان كل فعل يدفع فوريًا، لكانت المشكلة مجرد جدول بحث. لكنه لا يدفع فوريًا. فالنقلة التي خسّرت مباراة الشطرنج ربما جاءت قبل الخسارة بأربعين نقلة. والتوصية التي دفعت مستخدمًا إلى إلغاء اشتراكه شوهدت قبل ثلاثة أسابيع. المكافأة متأخرة، والنتيجة صورةٌ من مشكلة إسناد الفضل التي حلّها الدرس 6.3 لطبقات الشبكة — لكنها هنا في الزمن لا في العمق.

ويجدر وضع الحالتين جنبًا إلى جنب. الانتشار الخلفي يُسند الفضل عبر رسم حسابي معروف وقابل للتفاضل، وكل مسار في ذلك الرسم متاح للفحص. أما إسناد الفضل الزمني فلا رسم كهذا لديه: للوكيل تسلسل واحد من الحالات والأفعال والمكافآت، وعليه أن يقرّر إلى أي الأفعال السابقة تنتمي المكافأة المتأخرة. ولا يستطيع إعادة تشغيل التاريخ مع تغيير فعل واحد.

وبقية هذه الوحدة كلها آلياتٌ لهذه المشكلة الواحدة. الدرس 14.2 يعرّف الكمية التي تحلّها من حيث المبدأ — قيمة الحالة، أي المكافأة التي يمكن توقعها من هنا وصاعدًا. والدرس 14.3 يبيّن كيف تُقدَّر تلك الكمية من الخبرة خطوةً بخطوة. والدرس 14.4 يذهب إلى السياسة مباشرة.

الاستكشاف مقابل الاستغلال: أصغر مثال حقيقي

جرِّد الصياغة حتى لا تبقى فيها إلا صعوبة واحدة، فتحصل على الآلة متعددة الأذرع (multi-armed bandit): حالة واحدة، وk أفعال، ومكافأة تُسحب من توزيع مجهول مرتبط بالفعل الذي اخترته. لا شيء تخطّط له، لأن لا شيء تفعله يغيّر الموقف الذي أنت فيه. والسؤال الوحيد الباقي هو أي ذراع تسحب تاليًا، وهذا السؤال صعب أصلًا. طرحه روبنز (1952) بهذه الصورة في أدبيات الإحصاء، تحت عنوان التصميم المتسلسل للتجارب؛ ويفتتح ساتون وبارتو كتابهما به لنفس السبب الذي يجعله يظهر هنا.

اعمل حالة بذراعين يدويًا. سحبتَ الذراع A ثلاث مرات فحصلت على المكافآت 1 و0 و1؛ وسحبتَ الذراع B مرة واحدة فحصلت على 0. والتقدير البديهي لقيمة كل ذراع هو متوسط المكافأة التي دفعتها حتى الآن.

قيمة الفعل بمتوسط العيّنة
Q_t(a) = \frac{1}{N_t(a)} \sum_{i=1}^{N_t(a)} R_i
القيمة المقدَّرة للفعل a في الزمن t هي متوسط المكافآت المستلَمة في المرات Nt(a) التي اختير فيها. وللذراعين أعلاه: Q(A) = (1 + 0 + 1) / 3 = 0.67 وQ(B) = 0 / 1 = 0. والتقدير لا يفوق جودةَ العدد الذي تحته، وعدد B هو 1.

الوكيل الجَشِع الخالص يختار الآن الذراع ذات التقدير الأعلى، وهي A، فيحصل على مكافأة أخرى، ويحدّث Q(A)، ثم يختار A من جديد. وسيختار A إلى آخر الزمان. وإذا كانت الذراع B تدفع في الحقيقة 0.8 في المتوسط وكان ذلك الصفر الواحد مجرد حظ سيئ، فلن يكتشف الوكيل ذلك أبدًا، لأن اكتشافه يقتضي سحب ذراع قرّر سلفًا أنها أسوأ. هذه هي معضلة الاستكشاف والاستغلال بكاملها: استغلال المعرفة الحالية هو السبيل الوحيد لجمع مكافأة الآن، والاستكشاف هو السبيل الوحيد إلى معرفة أفضل تستغلها لاحقًا. وكل خطوة تصرف الميزانية على أحدهما.

وأبسط جواب عملي هو الجَشِع مع ε: اتخذ الفعل الأعلى تقديرًا في معظم الأحيان، وباحتمال صغير ε اختر عوضًا عن ذلك اختيارًا عشوائيًا منتظمًا.

اختيار الفعل بالجَشِع مع ε
\pi(a) = \begin{cases} 1 - \varepsilon + \dfrac{\varepsilon}{|\mathcal{A}|}, & a = \arg\max_{a'} Q(a') \\[6pt] \dfrac{\varepsilon}{|\mathcal{A}|}, & \text{otherwise} \end{cases}
مع k = |A| أفعال وε = 0.1، تُختار الذراع الجَشِعة باحتمال 0.1 / 2 + 0.9 = 0.95 في حالة الذراعين، ويُختار كل فعل باحتمال لا يقل عن ε / k. وهذا الحد الأدنى هو المقصود كله: فهو يضمن أن كل فعل يظل يُعايَن، وبالتالي أن كل تقدير يظل يُصحَّح. والثمن أن نسبة ε من الخطوات تُصرَف قصدًا على فعل يُعتقَد أنه أسوأ.

إعادة حساب المتوسط من الصفر بعد كل سحبة تعني تخزين كل مكافأة. وهذا غير لازم: يمكن الاحتفاظ بالمتوسط خطوةً بخطوة، والصورة التي يتخذها هي صورة كل قاعدة تحديث تقريبًا في هذه الوحدة.

التحديث التزايدي
Q_{n+1} = Q_n + \frac{1}{n}\left[ R_n - Q_n \right]
اقرأها: «التقدير القديم، زائد خطوة في اتجاه الخطأ». القوس هو مقدار المفاجأة في المكافأة الأخيرة، و1/n هو حجم الخطوة الذي يتقلّص مع تراكم الشواهد حتى يستقر التقدير. استبدل 1/n بـα ثابت فيصبح التقدير متتبِّعًا لعالم متغيّر، ناسيًا المكافآت القديمة هندسيًا — وهذا بالضبط هو الاختيار الذي يتخذه الدرس 14.3 لتعلّم القيمة Q.

التلاعب بالمكافأة: تحصل على ما قِسته

كل ما سبق يفترض أن المكافأة تقول ما قصدتَه. وتحديدها هو أصعب مهمة هندسية في التعلم المعزَّز التطبيقي، وهي صعبة على نحو محدَّد: الوكيل مُحسِّنٌ لا يكلّ للرقم الحرفي، وهو لا يشاركك افتراضاتك غير المعلنة عن الكيفية التي يُفترض أن يرتفع بها ذلك الرقم.

كافئ روبوت تنظيف على كمية الغبار التي يجمعها فقد يتعلّم أن يقلب السلة ويجمعها مرة أخرى. وكافئ نظام توصيات على النقرات فسيتعلّم أي العناوين أصعب على المقاومة، وهذا ليس نفس السؤال عن أي المقالات تستحق القراءة. وكافئ عدّاءً محاكيًا على السرعة الأمامية فقد يجد وضعية تستغل خللًا في محرّك الفيزياء بدلًا من أن يتعلّم الجري. وفي كل حالة لم يفعل الوكيل شيئًا خاطئًا: لقد عظّم الدالة الهدف التي أُعطيت له.

تحذير ساتون وبارتو

إشارة المكافأة هي كيف تُخبر الوكيل بماذا تريد أن يُنجَز — لا كيف تريد أن يُنجَز. وساتون وبارتو صريحان في أن وضع الأهداف الفرعية في المكافأة خطأ: كافئ وكيل الشطرنج على أخذ القطع أو السيطرة على المركز فقد يجد طرقًا لفعل ذلك بالضبط وهو يخسر المباراة. والمعرفة المسبقة عن الطريقة موضعها السياسة الابتدائية أو تقديرات القيمة الابتدائية، لا المكافأة.

ويتبع ذلك عادتان عمليتان. اكتب كيف يمكن للوكيل أن يعظّم مكافأتك المقترحة وهو يهزم مقصدك، قبل أن تدرّب أي شيء. وراقب السلوك، لا منحنى المكافأة فقط — فمنحنى مكافأة صاعد هو تحديدًا شكل التلاعب بالمكافأة من الخارج.

أين يستحق التعلم المعزَّز كلفته فعلًا

التعلم المعزَّز هو الأداة الخطأ أكثر بكثير مما هو الأداة الصحيحة. وهو يستحق كلفته حين تتحقق ثلاثة أمور معًا: أن تكون القرارات متسلسلة، بحيث يغيّر ما تفعله الآن ما تواجهه لاحقًا؛ وأن تكون التغذية الراجعة تقييمية ومتأخرة، فلا يستطيع أحد أن يسلّمك أفعال صحيحة مُسمّاة؛ وأن تكون الخبرة رخيصة بما يكفي لجمعها، من نظام حقيقي أو من محاكٍ جيد. وإن اختلّ أحد الثلاثة، فالتعلم الخاضع للإشراف عادةً أسرع وأرخص وأسهل في التنقيح.

وهذه أربع بيئات يناسبها فعلًا:

أربعة مواطن حقيقية

التحكّم. الروبوتات والطيران والتبريد وأنظمة الطاقة وجدولة الموارد. المشكلة متسلسلة بطبيعتها، ويمكن لمحاكٍ فيزيائي أن يوفّر خبرة رخيصة، ودالة الكلفة معروفة حقًا في كثير من الأحيان.

الألعاب. ميدان الإثبات التاريخي، لأن القواعد مضبوطة والمكافأة لا لبس فيها واللعب الذاتي يستطيع توليد خبرة بقدر ما تستطيع تحمّله. والوضوح الذي يجعل الألعاب مثالية هو نفسه ما يجعل نتائجها صعبة النقل.

التوصية والتفاعل. أيّ عنصر تعرض تاليًا هو قرار متسلسل تحت تغذية راجعة تقييمية، وصياغة الآلة متعددة الأذرع أعلاه هي الوصف الصادق لجزء كبير منه. ولاحظ أن الاقتران المذكور في القسم السابق حقيقي هنا: السياسة تُشكّل السجل، والسجل هو بياناتك الوحيدة.

التعلم المعزَّز من التغذية الراجعة البشرية. ويغطّيه الدرس 9.3 بوصفه الخطوة التي حوّلت متنبِّئًا بالكلمة التالية إلى نموذج يتّبع التعليمات. وقد أسّس كريستيانو وزملاؤه (2017) النمط الذي تفضي إليه هذه الوحدة: بدلًا من كتابة دالة مكافأة يدويًا، اجمع مقارنات بشرية بين أزواج من مقاطع سلوك قصيرة، وملائم نموذج مكافأة لتلك التفضيلات، ثم حسّن السياسة في مواجهة المكافأة المُلائَمة. ويعود إليه الدرس 14.4 بعد أن تصبح طرائق تدرّج السياسة متاحة.

والحدود الصادقة موضعها هنا أيضًا، وسيذكرها الدرس 14.4 كما ينبغي: التعلم المعزَّز جائع للعيّنات، وحسّاس لتحديد المكافأة، ومُتعِب في إعادة الإنتاج، وكثيرًا ما تهزمه الفجوة بين المحاكي والواقع. وليس في ذلك سبب لتجاوز الوحدة — بل سبب للتعرّف على هذه الصياغة عندما تكون فيها حقًا.

أهم النقاط
  • التعلم المعزَّز هو الصياغة الثالثة التي سمّاها الدرس 1.2: وكيل يتخذ أفعال في بيئة، ويرصد حالات، ويتلقى مكافأة قياسية — ولا توجد مجموعة بيانات.
  • تُكتب مكافأة الفعل في الزمن t على صورة Rt+1، لأنها تصل مع الحالة التالية. والحلقة هي تشغيلة واحدة إلى حالة نهائية.
  • التغذية الراجعة تقييمية لا إرشادية: تعرف قيمة الفعل الذي اتخذته ولا شيء عن الأفعال التي لم تتخذها.
  • الفرق الأعمق عن التعلم الخاضع للإشراف هو أن توزيع البيانات يعتمد على السياسة، فتحسين السياسة يغيّر البيانات — المشكلة غير مستقرة بحكم البناء.
  • المكافأة متأخرة، وهذا يجعل إسناد الفضل الزمني هو المشكلة المركزية؛ وخلافًا للانتشار الخلفي لا يوجد رسم قابل للتفاضل تتبعه من خلاله.
  • الآلة متعددة الأذرع (روبنز، 1952) تعزل الاستكشاف عن الاستغلال. والجَشِع مع ε يبقي احتمال كل فعل فوق ε/k، فيظل كل تقدير يُصحَّح.
  • تُصان التقديرات تزايديًا كقيمة قديمة زائد خطوة نحو الخطأ — وهي صورة كل تحديث تقريبًا في هذه الوحدة.
  • التلاعب بالمكافأة هو الفشل الافتراضي: الوكيل يعظّم ما قِسته. فحدِّد ماذا تريد في المكافأة، وضع كيف في السياسة الابتدائية، كما ينصح ساتون وبارتو.
  • يستحق كلفته حيث تكون القرارات متسلسلة والتغذية الراجعة تقييمية ومتأخرة والخبرة رخيصة: التحكّم، والألعاب، والتوصية، والتعلم المعزَّز من التغذية الراجعة البشرية (كريستيانو وزملاؤه، 2017؛ الدرس 9.3).
السابق الوحدة 13، الدرس 4 نظرة عامة التالي عمليات قرار ماركوف