التعلم من المكافأة
لا مجموعة بيانات. لا تسميات. فقط موقف، ومجموعة من الأشياء التي يجوز لك فعلها، ورقم يصل بعدها ليخبرك بمدى نجاح ما فعلته. هذا هو النوع الثالث من تعلُّم الآلة.
الدرس 1.2 قال ذلك
سمّى الدرس 1.2 التعلم المعزَّز «مختلفًا اختلافًا جوهريًا عن التعلم الخاضع للإشراف وغير الخاضع للإشراف» — ثم وضعه جانبًا لاثنتي عشرة وحدة. الوحدة 14 تسدّ ذلك الوعد.
وكيل، وبيئة
يرصد الوكيل حالة، ويختار فعلًا، فتجيب البيئة بـمكافأة وحالة تالية. ثم تدور الحلقة من جديد. والتشغيلة الواحدة من البداية إلى حالة نهائية هي حلقة.
الفضل، عبر الزمن
النقلة التي خسّرت المباراة ربما جاءت قبل الخسارة بأربعين نقلة. إلى أي فعل سابق تنتمي مكافأة متأخرة؟ حلّ الدرس 6.3 إسناد الفضل عبر الطبقات. وهذه هي المشكلة نفسها عبر الزمن.
تقييمية، لا إرشادية
التعلم الخاضع للإشراف يُخبَر بالفعل الصحيح الذي يتخذه. أما التعلم المعزَّز فلا يُخبَر إلا بقيمة الفعل الذي اتخذه — ولا شيء إطلاقًا عن الأفعال التي لم يتخذها. مكافأة قيمتها 3 لا تقول أبدًا إن كان 10 متاحًا.
البيانات تعتمد عليك
- السياسة تقرر أي الحالات تُزار
- وبالتالي تقرر أي خبرة تُجمَع
- حسّن السياسة فيتحرك توزيع البيانات
- غير مستقرة بحكم البناء — وبسبب المتعلم نفسه
- منطقة لا تُزار تبقى خاطئة أبدًا دون أن يناقضها شيء
آلة بذراعين
الذراع A دفعت 1 و0 و1 → Q(A) = 0.67. والذراع B دفعت 0 مرة واحدة → Q(B) = 0. الوكيل الجَشِع يختار A إلى الأبد — ولا يعرف أبدًا أن B تدفع في الحقيقة 0.8. طرح روبنز هذه المشكلة عام 1952.
قيمة قديمة، وخطوة واحدة
لا تحتاج قطعًا إلى تخزين كل مكافأة. حرّك التقدير قليلًا في اتجاه الخطأ. وكل تحديث في هذه الوحدة تقريبًا له هذه الصورة — وحجم خطوة ثابت α مكان 1/n يجعله يتتبّع عالمًا متغيّرًا بدلًا من ذلك.
استكشاف أم استغلال
استغلال ما تعرفه هو السبيل الوحيد لجمع مكافأة الآن. والاستكشاف هو السبيل الوحيد إلى معرفة أفضل تستغلها لاحقًا. وكل خطوة واحدة تصرف الميزانية على أحدهما.
التلاعب بالمكافأة
كافئ روبوت تنظيف على الغبار المجموع فقد يقلب السلة ليجمعها مرة أخرى. وكافئ نظام توصيات على النقرات فيتعلّم أي العناوين أصعب على المقاومة. الوكيل يعظّم ما قِسته، لا ما قصدته.
أربعة مواطن حقيقية
- التحكّم — الروبوتات والطيران والتبريد والجدولة
- الألعاب — قواعد مضبوطة ومكافأة لا لبس فيها ولعب ذاتي
- التوصية — قرارات متسلسلة وتغذية راجعة تقييمية
- التغذية الراجعة البشرية — مقارنات بشرية بدل مكافأة مكتوبة (كريستيانو وزملاؤه، 2017؛ الدرس 9.3)
- يجب تحقق الشروط الثلاثة كلها، وإلا فاستخدم التعلم الخاضع للإشراف
ما تعلّمته
وكيل، وبيئة، وحالة، وفعل، ومكافأة، وحلقة. التغذية الراجعة تقييمية لا إرشادية — وتوزيع البيانات يعتمد على السياسة، وهذا هو الفرق الأعمق. المكافأة متأخرة، فيمتد إسناد الفضل عبر الزمن. والآلة متعددة الأذرع تعزل الاستكشاف عن الاستغلال. والوكيل يعظّم ما قِسته بالضبط.