ML 101
M14 · L01
الوحدة 14

التعلم من المكافأة

لا مجموعة بيانات. لا تسميات. فقط موقف، ومجموعة من الأشياء التي يجوز لك فعلها، ورقم يصل بعدها ليخبرك بمدى نجاح ما فعلته. هذا هو النوع الثالث من تعلُّم الآلة.

01 / 13
ML 101
M14 · L01
وعد قديم

الدرس 1.2 قال ذلك

سمّى الدرس 1.2 التعلم المعزَّز «مختلفًا اختلافًا جوهريًا عن التعلم الخاضع للإشراف وغير الخاضع للإشراف» — ثم وضعه جانبًا لاثنتي عشرة وحدة. الوحدة 14 تسدّ ذلك الوعد.

المرجع
ساتون وبارتو، 2018
الجديد
صياغة، لا نموذج
02 / 13
ML 101
M14 · L01
الحلقة

وكيل، وبيئة

يرصد الوكيل حالة، ويختار فعلًا، فتجيب البيئة بـمكافأة وحالة تالية. ثم تدور الحلقة من جديد. والتشغيلة الواحدة من البداية إلى حالة نهائية هي حلقة.

خطوة واحدة
S_t \;\rightarrow\; A_t \;\rightarrow\; R_{t+1},\; S_{t+1}
03 / 13
ML 101
M14 · L01
المكافأة المتأخرة

الفضل، عبر الزمن

النقلة التي خسّرت المباراة ربما جاءت قبل الخسارة بأربعين نقلة. إلى أي فعل سابق تنتمي مكافأة متأخرة؟ حلّ الدرس 6.3 إسناد الفضل عبر الطبقات. وهذه هي المشكلة نفسها عبر الزمن.

الجزء الصعب
لا يوجد رسم قابل للتفاضل تتبعه للخلف — بل تسلسل واحد لما حدث
04 / 13
ML 101
M14 · L01
الفرق الأول

تقييمية، لا إرشادية

التعلم الخاضع للإشراف يُخبَر بالفعل الصحيح الذي يتخذه. أما التعلم المعزَّز فلا يُخبَر إلا بقيمة الفعل الذي اتخذه — ولا شيء إطلاقًا عن الأفعال التي لم يتخذها. مكافأة قيمتها 3 لا تقول أبدًا إن كان 10 متاحًا.

النتيجة
على الوكيل أن يجرّب. الملاءمة لا تكفي، لأن البدائل لم تُقيَّم أصلًا.
05 / 13
ML 101
M14 · L01
الفرق الثاني — الأعمق

البيانات تعتمد عليك

  • السياسة تقرر أي الحالات تُزار
  • وبالتالي تقرر أي خبرة تُجمَع
  • حسّن السياسة فيتحرك توزيع البيانات
  • غير مستقرة بحكم البناء — وبسبب المتعلم نفسه
  • منطقة لا تُزار تبقى خاطئة أبدًا دون أن يناقضها شيء
06 / 13
ML 101
M14 · L01
أصغر مثال حقيقي

آلة بذراعين

الذراع A دفعت 1 و0 و1 → Q(A) = 0.67. والذراع B دفعت 0 مرة واحدة → Q(B) = 0. الوكيل الجَشِع يختار A إلى الأبد — ولا يعرف أبدًا أن B تدفع في الحقيقة 0.8. طرح روبنز هذه المشكلة عام 1952.

قيمة الفعل
Q_t(a) = \frac{1}{N_t(a)} \sum_{i=1}^{N_t(a)} R_i
07 / 13
ML 101
M14 · L01
المحاسبة

قيمة قديمة، وخطوة واحدة

لا تحتاج قطعًا إلى تخزين كل مكافأة. حرّك التقدير قليلًا في اتجاه الخطأ. وكل تحديث في هذه الوحدة تقريبًا له هذه الصورة — وحجم خطوة ثابت α مكان 1/n يجعله يتتبّع عالمًا متغيّرًا بدلًا من ذلك.

المتوسط التزايدي
Q_{n+1} = Q_n + \frac{1}{n}\left[ R_n - Q_n \right]
08 / 13
ML 101
M14 · L01
المعضلة

استكشاف أم استغلال

استغلال ما تعرفه هو السبيل الوحيد لجمع مكافأة الآن. والاستكشاف هو السبيل الوحيد إلى معرفة أفضل تستغلها لاحقًا. وكل خطوة واحدة تصرف الميزانية على أحدهما.

الجَشِع مع ε
أفضل تقدير في معظم الأحيان؛ وباحتمال ε اختر عشوائيًا. يبقى احتمال كل فعل ≥ ε/k، فيظل كل تقدير يُصحَّح.
09 / 13
ML 101
M14 · L01
الفشل الافتراضي

التلاعب بالمكافأة

كافئ روبوت تنظيف على الغبار المجموع فقد يقلب السلة ليجمعها مرة أخرى. وكافئ نظام توصيات على النقرات فيتعلّم أي العناوين أصعب على المقاومة. الوكيل يعظّم ما قِسته، لا ما قصدته.

ساتون وبارتو
المكافأة تقول ماذا تريد أن يُنجَز، لا كيف أبدًا. والطريقة موضعها السياسة الابتدائية أو القيم الابتدائية.
10 / 13
ML 101
M14 · L01
أين يستحق كلفته

أربعة مواطن حقيقية

  • التحكّم — الروبوتات والطيران والتبريد والجدولة
  • الألعاب — قواعد مضبوطة ومكافأة لا لبس فيها ولعب ذاتي
  • التوصية — قرارات متسلسلة وتغذية راجعة تقييمية
  • التغذية الراجعة البشرية — مقارنات بشرية بدل مكافأة مكتوبة (كريستيانو وزملاؤه، 2017؛ الدرس 9.3)
  • يجب تحقق الشروط الثلاثة كلها، وإلا فاستخدم التعلم الخاضع للإشراف
11 / 13
ML 101
اختبار سريع

تحقّق ممّا ثبت

أربعة أسئلة من هذا الدرس. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت. ولا شيء يُسجَّل أو يُحفَظ.

السؤال 1 من 0
النتيجة 0/0

12 / 13
ML 101
ملخص
مراجعة

ما تعلّمته

وكيل، وبيئة، وحالة، وفعل، ومكافأة، وحلقة. التغذية الراجعة تقييمية لا إرشادية — وتوزيع البيانات يعتمد على السياسة، وهذا هو الفرق الأعمق. المكافأة متأخرة، فيمتد إسناد الفضل عبر الزمن. والآلة متعددة الأذرع تعزل الاستكشاف عن الاستغلال. والوكيل يعظّم ما قِسته بالضبط.

اكتمل الدرس
الدرس 14.2: عمليات قرار ماركوف ←
13 / 13