تعلّم القيمة Q
حلّ الدرس 14.2 عملية قرار ماركوف باستخدام احتمالات الانتقال. ولا أحد يسلّمك تلك الاحتمالات. فالسؤال: هل يستطيع وكيل أن يتعلم التصرّف الجيد بمجرد أن يتصرّف، دون أن يقدّر احتمالًا واحدًا؟
خالٍ من النموذج
الروبوت لا يعرف احتمال انزلاق عجلته. تكرار القيمة يحتاج ذلك الرقم؛ وتعلّم القيمة Q لا يحتاجه. فهو يستخدم ما حدث فعلًا بدلًا من ما قد يحدث. ساتون وبارتو (2018) يرسمان هذا الخط بالضبط.
التعلّم من خطوة واحدة
مونت كارلو ينتظر نهاية الحلقة. أما تعلّم الفرق الزمني فيرفض الانتظار: بعد خطوة واحدة يقارن رأيه القديم بالمكافأة التي قبضها للتو زائد القيمة المخصومة للمكان الذي هبط فيه.
قاعدة التحديث
حرّك التقدير القديم جزءًا مقداره α نحو التقدير الأفضل. قدّمتها رسالة واتكينز عام 1989؛ وأثبت واتكينز ودايان (1992) أن النسخة الجدولية تتقارب إلى قيم الأفعال المثلى.
ممر من أربع خلايا
- الحالات A – B – C – G؛ وG هي الهدف النهائي
- الأفعال يسار، يمين. واليمين من C يدخل G
- المكافآت 0 لكل خطوة، و+10 عند دخول G
- α = 0.5، γ = 0.9، وكل خانة في Q تبدأ من 0
- G نهائية، لذا maxa Q(G, a) = 0
أول قيمة غير صفرية
في C، تحرّك يمينًا، ادخل G. المكافأة +10، وG نهائية فحدّ الاستنهاض 0.
Q(C, right) ← 0 + 0.5×10 = 5.0
لاحظ 5.0 لا 10 — نصف الدليل، لأن α = 0.5.
التعلّم بلا مكافأة
في B، تحرّك يمينًا، وصل إلى C. المكافأة 0. لكن maxa Q(C, a) = max(0، 5.0) = 5.0، فهناك ما يمكن تعلّمه.
Q(B, right) ← 0 + 0.5×4.5 = 2.25
مكافأة صفرية، وتعلّم حقيقي. جاء كله من تقدير الوكيل الخاص لـC.
القيمة تسير إلى الخلف
في C مرة أخرى، يمينًا إلى G. الانتقال نفسه، وجدول مختلف.
Q(C, right) ← 5.0 + 0.5×5.0 = 7.5
كل زيارة تُغلق نصف الفجوة: 5.0، 7.5، 8.75، 9.375… نحو Q* = 10، مع Q*(B, يمين) = 9 وQ*(A, يمين) = 8.1 بخطوة خصم واحدة خلفها.
إبسيلون-الجشعة
باحتمال 1 − ε خُذ أفضل فعل معروف؛ وباحتمال ε تصرّف عشوائيًا. خشن، وهو ما يُبقي كل زوج حالة-فعل قابلًا للوصول — الشرط الذي يطلبه برهان واتكينز ودايان.
SARSA بجانب تعلّم القيمة Q
رَمِري ونيرانجان (1994). حدٌّ واحد يختلف: الأعظم على a، مقابل الفعل المأخوذ فعلًا. أعِد التحديث 2 مع يسار استكشافي من C — يتعلم Q-learning القيمة 2.25، ويتعلم SARSA صفرًا.
شبكات Q العميقة
- الممر يحتاج 8 خانات؛ وشاشة أتاري تحتاج عددًا فلكيًا أكبر
- والأسوأ: الجدول ليس لديه مفهوم للتشابه بين شاشتين شبه متطابقتين
- DQN يستبدل الجدول بشبكة؛ وقاعدة التحديث لم تتغير
- إعادة تشغيل الخبرة — حزم صغيرة عشوائية من مخزن تكسر الترابط بين الإطارات المتتالية، وتعيد استخدام كل انتقال
- الشبكة الهدف — نسخة مجمّدة θ− تحسب الهدف، فيتوقف عن التحرك مع كل خطوة تدرّج
ما تعلّمته
تعلّم القيمة Q لا يحتاج نموذجًا. يستنهض بعد خطوة واحدة، محرّكًا التقدير جزءًا مقداره α نحو المكافأة زائد أفضل قيمة تالية مخصومة. في الممر: 5.0، ثم 2.25 من خطوة بلا مكافأة، ثم 7.5. إبسيلون-الجشعة تستكشف وتُخفَّض تدريجيًا. وSARSA هو التوأم داخل السياسة. وDQN يستبدل الجدول ويحتاج إعادة تشغيل الخبرة وشبكة هدف لينجو — منيه وآخرون، Nature (2015).