ML 101
M14 · L03
الوحدة 14

تعلّم القيمة Q

حلّ الدرس 14.2 عملية قرار ماركوف باستخدام احتمالات الانتقال. ولا أحد يسلّمك تلك الاحتمالات. فالسؤال: هل يستطيع وكيل أن يتعلم التصرّف الجيد بمجرد أن يتصرّف، دون أن يقدّر احتمالًا واحدًا؟

01 / 13
ML 101
M14 · L03
بلا خريطة

خالٍ من النموذج

الروبوت لا يعرف احتمال انزلاق عجلته. تكرار القيمة يحتاج ذلك الرقم؛ وتعلّم القيمة Q لا يحتاجه. فهو يستخدم ما حدث فعلًا بدلًا من ما قد يحدث. ساتون وبارتو (2018) يرسمان هذا الخط بالضبط.

يحتاج نموذجًا
تكرار القيمة
يحتاج خبرة
تعلّم القيمة Q
02 / 13
ML 101
M14 · L03
الفكرة المفتاح

التعلّم من خطوة واحدة

مونت كارلو ينتظر نهاية الحلقة. أما تعلّم الفرق الزمني فيرفض الانتظار: بعد خطوة واحدة يقارن رأيه القديم بالمكافأة التي قبضها للتو زائد القيمة المخصومة للمكان الذي هبط فيه.

خطأ الفرق الزمني
\delta_t = R_{t+1} + \gamma \max_a Q(S_{t+1}, a) - Q(S_t, A_t)
03 / 13
ML 101
M14 · L03
واتكينز، 1989

قاعدة التحديث

حرّك التقدير القديم جزءًا مقداره α نحو التقدير الأفضل. قدّمتها رسالة واتكينز عام 1989؛ وأثبت واتكينز ودايان (1992) أن النسخة الجدولية تتقارب إلى قيم الأفعال المثلى.

تعلّم القيمة Q
Q(S_t, A_t) \leftarrow Q(S_t, A_t) + \alpha \left[ R_{t+1} + \gamma \max_a Q(S_{t+1}, a) - Q(S_t, A_t) \right]
04 / 13
ML 101
M14 · L03
محلول باليد

ممر من أربع خلايا

  • الحالات A – B – C – G؛ وG هي الهدف النهائي
  • الأفعال يسار، يمين. واليمين من C يدخل G
  • المكافآت 0 لكل خطوة، و+10 عند دخول G
  • α = 0.5، γ = 0.9، وكل خانة في Q تبدأ من 0
  • G نهائية، لذا maxa Q(G, a) = 0
05 / 13
ML 101
M14 · L03
التحديث 1

أول قيمة غير صفرية

في C، تحرّك يمينًا، ادخل G. المكافأة +10، وG نهائية فحدّ الاستنهاض 0.

الحسابات
δ = 10 + 0.9×0 − 0 = 10
Q(C, right) ← 0 + 0.5×10 = 5.0

لاحظ 5.0 لا 10 — نصف الدليل، لأن α = 0.5.

06 / 13
ML 101
M14 · L03
التحديث 2

التعلّم بلا مكافأة

في B، تحرّك يمينًا، وصل إلى C. المكافأة 0. لكن maxa Q(C, a) = max(0، 5.0) = 5.0، فهناك ما يمكن تعلّمه.

الحسابات
δ = 0 + 0.9×5.0 − 0 = 4.5
Q(B, right) ← 0 + 0.5×4.5 = 2.25

مكافأة صفرية، وتعلّم حقيقي. جاء كله من تقدير الوكيل الخاص لـC.

07 / 13
ML 101
M14 · L03
التحديث 3

القيمة تسير إلى الخلف

في C مرة أخرى، يمينًا إلى G. الانتقال نفسه، وجدول مختلف.

الحسابات
δ = 10 + 0 − 5.0 = 5.0
Q(C, right) ← 5.0 + 0.5×5.0 = 7.5

كل زيارة تُغلق نصف الفجوة: 5.0، 7.5، 8.75، 9.375… نحو Q* = 10، مع Q*(B, يمين) = 9 وQ*(A, يمين) = 8.1 بخطوة خصم واحدة خلفها.

08 / 13
ML 101
M14 · L03
الاستكشاف

إبسيلون-الجشعة

باحتمال 1 − ε خُذ أفضل فعل معروف؛ وباحتمال ε تصرّف عشوائيًا. خشن، وهو ما يُبقي كل زوج حالة-فعل قابلًا للوصول — الشرط الذي يطلبه برهان واتكينز ودايان.

تخفيضها تدريجيًا
ε = 1.0، ×0.995 لكل حلقة → ≈0.08 بعد 500 حلقة، بأرضية 0.05. السرعة المفرطة تثبّت طريقًا متوسطًا؛ والبطء الشديد لا يقبض شيئًا.
09 / 13
ML 101
M14 · L03
داخل السياسة وخارجها

SARSA بجانب تعلّم القيمة Q

رَمِري ونيرانجان (1994). حدٌّ واحد يختلف: الأعظم على a، مقابل الفعل المأخوذ فعلًا. أعِد التحديث 2 مع يسار استكشافي من C — يتعلم Q-learning القيمة 2.25، ويتعلم SARSA صفرًا.

SARSA
Q(S_t, A_t) \leftarrow Q(S_t, A_t) + \alpha \left[ R_{t+1} + \gamma Q(S_{t+1}, A_{t+1}) - Q(S_t, A_t) \right]
10 / 13
ML 101
M14 · L03
عندما ينفد الجدول

شبكات Q العميقة

  • الممر يحتاج 8 خانات؛ وشاشة أتاري تحتاج عددًا فلكيًا أكبر
  • والأسوأ: الجدول ليس لديه مفهوم للتشابه بين شاشتين شبه متطابقتين
  • DQN يستبدل الجدول بشبكة؛ وقاعدة التحديث لم تتغير
  • إعادة تشغيل الخبرة — حزم صغيرة عشوائية من مخزن تكسر الترابط بين الإطارات المتتالية، وتعيد استخدام كل انتقال
  • الشبكة الهدف — نسخة مجمّدة θ− تحسب الهدف، فيتوقف عن التحرك مع كل خطوة تدرّج
11 / 13
ML 101
اختبار سريع

تحقّق ممّا ثبت

أربعة أسئلة من هذا الدرس. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت. ولا شيء يُسجَّل أو يُحفَظ.

السؤال 1 من 0
النتيجة 0/0

12 / 13
ML 101
ملخص
مراجعة

ما تعلّمته

تعلّم القيمة Q لا يحتاج نموذجًا. يستنهض بعد خطوة واحدة، محرّكًا التقدير جزءًا مقداره α نحو المكافأة زائد أفضل قيمة تالية مخصومة. في الممر: 5.0، ثم 2.25 من خطوة بلا مكافأة، ثم 7.5. إبسيلون-الجشعة تستكشف وتُخفَّض تدريجيًا. وSARSA هو التوأم داخل السياسة. وDQN يستبدل الجدول ويحتاج إعادة تشغيل الخبرة وشبكة هدف لينجو — منيه وآخرون، Nature (2015).

اكتمل الدرس
طرق السياسة ←
13 / 13