ML 101
M14 · L02
الوحدة 14

عمليات قرار ماركوف

وصف الدرس 14.1 الحلقة. ولكي تحسب أي شيء عليك أن تقول بدقة ما هي البيئة. عملية قرار ماركوف هي ذلك القول — وثمرتها معادلة تكرارية واحدة بُني عليها المجال كله.

01 / 13
ML 101
M14 · L02
الافتراض

خاصية ماركوف

الحالة والفعل الحاليان يحددان ما يأتي بعدهما. والتاريخ لا يضيف شيئًا. وضعية الشطرنج ماركوفية؛ وإطار فيديو واحد لكرة متحركة ليس كذلك — لا سرعة فيه.

الدينامية
S_{t+1},\, R_{t+1} \sim p(\cdot,\cdot \mid S_t, A_t)
02 / 13
ML 101
M14 · L02
الصياغة

خمسة أجزاء

  • S — الحالات، وبعضها نهائي
  • A — الأفعال، وقد تعتمد على الحالة
  • p — احتمالات الانتقال إلى s′ وr
  • r — دالة المكافأة، وهي خاصية البيئة
  • γ — عامل الخصم، 0 ≤ γ ≤ 1
03 / 13
ML 101
M14 · L02
الهدف

العائد المخصوم

الوكيل لا يعظّم المكافأة التالية بل كل ما بعدها. والفعل في الزمن t يكسب Rt+1، فيبدأ المجموع من هناك — غير مخصوم، لأن γ0 = 1.

العائد
G_t = \sum_{k=0}^{\infty} \gamma^k R_{t+k+1}
04 / 13
ML 101
M14 · L02
لماذا الخصم

ثلاثة أسباب

  • مجموع مكافآت لا ينتهي قد يكون لا نهائيًا، واللانهايات لا تُقارَن
  • الأقرب أفضل حقًا — عشر خطوات تتجاوز ألفًا
  • المستقبل البعيد غير مؤكد، فوازِنه بأقل
  • γ = 0 قصير النظر؛ وقريبًا من 1 بعيد النظر وأبطأ تعلمًا؛ و0.9 إلى 0.99 معتاد
  • γ = 1 فقط حين يكون انتهاء الحلقات مضمونًا
05 / 13
ML 101
M14 · L02
السياسة والقيمة

ما تساويه الحالة

السياسة π(a | s) تعطي احتمال كل فعل. وقيمة الحالة هي العائد الذي ينبغي أن تتوقعه منها — ولا تكون إلا تحت سياسة ما. والدليل العلوي ليس زخرفة.

قيمة الحالة
V^{\pi}(s) = \mathbb{E}_{\pi}\left[ G_t \mid S_t = s \right]
06 / 13
ML 101
M14 · L02
الأنفع

قيمة الفعل

خُذ الفعل a أولًا، ثم اتبع π. مع V عليك النظر أمامًا عبر النموذج لتقارن الأفعال؛ ومع Q تقارن أرقامًا مفهرسة حسب الفعل أصلًا. ولهذا يتعلّم الدرس 14.3 قيمة Q.

قيمة الفعل
Q^{\pi}(s,a) = \mathbb{E}_{\pi}\left[ G_t \mid S_t = s, A_t = a \right]
07 / 13
ML 101
M14 · L02
بلمان، 1957

القيمة، تكراريًا

العائد ينقسم إلى المكافأة التالية زائد العائد المخصوم من حيث تهبط. خُذ المتوسط على السياسة، ثم على البيئة. معادلة خطية واحدة لكل حالة.

بلمان للتوقع
V^{\pi}(s) = \sum_a \pi(a \mid s) \sum_{s',r} p(s',r \mid s,a) \left[ r + \gamma V^{\pi}(s') \right]
08 / 13
ML 101
M14 · L02
تغيير واحد

من متوسط إلى حدٍّ أقصى

الوكيل الأمثل لا يأخذ متوسط ما قد يفعله — بل يأخذ أفضل فعل. والتوقع على البيئة يبقى، لأنك لا تستطيع أن تعظّم على ما يفعله العالم. والمعادلة لم تبقَ خطية.

بلمان للأمثلية
V^{*}(s) = \max_a \sum_{s',r} p(s',r \mid s,a) \left[ r + \gamma V^{*}(s') \right]
09 / 13
ML 101
M14 · L02
محلولة يدويًا

مَمرّ من أربع خلايا

الحالات 1 و2 و3 والهدف G على استقامة واحدة. يمينًا من 3 يدفع 1 وينهي الحلقة؛ وكل حركة أخرى تدفع 0. γ = 0.9، وكل القيم تبدأ من 0. ثلاثة مرورات لتحديث الأمثلية وتُحَلّ.

المرور 1
V(3) = 1
المرور 2
V(2) = 0.9
المرور 3
V(1) = 0.81
اقرأها
القيمة تهبط بعامل γ لكل خطوة بعيدًا عن الهدف. تصرّف بجَشَع فتحصل على «يمينًا دائمًا» — دون بحث.
10 / 13
ML 101
M14 · L02
خوارزميتان

تكرار القيمة أم السياسة

  • تكرار القيمة — مرِّر تحديث الأمثلية حتى لا يتغير شيء
  • تكرار السياسة — قيّم السياسة مضبوطًا، ثم اجعلها جَشِعة، وكرّر
  • تكرار القيمة أرخص في المرور؛ وتكرار السياسة يحتاج دورات أقل
  • السياسة تصبح مثلى عادةً قبل أن تستقر القيم
  • وكلاهما يحتاج p — ولا أحد يسلّمك دينامية مستودع
11 / 13
ML 101
اختبار سريع

تحقّق ممّا ثبت

أربعة أسئلة من هذا الدرس. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت. ولا شيء يُسجَّل أو يُحفَظ.

السؤال 1 من 0
النتيجة 0/0

12 / 13
ML 101
ملخص
مراجعة

ما تعلّمته

عملية قرار ماركوف هي S وA وp وr وγ، قائمةً على خاصية ماركوف. والعائد يخصم المستقبل. وV تقول ما تساويه الحالة تحت سياسة؛ وQ تقول ما يساويه الفعل. ومعادلتا بلمان تجعلان كلتيهما تكرارية، والبرمجة الدينامية تحلّهما حين تكون p معروفة.

اكتمل الدرس
الدرس 14.3: تعلُّم Q ←
13 / 13