عمليات قرار ماركوف
وصف الدرس 14.1 الحلقة. ولكي تحسب أي شيء عليك أن تقول بدقة ما هي البيئة. عملية قرار ماركوف هي ذلك القول — وثمرتها معادلة تكرارية واحدة بُني عليها المجال كله.
خاصية ماركوف
الحالة والفعل الحاليان يحددان ما يأتي بعدهما. والتاريخ لا يضيف شيئًا. وضعية الشطرنج ماركوفية؛ وإطار فيديو واحد لكرة متحركة ليس كذلك — لا سرعة فيه.
خمسة أجزاء
- S — الحالات، وبعضها نهائي
- A — الأفعال، وقد تعتمد على الحالة
- p — احتمالات الانتقال إلى s′ وr
- r — دالة المكافأة، وهي خاصية البيئة
- γ — عامل الخصم، 0 ≤ γ ≤ 1
العائد المخصوم
الوكيل لا يعظّم المكافأة التالية بل كل ما بعدها. والفعل في الزمن t يكسب Rt+1، فيبدأ المجموع من هناك — غير مخصوم، لأن γ0 = 1.
ثلاثة أسباب
- مجموع مكافآت لا ينتهي قد يكون لا نهائيًا، واللانهايات لا تُقارَن
- الأقرب أفضل حقًا — عشر خطوات تتجاوز ألفًا
- المستقبل البعيد غير مؤكد، فوازِنه بأقل
- γ = 0 قصير النظر؛ وقريبًا من 1 بعيد النظر وأبطأ تعلمًا؛ و0.9 إلى 0.99 معتاد
- γ = 1 فقط حين يكون انتهاء الحلقات مضمونًا
ما تساويه الحالة
السياسة π(a | s) تعطي احتمال كل فعل. وقيمة الحالة هي العائد الذي ينبغي أن تتوقعه منها — ولا تكون إلا تحت سياسة ما. والدليل العلوي ليس زخرفة.
قيمة الفعل
خُذ الفعل a أولًا، ثم اتبع π. مع V عليك النظر أمامًا عبر النموذج لتقارن الأفعال؛ ومع Q تقارن أرقامًا مفهرسة حسب الفعل أصلًا. ولهذا يتعلّم الدرس 14.3 قيمة Q.
القيمة، تكراريًا
العائد ينقسم إلى المكافأة التالية زائد العائد المخصوم من حيث تهبط. خُذ المتوسط على السياسة، ثم على البيئة. معادلة خطية واحدة لكل حالة.
من متوسط إلى حدٍّ أقصى
الوكيل الأمثل لا يأخذ متوسط ما قد يفعله — بل يأخذ أفضل فعل. والتوقع على البيئة يبقى، لأنك لا تستطيع أن تعظّم على ما يفعله العالم. والمعادلة لم تبقَ خطية.
مَمرّ من أربع خلايا
الحالات 1 و2 و3 والهدف G على استقامة واحدة. يمينًا من 3 يدفع 1 وينهي الحلقة؛ وكل حركة أخرى تدفع 0. γ = 0.9، وكل القيم تبدأ من 0. ثلاثة مرورات لتحديث الأمثلية وتُحَلّ.
تكرار القيمة أم السياسة
- تكرار القيمة — مرِّر تحديث الأمثلية حتى لا يتغير شيء
- تكرار السياسة — قيّم السياسة مضبوطًا، ثم اجعلها جَشِعة، وكرّر
- تكرار القيمة أرخص في المرور؛ وتكرار السياسة يحتاج دورات أقل
- السياسة تصبح مثلى عادةً قبل أن تستقر القيم
- وكلاهما يحتاج p — ولا أحد يسلّمك دينامية مستودع
ما تعلّمته
عملية قرار ماركوف هي S وA وp وr وγ، قائمةً على خاصية ماركوف. والعائد يخصم المستقبل. وV تقول ما تساويه الحالة تحت سياسة؛ وQ تقول ما يساويه الفعل. ومعادلتا بلمان تجعلان كلتيهما تكرارية، والبرمجة الدينامية تحلّهما حين تكون p معروفة.