Commit to the Bit: Reactive Reinforcement Learning Done Right
تقدم هذه الورقة البحثية خوارزمية "التعلم بـ Q الملتزم" (Committed Q-learning)، وهي خوارزمية جديدة تحقق التقارب شبه المؤكد نحو سياسة تفاعلية مثلى في البيئات الحتمية ذات الإدراك الجزئي، وذلك بموجب افتراض "متانة إعادة التوصيل" (rewire-robustness) الأضعف، من خلال جعل سياسة السلوك تلتزم بإجراء واحد لكل سمة حتى يتغير الإدراك.