StaQ: a Finite Memory Approach to Discrete Action Policy Mirror Descent
تقترح هذه الورقة وتتحقق من صحة "StaQ"، وهي خوارزمية ذات ذاكرة محدودة للتعلم التعزيزي ذي الإجراءات المنفصلة، والتي تقرب عملية "هبوط مرآة السياسة" (Policy Mirror Descent) عبر الاحتفاظ بآخر من دالات فقط، محققةً بذلك الفوائد النظرية لمتوسط الخطأ دون التعقيد الحسابي للمجموع اللانهائي، مع إثبات تجريبي بأن قيمة الكافية تؤدي إلى أداء مماثل لعملية "هبوط مرآة السياسة" الدقيقة.