Bayesian policy gradient and actor-critic algorithms
تقترح هذه الورقة إطاراً بايزياً لخوارزميات تدرج السياسة والفاعل-الناقد، يقوم بنمذجة التدرجات ودوال قيمة الفعل باستخدام العمليات الغاوسية لتقليل تعقيد العينات، وتوفير تقديرات لعدم اليقين، وتحقيق تحديثات خلفية ذات صيغة مغلقة، مما يؤدي إلى التفوق على طرق مونت كارلو التقليدية في مهام مختلفة من التعلم المعزز.