Revisiting Mixture Policies in Entropy-Regularized Actor-Critic
تقترح هذه الورقة مُقدِّر إعادة المعلمة الهامشية (MRP) للتغلب على التباين العالي لطرق نسبة الاحتمال القياسية في سياسات المزيج، مما يثبت أن هذا النهج يمكّن سياسات المزيج من مضاهاة أو تجاوز أداء السياسات الغاوسية في مهام التعلم التعزيزي للفعل المستمر.