Behavior-Consistent Deep Reinforcement Learning
تقدم هذه الورقة البحثية "اختلاف المئينات لقيمة-Q" (QED)، وهو جدول زمني لدرجة الحرارة يعتمد على الحالة ويستفيد من اختلاف الناقد المزدوج لتقليل تباعد السياسة عبر التشغيلات بشكل كبير في تعلم التعزيز ذي الإنتروبيا القصوى مع الحفاظ على أداء عالٍ عبر مهام التحكم المستمر.