Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness
تقدم هذه الورقة أول تنفيذ لإثبات المفهوم لوكيل تعلم تعزيزي "تحت-بايزي" (infra-Bayesian) يتفوق على التعلم التعزيزي الكلاسيكي في متانة الحالة الأسوأ من خلال التعامل بفعالية مع عدم اليقين "النايتي" (Knightian uncertainty) وعدم دقة النموذج عبر عملية اتخاذ قرار "ماكسيمين" (maximin).