Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism
تقدم هذه الورقة NEUBAY، وهو خوارزمية تعلم تعزيزي غير متصل (offline) تعتمد على النماذج وذات أفق طويل، تستبدل التحفظ الصريح بمنظور بايزي للتعامل بفعالية مع عدم اليقين المعرفي وتحقيق أداء رائد في مجموعات بيانات متنوعة.