Q-Learning With World Models
تقترح الورقة البحثية إطار عمل QWM، الذي يدمج نماذج العالم مع تعلم Q القياسي لإجراء بحث في وقت الاختبار عبر مسارات متخيلة لاختيار الإجراءات، مما يحقق كفاءة عينة وأداءً فائقين في معايير التحكم الروبوتي مع تجنب تراكم انحياز النموذج من خلال التدريب حصرياً على الانتقالات الحقيقية.