Cost-Matching Model Predictive Control for Efficient Reinforcement Learning in Humanoid Locomotion
تقترح هذه الورقة إطار عمل للتحكم التنبئي بالنماذج القائم على مطابقة التكلفة، والذي يقوم بتدريب نموذج ديناميكيات مركزي مُعامل لتقريب دوال قيمة الفعل من بيانات عالية الدقة، مما يتيح التعلم الفعال القائم على التدرج من أجل حركة بشرية قوية وعالية الأداء دون العبء الحسابي المتمثل في حل مسائل التحكم التنبئي بالنماذج بشكل متكرر أثناء التدريب.