Pretraining in Actor-Critic Reinforcement Learning for Robot Locomotion
تقترح هذه الورقة نموذجاً للتدريب المسبق والضبط الدقيق لحركة الروبوتات يستفيد من استراتيجية استكشاف غير مرتبطة بمهمة محددة لتدريب نموذج ديناميكيات عكسية للحس العميق (PIDM)، والذي يُستخدم بعد ذلك لبدء تشغيل خوارزميات الممثل-الناقد مثل PPO، مما يؤدي إلى تحسينات كبيرة في كفاءة العينات وأداء المهام عبر هياكل روبوتية متنوعة.