From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning
تقدم الورقة البحثية DICE-RL، وهو إطار عمل للتعلم المعزز كفء في استهلاك العينات يعمل على صقل سياسات الروبوت التوليدية سابقة التدريب إلى خبراء عاليي الأداء باستخدام تقنية تقليص التوزيع لتضخيم السلوكيات الناجحة من خلال التغذية الراجعة عبر الإنترنت، مما يمكّن من إتقان مهام المناولة المعقدة طويلة المدى من مدخلات بكسلية في كل من بيئات المحاكاة والواقع الفعلي.