: Training Robots to Reason in Natural Language via Reinforcement Learning
تقدم الورقة البحثية إطار العمل ، وهو إطار عمل لما بعد التدريب يعمل على تعزيز نماذج الرؤية واللغة الجاهزة وتحويلها إلى مستنتجات روبوتية قادرة على توليد توجيهات لغوية طبيعية حرة لسياسات التلاعب منخفضة المستوى، مما يؤدي بشكل كبير إلى تحسين الاستكشاف والتعميم في المهام طويلة الأمد من خلال الجمع بين التدريب المتوسط على آثار الخبراء والتعلم التعزيزي القائم على المعايير.