Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning
تقترح هذه الورقة خوارزمية مبتكرة تخفف من فجوة التقليد في التعلم بالتقليد المدفوع بالتعلم المعزز القائم على الحالة، وذلك عبر تدريب فضاء تضمين مشترك بواسطة التعلم التبايني ذاتي الإشراف لضمان اعتماد سياسات المعلم فقط على المعلومات القابلة للملاحظة، مما يمكّن سياسات الطالب عالية الأداء دون الحاجة إلى ضبط دقيق باستخدام التعلم المعزز بعد التدريب.