Reward-Free Continual Adaptation for Resilient Space Robots
تقدم هذه الورقة إطار عمل للتعلم المستمر الخالي من المكافآت يُمكّن الروبوتات الفضائية من التكيف مع التدهور الشديد في الأجهزة عبر الاستفادة من نموذج عالم للحالة الكامنة مُدرب مسبقاً لتحديث ديناميكيات الانتقال عبر عمليات تدحرج غير خاضعة للإشراف وتدريب السياسات على مسارات متخيلة، مما يلغي الحاجة إلى إشارات مكافأة غير قابلة للتنفيذ أثناء النشر.