SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning
يقدم SOLE-R1 نموذج استدلال لغوي-بصري يعمل كإشارة مكافأة وحيدة للتعلم التعزيزي على الروبوتات من خلال توليد تقديرات تقدم كثيفة لكل خطوة زمنية عبر استدلال تسلسلي مكاني-زماني، مما يمكن الروبوتات من إتقان مهام التلاعب غير المرئية دون الحاجة إلى مكافآت حقيقية أو عروض توضيحية، مع التفوق على المقيمات اللغوية-البصرية الحالية في المتانة ومعدلات النجاح.