Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation
تقدم هذه الورقة البحثية Robo-Dopamine 2.0، وهو نموذج مكافأة عملية يعتمد على التاريخ وواعٍ بالخروج عن التوزيع (OOD-aware)، يستفيد من التنبؤ الزوجي، وفضاءات التقدم الموقعة، ومنهج "القفزة الموقعة" (Signed-Hop) للتغلب على قيود المكافآت المتفرقة والتقييم البصري الثابت، مما يؤدي إلى تحسين متانة ومعدلات نجاح نماذج الرؤية واللغة والعمل (VLA) في مهام التلاعب الروبوتي بشكل كبير.