Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation
यह शोध पत्र Robo-Dopamine 2.0 का परिचय देता है, जो एक इतिहास-सशर्त (history-conditioned) और OOD-जागरूक प्रोसेस रिवॉर्ड मॉडल है जो पेयरवाइज प्रेडिक्शन (pairwise prediction), साइन्ड प्रोग्रेस स्पेस (signed progress spaces) और एक साइन्ड-हॉप करिकुलम (Signed-Hop curriculum) का लाभ उठाता है ताकि स्पार्स रिवार्ड्स (sparse rewards) और स्टेटिक विजुअल इवैल्यूएशन की सीमाओं को दूर किया जा सके, जिससे रोबोटिक मैनिपुलेशन कार्यों में विजन-लैंग्वेज-एक्शन मॉडल्स की मजबूती और सफलता दर में उल्लेखनीय सुधार होता है।