💻 computer science
WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation
यह शोध पत्र WARP-RM को प्रस्तुत करता है, जो एक पूर्णतः स्व-पर्यवेक्षित (self-supervised) रिवॉर्ड मॉडल है जो टाइम-वॉर्प्ड सफल प्रदर्शनों (time-warped successful demonstrations) से सघन सापेक्ष प्रगति संकेत (dense relative progress signals) उत्पन्न करता है ताकि WARP-BC को सक्षम बनाया जा सके, जो एक व्यवहार क्लोनिंग (behavior cloning) विधि है जो मिश्रित-गुणवत्ता वाले डेटा से एक्शन चंक्स (action chunks) को फ़िल्टर और पुन: भारित (reweight) करके लंबी अवधि के कार्यों (long-horizon tasks) पर रोबोट के प्रदर्शन में महत्वपूर्ण सुधार करती है।
Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Phi (…)2026-09-09