SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation
यह शोध पत्र SARM का प्रस्ताव करता है, जो एक स्टेज-अवेयर, वीडियो-आधारित रिवॉर्ड मॉडलिंग फ्रेमवर्क है जो टी-शर्ट फोल्डिंग जैसे लॉन्ग-होरिज़ॉन, कॉन्टैक्ट-रिच कार्यों के लिए सुसंगत सुपरविजन उत्पन्न करने हेतु प्राकृतिक भाषा एनोटेशन का लाभ उठाता है, जो एक नवीन रिवॉर्ड-अलाइन्ड बिहेवियर क्लोनिंग (RA-BC) पद्धति के माध्यम से डाउनस्ट्रीम पॉलिसी ट्रेनिंग को महत्वपूर्ण रूप से बढ़ाता है।