RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
RePO-VLA एक रिकवरी-ड्रिवन पॉलिसी ऑप्टिमाइज़ेशन फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन मॉडल्स के लिए है, जो सफलता, विफलता और रिकवरी ट्रेजेक्टरीज के बीच अंतर करके लॉन्ग-होरइज़न, कॉन्टैक्ट-रिच मैनिपुलेशन में मजबूती को बढ़ाता है ताकि एक वैल्यू-कंडीशन्ड पॉलिसी को प्रशिक्षित किया जा सके जो बिना किसी ऑनलाइन फेल्योर डिटेक्टर के स्वायत्त रूप से निष्पादन ड्रिफ्ट (execution drift) को ठीक करने में सक्षम हो।