← नवीनतम पेपर
🤖 AI

RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models

RePO-VLA एक रिकवरी-ड्रिवन पॉलिसी ऑप्टिमाइज़ेशन फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन मॉडल्स के लिए है, जो सफलता, विफलता और रिकवरी ट्रेजेक्टरीज के बीच अंतर करके लॉन्ग-होरइज़न, कॉन्टैक्ट-रिच मैनिपुलेशन में मजबूती को बढ़ाता है ताकि एक वैल्यू-कंडीशन्ड पॉलिसी को प्रशिक्षित किया जा सके जो बिना किसी ऑनलाइन फेल्योर डिटेक्टर के स्वायत्त रूप से निष्पादन ड्रिफ्ट (execution drift) को ठीक करने में सक्षम हो।

मूल लेखक: Weijia Liufu, Xiaoyu Guo, Ruiyi Chen, Jingzhi Liu, Kaidong Zhang, Xiwen Liang, Jianqi Lin, Dawei Sun, Yuze Wang, Rongtao Xu, Bingqian Lin, Bowen Yang, Tongtong Cao, Bowen Peng, Dongyu Zhang, Guangrun
प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weijia Liufu, Xiaoyu Guo, Ruiyi Chen, Jingzhi Liu, Kaidong Zhang, Xiwen Liang, Jianqi Lin, Dawei Sun, Yuze Wang, Rongtao Xu, Bingqian Lin, Bowen Yang, Tongtong Cao, Bowen Peng, Dongyu Zhang, Guangrun Wang, Min Wang, Liang Lin, Xiaodan Liang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जटिल भोजन बनाना या एक नाजुक तौलिया मोड़ना सिखा रहे हैं। आप उसे एक वीडियो दिखाते हैं जिसमें एक इंसान इसे पूरी तरह से कर रहा है। रोबोट वीडियो देखता है, सीखता है और आपकी नकल करने की कोशिश करता है।

समस्या: "परफेक्ट रेसिपी" का जाल
वर्तमान रोबट (जिन्हें विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है) परफेक्ट वीडियो की नकल करने में बहुत अच्छे होते हैं। लेकिन जीवन अव्यवस्थित है। यदि रोबोट एक चम्मच गिरा देता है, गीले फर्श पर फिसल जाता है, या एक कप को अजीब कोण पर पकड़ लेता है, तो वह भ्रमित हो जाता है। क्योंकि उसे केवल परफेक्ट वीडियो पर प्रशिक्षित किया गया था, इसलिए उसे नहीं पता कि गलत होने पर क्या करना है। वह बस मूल "परफेक्ट" स्क्रिप्ट का पालन करने की कोशिश करता रहता है, भले ही स्थिति बदल गई हो, जिससे दुर्घटना हो जाती है। यह उस ड्राइवर की तरह है जिसने केवल खाली हाईवे पर गाड़ी चलाना सीखा है; जैसे ही कोई गड्ढा आता है, उसे नहीं पता कि स्टीयरिंग कैसे घुमाना है।

समाधान: RePO-VLA (द रिकवरी कोच)
यह शोध पत्र एक नई विधि पेश करता है जिसे RePO-VLA कहा जाता है। केवल रोबोट को परफेक्ट वीडियो दिखाने के बजाय, यह तरीका रोबोट को तीन विशिष्ट चीजें सिखाता है:

  1. सफलता (Success): इसे सही तरीके से कैसे करें।
  2. विफलता (Failure): जब चीजें गलत होती हैं तो क्या होता है।
  3. रिकवरी (Recovery): गलती को कैसे सुधारें और वापस पटरी पर कैसे आएं।

इसे एक जिम्नास्ट को प्रशिक्षित करने की तरह समझें। आप उन्हें केवल एक परफेक्ट लैंडिंग नहीं दिखाते। आप उन्हें यह भी दिखाते हैं कि वे गिरते हैं, और फिर उन्हें खुद को संभालकर वापस उठते हुए भी दिखाते हैं। रोबोट सीखता है कि गिरना दुनिया का अंत नहीं है; यह केवल रणनीति बदलने का एक संकेत है।

यह कैसे काम करता है: तीन सरल चरण

  1. "फ्रेश स्टार्ट" ट्रिक (रिकवरी-अवेयर इनिशियलाइजेशन)
    जब कोई रोबोट गिरता है, तो वह अक्सर उस गलती को याद रखता है जिसके कारण वह गिरा था। यदि आप उसे समस्या ठीक करने के लिए कहते हैं, तो वह अपनी गलती को अपने दिमाग में दोहराने में फंस सकता है।
  • समाधान: RePO-VLA वीडियो के "रिकवरी" वाले हिस्से को लेता है और "गलती" वाले हिस्से को काट देता है। यह सुधार शुरू होने से ठीक पहले रोबोट की मेमोरी को रीसेट कर देता है। यह रोबोट को यह बताने जैसा है, "कैसे गिरे उसे भूल जाओ। बस यह देखो कि तुम अभी कहाँ हो और वापस कैसे उठना है, यह पता लगाओ।" यह रोबोट को गिरने के कारण और समाधान के बीच भ्रमित होने से रोकता है।
  1. "प्रोग्रेस थर्मामीटर" (सिमेंटिक वैल्यू फंक्शन)
    यह सिस्टम वीडियो के हर क्षण को एक "स्कोर" देता है।
  • हाई स्कोर (1.0): आप लक्ष्य की ओर बढ़ रहे हैं।
  • लो स्कोर (0.0): आप लक्ष्य से दूर जा रहे हैं या दुर्घटना होने वाली है।
  • जादू: यदि रोबोट फिसलता है, तो स्कोर गिर जाता है। लेकिन यदि वह फिसलन को ठीक करने लगता है, तो स्कोर वापस ऊपर चला जाता है। रोबोट इस "थर्मामीटर" को देखना सीखता है। यदि स्कोर कम है, तो वह जानता है कि अपना वर्तमान प्लान रोकना है और स्कोर को वापस हाई करने के लिए एक अलग चाल चलनी है। वह यह अंतर करना सीख जाता है कि "कड़ी मेहनत कर रहा हूँ पर असफल हो रहा हूँ" और "वास्तव में समस्या को ठीक कर रहा हूँ" के बीच।
  1. "गोल-ओरिएंटेड" ड्राइव (वैल्यू-कंडीशन्ड रिफाइनमेंट)
    जब रोबोट वास्तव में वास्तविक दुनिया में काम कर रहा होता है, तो सिस्टम उसे कहता है: "उच्चतम संभव स्कोर (1.0) के लिए लक्ष्य रखें।"
  • यदि रोबोट रास्ते से भटक जाता है, तो "स्कोर" गिर जाता है। क्योंकि रोबोट को हाई स्कोर के पीछे भागने के लिए प्रशिक्षित किया गया है, वह स्वचालित रूप से "रिकवरी मोड" में स्विच कर जाता है ताकि सुरक्षित पथ पर वापस आ सके। उसे किसी इंसान द्वारा "रुको!" चिल्लाने या किसी विशेष सेंसर द्वारा क्रैश का पता लगाने की आवश्यकता नहीं होती। वह बस स्कोर को गिरते हुए देखता है और सहज रूप से खुद को ठीक करता है।

परीक्षण: FRBench
यह साबित करने के लिए कि यह काम करता है, शोधकर्ताओं ने FRBench नामक एक परीक्षण बनाया। कल्पना कीजिए कि एक वीडियो गेम है जहाँ रोबोट पानी डालने या तौलिया मोड़ने की कोशिश कर रहा है, लेकिन गेम मास्टर चुपके से रोबोट को धक्का देता है या वस्तु को फिसलने देता है।

  • पुराने रोबोट: धक्का दिए जाने पर, वे हवा में पानी डालने की कोशिश करते रहे या तौलिया गलत तरीके से मोड़ते रहे, जिससे अंततः वे विफल हो गए।
  • RePO-VLA रोबोट: धक्का दिए जाने पर, इसने महसूस किया कि स्कोर गिर रहा है, इसने खराब मूव को रोका, और पानी डालने या तौलिया मोड़ने का एक नया तरीका खोजा, और सफलतापूर्वक कार्य पूरा किया।

परिणाम
परीक्षणों में, पुराने रोबोट चीजें गलत होने पर केवल 20% बार सफल होते थे। नया RePO-VLA रोबोट लगभग 75% बार सफल रहा। वास्तविक रोबोटों के साथ वास्तविक दुनिया के परीक्षणों में, इसने 80% तक सफलता प्राप्त की।

संक्षेप में
RePO-VLA रोबोट को सिखाता है कि विफलता केवल डेटा है। गलतियों को तोड़कर, यादों को रीसेट करके और रोबोट को एक "स्कोर" के पीछे भागने के लिए देकर, यह एक नाजुक रोबोट को एक लचीले रोबोट में बदल देता है जो अपनी समस्याओं को खुद ठीक कर सकता है। यह एक ऐसे छात्र के बीच का अंतर है जो उत्तर कुंजी रट लेता है और एक ऐसे छात्र के बीच का अंतर है जो यह सीखता है कि प्रश्न बदलने पर भी समस्या को कैसे हल किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →