RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
RePO-VLA एक रिकवरी-ड्रिवन पॉलिसी ऑप्टिमाइज़ेशन फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन मॉडल्स के लिए है, जो सफलता, विफलता और रिकवरी ट्रेजेक्टरीज के बीच अंतर करके लॉन्ग-होरइज़न, कॉन्टैक्ट-रिच मैनिपुलेशन में मजबूती को बढ़ाता है ताकि एक वैल्यू-कंडीशन्ड पॉलिसी को प्रशिक्षित किया जा सके जो बिना किसी ऑनलाइन फेल्योर डिटेक्टर के स्वायत्त रूप से निष्पादन ड्रिफ्ट (execution drift) को ठीक करने में सक्षम हो।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को जटिल भोजन बनाना या एक नाजुक तौलिया मोड़ना सिखा रहे हैं। आप उसे एक वीडियो दिखाते हैं जिसमें एक इंसान इसे पूरी तरह से कर रहा है। रोबोट वीडियो देखता है, सीखता है और आपकी नकल करने की कोशिश करता है।
समस्या: "परफेक्ट रेसिपी" का जाल
वर्तमान रोबट (जिन्हें विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है) परफेक्ट वीडियो की नकल करने में बहुत अच्छे होते हैं। लेकिन जीवन अव्यवस्थित है। यदि रोबोट एक चम्मच गिरा देता है, गीले फर्श पर फिसल जाता है, या एक कप को अजीब कोण पर पकड़ लेता है, तो वह भ्रमित हो जाता है। क्योंकि उसे केवल परफेक्ट वीडियो पर प्रशिक्षित किया गया था, इसलिए उसे नहीं पता कि गलत होने पर क्या करना है। वह बस मूल "परफेक्ट" स्क्रिप्ट का पालन करने की कोशिश करता रहता है, भले ही स्थिति बदल गई हो, जिससे दुर्घटना हो जाती है। यह उस ड्राइवर की तरह है जिसने केवल खाली हाईवे पर गाड़ी चलाना सीखा है; जैसे ही कोई गड्ढा आता है, उसे नहीं पता कि स्टीयरिंग कैसे घुमाना है।
समाधान: RePO-VLA (द रिकवरी कोच)
यह शोध पत्र एक नई विधि पेश करता है जिसे RePO-VLA कहा जाता है। केवल रोबोट को परफेक्ट वीडियो दिखाने के बजाय, यह तरीका रोबोट को तीन विशिष्ट चीजें सिखाता है:
- सफलता (Success): इसे सही तरीके से कैसे करें।
- विफलता (Failure): जब चीजें गलत होती हैं तो क्या होता है।
- रिकवरी (Recovery): गलती को कैसे सुधारें और वापस पटरी पर कैसे आएं।
इसे एक जिम्नास्ट को प्रशिक्षित करने की तरह समझें। आप उन्हें केवल एक परफेक्ट लैंडिंग नहीं दिखाते। आप उन्हें यह भी दिखाते हैं कि वे गिरते हैं, और फिर उन्हें खुद को संभालकर वापस उठते हुए भी दिखाते हैं। रोबोट सीखता है कि गिरना दुनिया का अंत नहीं है; यह केवल रणनीति बदलने का एक संकेत है।
यह कैसे काम करता है: तीन सरल चरण
- "फ्रेश स्टार्ट" ट्रिक (रिकवरी-अवेयर इनिशियलाइजेशन)
जब कोई रोबोट गिरता है, तो वह अक्सर उस गलती को याद रखता है जिसके कारण वह गिरा था। यदि आप उसे समस्या ठीक करने के लिए कहते हैं, तो वह अपनी गलती को अपने दिमाग में दोहराने में फंस सकता है।
- समाधान: RePO-VLA वीडियो के "रिकवरी" वाले हिस्से को लेता है और "गलती" वाले हिस्से को काट देता है। यह सुधार शुरू होने से ठीक पहले रोबोट की मेमोरी को रीसेट कर देता है। यह रोबोट को यह बताने जैसा है, "कैसे गिरे उसे भूल जाओ। बस यह देखो कि तुम अभी कहाँ हो और वापस कैसे उठना है, यह पता लगाओ।" यह रोबोट को गिरने के कारण और समाधान के बीच भ्रमित होने से रोकता है।
- "प्रोग्रेस थर्मामीटर" (सिमेंटिक वैल्यू फंक्शन)
यह सिस्टम वीडियो के हर क्षण को एक "स्कोर" देता है।
- हाई स्कोर (1.0): आप लक्ष्य की ओर बढ़ रहे हैं।
- लो स्कोर (0.0): आप लक्ष्य से दूर जा रहे हैं या दुर्घटना होने वाली है।
- जादू: यदि रोबोट फिसलता है, तो स्कोर गिर जाता है। लेकिन यदि वह फिसलन को ठीक करने लगता है, तो स्कोर वापस ऊपर चला जाता है। रोबोट इस "थर्मामीटर" को देखना सीखता है। यदि स्कोर कम है, तो वह जानता है कि अपना वर्तमान प्लान रोकना है और स्कोर को वापस हाई करने के लिए एक अलग चाल चलनी है। वह यह अंतर करना सीख जाता है कि "कड़ी मेहनत कर रहा हूँ पर असफल हो रहा हूँ" और "वास्तव में समस्या को ठीक कर रहा हूँ" के बीच।
- "गोल-ओरिएंटेड" ड्राइव (वैल्यू-कंडीशन्ड रिफाइनमेंट)
जब रोबोट वास्तव में वास्तविक दुनिया में काम कर रहा होता है, तो सिस्टम उसे कहता है: "उच्चतम संभव स्कोर (1.0) के लिए लक्ष्य रखें।"
- यदि रोबोट रास्ते से भटक जाता है, तो "स्कोर" गिर जाता है। क्योंकि रोबोट को हाई स्कोर के पीछे भागने के लिए प्रशिक्षित किया गया है, वह स्वचालित रूप से "रिकवरी मोड" में स्विच कर जाता है ताकि सुरक्षित पथ पर वापस आ सके। उसे किसी इंसान द्वारा "रुको!" चिल्लाने या किसी विशेष सेंसर द्वारा क्रैश का पता लगाने की आवश्यकता नहीं होती। वह बस स्कोर को गिरते हुए देखता है और सहज रूप से खुद को ठीक करता है।
परीक्षण: FRBench
यह साबित करने के लिए कि यह काम करता है, शोधकर्ताओं ने FRBench नामक एक परीक्षण बनाया। कल्पना कीजिए कि एक वीडियो गेम है जहाँ रोबोट पानी डालने या तौलिया मोड़ने की कोशिश कर रहा है, लेकिन गेम मास्टर चुपके से रोबोट को धक्का देता है या वस्तु को फिसलने देता है।
- पुराने रोबोट: धक्का दिए जाने पर, वे हवा में पानी डालने की कोशिश करते रहे या तौलिया गलत तरीके से मोड़ते रहे, जिससे अंततः वे विफल हो गए।
- RePO-VLA रोबोट: धक्का दिए जाने पर, इसने महसूस किया कि स्कोर गिर रहा है, इसने खराब मूव को रोका, और पानी डालने या तौलिया मोड़ने का एक नया तरीका खोजा, और सफलतापूर्वक कार्य पूरा किया।
परिणाम
परीक्षणों में, पुराने रोबोट चीजें गलत होने पर केवल 20% बार सफल होते थे। नया RePO-VLA रोबोट लगभग 75% बार सफल रहा। वास्तविक रोबोटों के साथ वास्तविक दुनिया के परीक्षणों में, इसने 80% तक सफलता प्राप्त की।
संक्षेप में
RePO-VLA रोबोट को सिखाता है कि विफलता केवल डेटा है। गलतियों को तोड़कर, यादों को रीसेट करके और रोबोट को एक "स्कोर" के पीछे भागने के लिए देकर, यह एक नाजुक रोबोट को एक लचीले रोबोट में बदल देता है जो अपनी समस्याओं को खुद ठीक कर सकता है। यह एक ऐसे छात्र के बीच का अंतर है जो उत्तर कुंजी रट लेता है और एक ऐसे छात्र के बीच का अंतर है जो यह सीखता है कि प्रश्न बदलने पर भी समस्या को कैसे हल किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।