← नवीनतम पेपर
💻 computer science

CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding

CycleVLA विज़न-लैंग्वेज-एक्शन मॉडल्स के लिए एक सक्रिय आत्म-सुधार प्रणाली है जो सबटास्क बैकट्रैकिंग और मिनिमम बेयस रिस्क डिकोडिंग के माध्यम से प्रारंभिक विफलताओं का पूर्वानुमान लगाती है और उनसे उबरती है, जो सिमुलेशन और वास्तविक दुनिया के रोबोटिक मैनिपुलेशन कार्यों दोनों में अत्याधुनिक बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करती है।

मूल लेखक: Chenyang Ma, Kai Lu, Guangyu Yang, Jiuming Liu, Shitong Xu, Bill Byrne, Ioannis Havoutis, Niki Trigoni, Andrew Markham

प्रकाशित 2026-07-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenyang Ma, Kai Lu, Guangyu Yang, Jiuming Liu, Shitong Xu, Bill Byrne, Ioannis Havoutis, Niki Trigoni, Andrew Markham

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। आप उसे कहते हैं, "ब्रेड पर हैम रखो।" एक मानक रोबोट हैम उठा सकता है, ब्रेड की ओर चल सकता है, और उसे फर्श पर गिरा सकता है क्योंकि उसने यह ध्यान नहीं दिया कि उसकी ग्रिपर थोड़ी टेढ़ी थी। जब तक उसे एहसास होता है कि हैम फर्श पर गिर गया है, तब तक सैंडविच खराब हो चुका होता है। उसे फिर से शुरुआत से शुरू करना पड़ता है, या इससे भी बुरा, बस गंदगी फैलाकर छोड़ देता है। अधिकांश वर्तमान रोबोट "मस्तिष्क" इसी तरह काम करते हैं: उन्हें अपनी गलती का एहसास तभी होता है जब आपदा पहले ही घटित हो चुकी होती है।

लेकिन इंसान अलग होते हैं। यदि आपको अपने हाथ से कांच का गिलास फिसलता हुआ महसूस होता है, तो आप उसके टूटने से पहले अपनी पकड़ मजबूत कर लेते हैं। यदि आप देखते हैं कि आपकी कार फुटपाथ की ओर जा रही है, तो आप टकराने से पहले उसे वापस मोड़ लेते हैं। इसे प्रोएक्टिव सेल्फ-करेक्शन (सक्रिय आत्म-सुधार) कहा जाता है। यह कुछ गलत होने का अहसास करने की क्षमता है जबकि आप वह काम कर रहे होते हैं और उसे तुरंत ठीक कर देते हैं। रोबोटिक्स का क्षेत्र रोबोटों को यही सुपरपावर देने की कोशिश कर रहा है। ऐसा करने के लिए, शोधकर्ता विज़न-लैंग्वेज-एक्शन (VLA) मॉडल का उपयोग करते हैं। इन्हें ऐसे समझें कि ये ऐसे रोबोट हैं जो दुनिया को देख सकते हैं (विज़न), आपके बोले गए निर्देशों को समझ सकते हैं (लैंग्वेज), और यह पता लगा सकते हैं कि काम करने के लिए उन्हें अपने हाथों को बिल्कुल कैसे हिलाना है (एक्शन)। बड़ा सवाल यह है: क्या हम रोबोटों को उतना ही सावधान और आत्म-जागरूक बना सकते हैं जितना कि एक इंसान होता है, जो विफलताओं में बदलने से पहले अपनी गलतियों को पकड़ सके?

यह पेपर साइकिलवीएलए (CycleVLA) नामक एक नई प्रणाली पेश करता है, जो रोबोटों को कार्य को बर्बाद करने से पहले त्रुटियों को पकड़ने के लिए एक "दूसरा मौका" देती है। किसी दुर्घटना का इंतजार करने के बजाय, साइकिलवीएलए एक सतर्क कोच की तरह काम करती है जो रोबोट के बगल में खड़ा होकर हर कदम पर नज़र रखता है। यह बड़े कार्यों को छोटे, प्रबंधनीय चरणों में तोड़ देता है (जैसे "हैम उठाना" और "ब्रेड पर रखना")। जैसे ही रोबोट प्रत्येक छोटा चरण पूरा करता है, सिस्टम उसकी प्रगति की जांच करता है। यदि रोबंडा चरण लगभग पूरा होने वाला है लेकिन थोड़ा डगमगा रहा है—जैसे कि एक ग्रिपर जो पूरी तरह से संरेखित नहीं है—तो सिस्टम रुक जाता है और एक शक्तिशाली "स्मार्ट ब्रेन" (एक विज़न-लैंग्वेज मॉडल) को इसे देखने के लिए कहता है।

यह स्मार्ट ब्रेन एक जासूस की तरह काम करता है। वह पूछता है, "क्या रोबोट हैम गिराने वाला है?" यदि उत्तर हाँ है, तो रोबोट गिरने का इंतज़ार नहीं करता। इसके बजाय, वह उस विशिष्ट चरण के प्रारंभ पर वापस जाने के लिए एक "रिवाइंड" बटन दबाता है, जैसे कि वीडियो गेम का कोई पात्र पिछले चेकपॉइंट पर पुनर्जीवित (respawn) होता है। फिर, वह फिर से प्रयास करता है, लेकिन इस बार वह मिनिमम बेयस रिस्क (MBR) डिकोडिंग नामक एक विशेष तकनीक का उपयोग करता है। कल्पना कीजिए कि रोबोट अपने हाथ को हिलाने का सबसे अच्छा तरीका अनुमान लगाने की कोशिश कर रहा है। केवल एक अनुमान लगाने के बजाय, वह आठ अलग-अलग संभावित चालें उत्पन्न करता है, उन सभी को देखता है, और उस चाल को चुनता है जिस पर सभी सहमत हैं कि वह सबसे सुरक्षित और सबसे अधिक सफल होने की संभावना वाली है। यह "आम सहमति" वाली चाल बहुत अधिक विश्वसनीय होती है।

शोधकर्ताओं ने इसे दो तरीकों से परखा: एक कंप्यूटर सिमुलेशन में और एक वास्तविक रोबोटिक आर्म पर। सिमुलेशन में, उन्होंने रोबोटों पर हर तरह की समस्याएँ डालीं, जैसे वस्तुओं को इधर-उधर करना या रोशनी बदलना। साइकिलवीएलए जानबूझकर सिस्टम में डाली गई गलतियों में से लगभग 80% को ठीक करने में सक्षम था। एक वास्तविक रोबोट पर, इसने एक चायदानी को एक छोटे से पेग पर लटकाने जैसे कठिन कार्यों पर 91% सफलता दर हासिल की, जहाँ केवल 1.5 सेमी की जगह खाली थी। यहाँ तक कि जब रोबोट "अंडर-ट्रेन्ड" (यानी उसने पर्याप्त अभ्यास नहीं किया था और आमतौर पर उस कार्य में खराब प्रदर्शन करता था) था, तब भी साइकिलवीएलए ने इसे बहुत बेहतर प्रदर्शन करने में मदद की, लगभग एक पूरी तरह से प्रशिक्षित रोबट के समान।

यह पेपर इस विचार के विरुद्ध तर्क देता है कि रोबोटों को सीखने या सुधार करने के लिए विफल होने तक प्रतीक्षा करनी चाहिए। यह दिखाता है कि कार्यों को छोटे हिस्सों में बांटकर, चेतावनी के संकेतों पर नज़र रखकर, और "रिवाइंड और रिट्राय" की रणनीति अपनाकर, रोबोट बहुत अधिक मजबूत बन सकते हैं। हालाँकि, लेखक यह नोट करने में भी सावधान हैं कि यह हर चीज़ के लिए जादुई समाधान नहीं है। सिस्टम इस बात पर निर्भर करता है कि रोबोट अपनी भौतिक स्थिति को "रिवाइंड" करने में सक्षम हो, जो कि उन अराजक वातावरणों में कठिन हो सकता है जहाँ चीजों को बदला नहीं जा सकता। इसके अलावा, गलतियों की जाँच करना और कई अनुमान उत्पन्न करना, कार्य को केवल एक बार करने की तुलना में अधिक समय और कंप्यूटिंग शक्ति लेता है। लेकिन फिलहाल, साइकिलवीएलए सुझाव देता है कि रोबोटों को एक सक्रिय "गट चेक" (अंतर्ज्ञान की जाँच) देना उन्हें अधिक सुरक्षित और विश्वसनीय सहायक बनाने का एक शक्तिशाली तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →