Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
एजेंटिक-वीएलए (Agentic-VLA) विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक कुशल ऑनलाइन अनुकूलन ढांचा है जो रोबोटिक मैनिपुलेशन बेंचमार्क पर सामान्यीकरण, नमूना दक्षता और क्रॉस-टास्क ट्रांसफर को महत्वपूर्ण रूप से सुधारने के लिए एडेप्टिव रिवॉर्ड सिंथेसिस, लैंग्वेज-गाइडेड एक्सप्लोरेशन और एक्सपीरियंस मेमोरी का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखाने की कोशिश कर रहे हैं, जैसे कि स्टोवपॉट का उपयोग करके एक विशिष्ट प्रकार की कॉफी बनाना। अतीत में, आपको रोबोट को सैकड़ों बार, चरण-दर-चरण दिखाना पड़ता था कि यह कैसे किया जाता है। यदि रोबोट बर्तन गिरा देता या स्टोव थोड़ी अलग जगह पर होता, तो वह भ्रमित हो जाता और पूरी तरह से विफल हो जाता। यह एक ऐसे छात्र की तरह था जिसने किसी विशिष्ट परीक्षा के उत्तर रट लिए हों लेकिन अगर संख्याएँ बदल जाएँ तो वह समान समस्या को हल नहीं कर पाता।
यह शोध पत्र Agentic-VLA पेश करता है, जो रोबोट को प्रशिक्षित करने का एक नया तरीका है जो एक कठोर छात्र की तरह कम और एक मददगार गुरु के साथ एक समझदार प्रशिक्षु (apprentice) की तरह अधिक काम करता है। केवल वही कॉपी करने के बजाय जो वे देखते हैं, यह सिस्टम यह सीखता है कि कैसे सीखा जाए।
यह कैसे काम करता है, इसे तीन सरल "सुपरपावर्स" में विभाजित किया गया है:
1. स्मार्ट कोच (Adaptive Reward Synthesis)
समस्या: आमतौर पर, एक रोबोट को कार्य के अंत में केवल "अच्छा काम किया!" या "फिर से प्रयास करें!" मिलता है। यदि कार्य लंबा है (जैसे खाना बनाना), तो रोबोट को पता नहीं चलता कि उसने किस विशिष्ट चरण में गलती की है।
समाधान: Agentic-VLA एक कोच की तरह काम करता है जो एक बड़े लक्ष्य को छोटे, प्रबंधनीय चरणों में तोड़ देता है।
- उपमा: साइकिल चलाना सीखने की कल्पना करें। एक बुरा कोच बस कहता है, "तुम रेस हार गए।" एक स्मार्ट कोच कहता है, "समतल जमीन पर संतुलन बनाने के लिए बहुत बढ़िया! अब, आइए बाएं मुड़ने की कोशिश करें। आप थोड़ा डगमगाए थे, इसलिए आइए उस पर ध्यान केंद्रित करें।"
- यह कैसे काम करता है: यह सिस्टम एक जटिल कार्य (जैसे "कॉफी बनाना") को छोटे उप-लक्ष्यों ("स्टोव खोजें," "इसे चालू करें," "बर्तन खोजें") में स्वतः विभाजित करता है। फिर यह रोबлот को देखता है। यदि रोबोट स्टोव खोजने में पहले से ही अच्छा है, तो कोच उस काम के लिए अंक देना बंद कर देता है और रोबोट का ध्यान उस हिस्से पर केंद्रित करता है जिसमें वह संघर्ष कर रहा है (जैसे बर्तन रखना)। यह एक कस्टम "पाठ्यक्रम" बनाता है जो रोबोट के बेहतर होने पर ही कठिन होता जाता है।
2. मददगार मार्गदर्शक (Language-Guided Exploration)
समस्या: जब रोबोट अपने आप सीखने की कोशिश करते हैं, तो वे अक्सर बेतरतीब ढंग से हाथ-पैर मारते हैं, जैसे कोई बच्चा पियानो की कुंजियों को तब तक पीट रहा हो जब तक कि कोई स्वर न मिल जाए। इससे बहुत समय और ऊर्जा बर्बाद होती है।
समाधान: बेतरतीब अनुमान लगाने के बजाय, रोबोट को साधारण अंग्रेजी में संकेत मिलते हैं।
- उपमा: कल्पना कीजिए कि आप एक अस्त-व्यस्त कमरे में छिपी हुई चाबी ढूंढने की कोशिश कर रहे हैं। एक रैंडम खोज का मतलब है अंधेरे में हर कालीन के नीचे और हर दराज में देखना। एक "लैंग्वेज-गाइडेड" खोज एक दोस्त की तरह है जो फुसफुसाता है, "हे, मुझे लगता है कि तुम गलत कोण से देख रहे हो; मेज के बाईं ओर देखने की कोशिश करो।"
- यह कैसे काम करता है: एक विशेष "क्रिटिक" मॉडल यह देखता है कि रोबोट क्या कर रहा है और प्राकृतिक भाषा में विशिष्ट परिवर्तन सुझाता है, जैसे "बाईं ओर से वस्तु के पास जाने की कोशिश करें" या "बेहतर स्थिरता के लिए केंद्र को पकड़ें।" यह रोबोट को रैंडम ट्रायल-एंड-एरर की तुलना में बहुत तेज़ी से अच्छी रणनीतियों को खोजने में मदद करता है।
3. मेमोरी बुक (Experience Memory)
समस्या: यदि एक रोबोट दराज खोलना सीखता है, तो उसे कैबिनेट खोलने के लिए फिर से शून्य से शुरुआत करनी पड़ती है, भले ही दोनों गतिविधियाँ समान हों।
समाधान: रोबोट अपनी पिछली सफलताओं की एक "लाइब्रेरी" रखता है।
- उपमा: इसे एक ऐसे शेफ के रूप में सोचें जिसने प्याज काटना सीख लिया है। जब उन्हें लहसुन काटना होता है, तो वे शून्य से शुरू नहीं करते; वे याद रखते हैं, "मुझे पता है कि चाकू को कैसे पकड़ना है और गति भी लगभग समान है।"
- यह कैसे काम करता है: जब रोबोट के सामने कोई नया कार्य आता है, तो वह अपने मेमोरी बुक में अपने पहले से सीखे गए किसी समान कार्य को खोजता है। वह एक खाली स्लेट के बजाय उस समान कार्य के कौशल के साथ "वार्म अप" करता है। यह उसे बहुत कम डेटा के साथ नई चीजें तेजी से सीखने में सक्षम बनाता है।
परिणाम: उन्होंने क्या पाया?
शोधकर्ताओं ने LIBERO (रोबोट हेरफेर कार्यों का एक सेट) नामक बेंचमार्क पर और एक ड्यूल-आर्म रोबोट टेस्ट पर RoboTwin पर इस नए सिस्टम का परीक्षण किया। यहाँ क्या हुआ:
- लंबे कार्य: रोबोट लंबे, बहु-चरणीय कार्यों को पूरा करने में पिछले तरीकों की तुलना में 12.3% बेहतर हुआ।
- एक उदाहरण से सीखना: एक "वन-शॉट" टेस्ट में (जहाँ रोबोट सीखने से पहले केवल एक बार कार्य देखता है), इसमें 28.5% का सुधार हुआ। यह बहुत कम डेटा के साथ बहुत तेज़ी से सीख सकता है।
- जीरो टू हीरो: बिना किसी विशिष्ट उदाहरण के, रोबोट अभी भी लगभग 31% समय इसे करने का तरीका निकाल लेता था, जबकि पुराने तरीके 100% विफल हो जाते थे।
- गति: यह सिस्टम अन्य ऑनलाइन लर्निंग विधियों की तुलना में 2.4 गुना तेज़ सीखता है, जिसका अर्थ है कि इसे किसी कार्य में कुशल होने के लिए बहुत कम प्रयासों की आवश्यकता थी।
सारांश
Agentic-VLA एक ऐसा फ्रेमवर्क है जो रोबोट को बेहतर सीखने वाला बनाता है। केवल मनुष्यों द्वारा किए जाने वाले कार्यों के वीडियो को रटने के बजाय, यह कार्यों को तोड़ने के लिए एक स्मार्ट कोच, भाषा-आधारित संकेत देने के लिए एक मददगार मार्गदर्शक, और पिछले कौशल का पुन: उपयोग करने के लिए एक मेमोरी बुक का उपयोग करता है। यह रोबोट को नए वातावरण के अनुकूल होने और पहले की तुलना में बहुत कम डेटा और समय के साथ जटिल कार्य सीखने में सक्षम बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।