Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time
यह शोध पत्र एक रिट्रीवल-ऑगमेंटेड (retrieval-augmented) दृष्टिकोण का प्रस्ताव करता है जो एक सस्ते एम्बॉडमेंट (embodiment) से प्रदर्शन (demonstrations) को इंडेक्स करके टेस्ट के समय फ्रोजन विजन-लैंग्वेज-एक्शन मॉडल्स को नए कार्यों तक विस्तारित करता है, जिससे अनसीन टास्क और एम्बॉडमेंट्स पर बेहतर प्रदर्शन प्राप्त करते हुए प्रति-कार्य फाइन-ट्यूनिंग की आवश्यकता समाप्त हो जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक रोबोट है जिसे नए काम सीखने की जरूरत है। पारंपरिक रूप से, रोबोट को एक नया काम सिखाना (जैसे किसी विशिष्ट कैबिनेट को खोलना या बोतल को डिब्बे में रखना) एक व्यक्तिगत ट्यूटर को हर एक नए कौशल के लिए काम पर रखने जैसा है। आपको यह करना पड़ता है:
- रोबोट को रिकॉर्ड करना जो वह कार्य मैन्युअल रूप से कर रहा है (जो धीमा और महंगा है)।
- रोबोट के मस्तिष्क को फिर से प्रशिक्षित करना विशेष रूप से उस एक कार्य के लिए (जिसमें बहुत अधिक कंप्यूटर पावर और समय लगता है)।
यदि आप चाहते हैं कि रोबोट 100 अलग-अलग काम करे, तो आपको इस महंगे प्रशिक्षण प्रक्रिया को 100 बार करना होगा।
पेपर का बड़ा विचार: "रिट्रेन नहीं, रिट्रीवल (खोज/प्राप्ति)"
लेखक एक स्मार्ट तरीका प्रस्तावित करते हैं जिसे RECAP कहा जाता है। रोबोट के मस्तिष्क को हर बार फिर से प्रशिक्षित करने के बजाय, वे उसे "सस्ते" उदाहरणों की एक लाइब्रेरी देते हैं और उसे उन्हें खोजने (लुक अप करने) का तरीका सिखाते हैं।
यह कैसे काम करता है, सरल उपमाओं का उपयोग करके:
1. दो "शरीर" (एम्बॉडिमेंट्स)
कल्पना कीजिए कि रोबोट एक भारी, अनाड़ी निर्माण कार्यकर्ता (Target) है। उन्हें नए कार्य दिखाना कठिन है क्योंकि वे धीमे हैं और उन्हें नियंत्रित करने के लिए महंगे उपकरणों की आवश्यकता होती है।
अब, कल्पना कीजिए कि एक फुर्तीला मानव हाथ (Pool) है। मानव को कार्य करते हुए फिल्माना आसान है। वे तेज़ हैं, रिकॉर्ड करने में सस्ते हैं, और लगभग कुछ भी कर सकते हैं।
समस्या यह है कि मानव हाथ का हिलना-डुलना निर्माण कार्यकर्ता से अलग होता है। यदि आप कार्यकर्ता को बस "मानव की नकल करने" के लिए कहते हैं, तो वे चीजें तोड़ सकते हैं क्योंकि उनके हाथ अलग हैं।
2. पुराना तरीका बनाम नया तरीका
- पुराना तरीका (Retrain): हर बार जब आप चाहते हैं कि कार्यकर्ता एक नया कार्य सीखे, तो आप एक ट्रेनर को उनके पास खड़ा करते हैं, उन्हें कार्य दिखाते हैं, और फिर उनके मस्तिष्क को करने के लिए घंटों तक ट्यून करते हैं। यह धीमा और महंगा है।
- नया तरीका (RECAP):
- एक बार प्रशिक्षित करें: आप कार्यकर्ता के मस्तिष्क को एक ही बार यह सिखाते हैं कि "मानव हाथ की गति" को "निर्माण कार्यकर्ता की गति" में कैसे अनुवादित किया जाए। आप उन्हें सिखाते हैं: "जब आप मानव हाथ को X करते हुए देखें, तो आप Y करें।"
- मस्तिष्क को फ्रीज करें: एक बार जब वह अनुवाद कौशल सीख लिया जाता है, तो आप मस्तिष्क को लॉक कर देते हैं। अब और कोई प्रशिक्षण नहीं।
- लाइब्रेरी (Retrieval): आप मानव हाथ द्वारा कई अलग-अलग कार्य करने वाले वीडियो की एक लाइब्रेरी बनाते हैं।
- जादू: जब कार्यकर्ता को एक नए कार्य को करने की आवश्यकता होती है जिसे उन्होंने पहले कभी नहीं देखा है, तो आप उन्हें फिर से प्रशिक्षित नहीं करते हैं। इसके बजाय, आप लाइब्रेरी से पूछते हैं: "क्या हमारे पास इस तरह के काम का कोई मानव वीडियो है?"
- परिणाम: कार्यकर्ता सबसे करीबी मानव वीडियो को ढूंढता है, उसे देखता है, और अपने "अनुवाद कौशल" का उपयोग करके यह पता लगाता है कि उसी परिणाम को प्राप्त करने के लिए उसे कैसे हिलना-डुलना चाहिए।
3. "रेसिडुअल" (Residual) ट्रिक (सीक्रेट सॉस)
यह पेपर एक विशेष प्रकार के AI मॉडल का उपयोग करता है (जिसे "वर्ल्ड-एक्शन मॉडल" कहा जाता है) जो एक भविष्यवाणी करने वाले कहानीकार की तरह कार्य करता है।
- मानव वीडियो (योजना): रिट्रीव किया गया वीडियो एक "कोर्स प्लान" (एक मोटा खाका) देता है। यह कहता है, "लक्ष्य वस्तु को यहाँ से वहाँ ले जाना है।"
- रोबोट का काम (सुधार): रोबकट ठीक उसी तरह नकल करने की कोशिश नहीं करता जैसे मानव करता है। इसके बजाय, वह मानव की गति और अपनी आवश्यक गति के बीच के अंतर (जिसे "रेसिड्यू" या अवशेष कहा जाता है) की गणना करता है।
- उपमा: कल्पना कीजिए कि मानव एक 'पिरुएट' (घूमने वाला नृत्य) कर रहा है। रोबोट एक फोर्कलिफ्ट है। रोबोट डांसर की तरह घूमने की कोशिश नहीं करता। वह डांसर की योजना को देखता है ("बाईं ओर घूमो") और गणना करता है, "ठीक है, मुझे उसी परिणाम को प्राप्त करने के लिए अपने पहियों को बाईं ओर घुमाना होगा।"
AI मॉडल न केवल रोबोट की अगली चाल की भविष्यवाणी करने के लिए प्रशिक्षित है, बल्कि यह भी कि अगला दृश्य कैसा दिखेगा। यह एक "रियलिटी चेक" के रूप में कार्य करता है। यदि रोबोट की योजना का परिणाम गड़बड़ी (जैसे बोतल गिरा देना) होगा, तो मॉडल इसे पकड़ लेता है और चाल को सुधार देता है।
4. उन्होंने क्या पाया
शोधकर्ताओं ने तीन तरीकों से इसका परीक्षण किया:
- एक सरल 2D गेम (PushT): उन्होंने रोबोट को एक ब्लॉक को विभिन्न कोणों पर धकेलने के लिए कहा। लाइब्रेरी में अधिक मानव वीडियो जोड़ने से, रोबोट ने बिना किसी अतिरिक्त प्रशिक्षण के, उन नए कोणों पर ब्लॉक को धकेलने में बेहतर प्रदर्शन किया जिन्हें उसने पहले कभी नहीं देखा था।
- एक जटिल सिमुलेशन (RoboTwin): उन्होंने दो-हाथों वाले रोबोट के जटिल कार्यों का परीक्षण किया। उनका "रिट्रीवल" तरीका अन्य तरीकों से बेहतर था जो हर नए काम के लिए रोबोट को फिर से प्रशिक्षित करने की कोशिश करते थे।
- एक वास्तविक रोबट: उन्होंने इसे एक वास्तविक भौतिक रोबोट पर लगाया। उन्होंने एक कार्य (कैबिनेट खोलना) के लिए मानव वीडियो का उपयोग करके इसे प्रशिक्षित किया। फिर, उन्होंने मस्तिष्क को फ्रीज कर दिया। जब हमने उनसे नए कार्य करने के लिए कहा (कैबिनेट बंद करना, बोतल रखना), तो हमने बस लाइब्रेरी में उन कार्यों के मानव वीडियो जोड़ दिए। रोबोट ने सफलतापूर्वक उन्हें करना सीख लिया, जबकि एक मानक रोबोट पूरी तरह विफल रहा।
निचोड़
यह पेपर दिखाता है कि आपको हर नए काम के लिए रोबोट के मस्तिष्क को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। इसके बजाय, आप इसे एक बार यह समझने के लिए प्रशिक्षित कर सकते हैं कि "सस्ते मानव उदाहरणों" को "महंगे रोबोट कार्यों" में कैसे अनुवादित किया जाए। फिर, उसे नया काम सिखाने के लिए, आपको बस लाइब्रेरी में एक नया वीडियो जोड़ना होता है।
यह रोबोट लर्निंग को "हर काम के लिए एक नया मस्तिष्क बनाने" से बदलकर "एक कुकबुक में रेसिपी देखने" में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।