ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation
ChainVLA एक 1.2B-पैरामीटर वाला विजन-लैंग्वेज-एक्शन पॉलिसी है जो कार्य प्रगति के लिए रिकरेंट वर्किंग मेमोरी और निरंतर एक्शन जनरेशन के लिए मोशन टेलिंग को संयोजित करने वाले एक एकीकृत, परिवर्तनीय निष्पादन अवस्था (एग्जीक्यूशन स्टेट) के माध्यम से क्रमिक प्रश्नों को जोड़कर श्रेष्ठ लॉन्ग-होरइजन मैनिपुलेशन प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को अपना बिखरा हुआ कमरा साफ करना सिखा रहे हैं। आप उसे एक सरल निर्देश देते हैं: "खिलौनों को हटा दो।" एक रोबोट जो बहुत छोटे, अलग-थलग चरणों में सोचता है, वह फर्श की ओर देख सकता है, एक लाल ब्लॉक उठा सकता है, और उसे एक डिब्बे में रख सकता है। फिर, वह रुक जाता है। वह भूल जाता है कि उसने अभी-अभी वह ब्लॉक उठाया था। वह फिर से फर्श की ओर देखता है, एक नीला ब्लॉक देखता है, और उसे उठा लेता है। लेकिन क्या होगा अगर वह लाल ब्लॉक वास्तव में नीले ब्लॉक के नीचे रखा जाना चाहिए था? या क्या होगा अगर रोबट को यह याद रखने की ज़रूरत है कि उसने कमरे का बायां हिस्सा पहले ही साफ कर दिया है, ताकि वह वापस वहां न जाए? यह "लॉन्ग-होराइजन मैनिपुलेशन" (long-horizon manipulation) की चुनौती है। यह केवल एक हाथ हिलाने के बारे में नहीं है; यह अपने हाथों के व्यस्त होने के दौरान अपने दिमाग में एक चलती हुई कहानी बनाए रखने के बारे में है।
रोबोटिक्स की दुनिया में, वैज्ञानिक विजन-लैंग्वेज-एक्शन (VLA) पॉलिसी नामक चीज़ का उपयोग करते हैं। इन्हें रोबोट का मस्तिष्क समझें, जो कैमरे को देखता है (विज़न/दृष्टि), आपके निर्देशों को पढ़ता है (भाषा), और निर्णय लेता है कि क्या करना है (एक्शन/क्रिया)। आमतौर पर, ये मस्तिष्क छोटे अंतराल में काम करते हैं। वे अगले कुछ सेकंड के लिए एक योजना बनाते हैं, वे चालें चलते हैं, और फिर तुरंत एक नया प्लान शून्य से बनाने के लिए रुक जाते हैं। यह एक उपन्यास लिखने की कोशिश करने जैसा है जहाँ आप एक वाक्य लिखते हैं, पिछले वाक्य की अपनी स्मृति मिटा देते हैं, और फिर केवल वर्तमान पृष्ठ के आधार पर अगले वाक्य का अनुमान लगाने की कोशिश करते हैं। समस्या यह है कि रोबोट अक्सर कहानी का सूत्र खो देता है। वह भूल जाता है कि उसने अभी क्या हासिल किया है या भ्रमित हो जाता है क्योंकि उसकी नई योजना उस गति से टकरा जाती है जो वह पहले से ही कर रहा था। यह पेपर पूछता है: हम एक ऐसा रोबोट कैसे बना सकते हैं जो अपनी कहानी को याद रखे और अपनी गतिविधियों को सुचारू बनाए रखे, वह भी वास्तविक समय में दुनिया को देखते हुए?
एक स्मृति और एक संवेग वाला रोबोट
मिलिए ChainVLA से। यह शोधकर्ताओं द्वारा "भुलक्कड़ रोबोट" की समस्या को हल करने के लिए डिज़ाइन किया गया एक नए प्रकार का रोबोट मस्तिष्क है। कल्पना कीजिए कि आप एक घुमावदार रास्ते पर साइकिल चला रहे हैं। सीधा रहने के लिए, आपको दो चीजों की आवश्यकता होती है: आपको यह याद रखने की आवश्यकता है कि आप कहाँ रहे हैं (क्या आपने अभी बाएँ मुड़ा था? क्या आगे कोई पहाड़ी आ रही है?), और आपको सुचारू रूप से पैडल मारना जारी रखना होगा ताकि आप डगमगाएँ और गिर न जाएँ। ChainVLA रोबोटिक भुजाओं के लिए ठीक यही करने के लिए बनाया गया है।
आज के अधिकांश रोबोट मस्तिष्क एक ऐसे व्यक्ति की तरह काम करते हैं जो एक फोटो लेता है, एक निर्णय लेता है, फोटो को नीचे रखता है, एक नई फोटो लेता है, और एक नया निर्णय लेता है। वे पिछले निर्णय की "अनुभूति" को अगले निर्णय में नहीं ले जाते हैं। ChainVLA इन निर्णयों को एक साथ जोड़कर खेल बदल देता है। यह एक विशेष "एक्जीक्यूशन स्टेट" (execution state) बनाता है जो एक बैकपैक की तरह काम करता है जिसे रोबोट पहनता है। इस बैकपैक में दो बहुत महत्वपूर्ण हिस्से हैं:
- "कहानी" वाला हिस्सा (प्रोग्रेस कॉन्टेक्स्ट): इसमें इस बात की स्मृति होती है कि रोबोट ने पहले ही क्या हासिल कर लिया है। यह एक मानसिक चेकलिस्ट की तरह है। यदि रोबोट ने अभी एक ब्लॉक को बाईं ओर स्थानांतरित किया है, तो यह हिस्सा याद रखेगा, "ठीक है, बायां हिस्सा साफ है।" यह एक त्वरित, वर्किंग मेमोरी (अभी क्या हो रहा है) को एक स्पार्स, लॉन्ग-टर्म मेमोरी (महत्वपूर्ण घटनाएँ जो कुछ समय पहले हुई थीं, जैसे "मैंने पहले लाल ब्लॉक को हटाया") के साथ जोड़ता है। यह रोबट को यह जानने में मदद करता है कि वह बड़े कार्य के चित्र में कहाँ है।
- "संवेग" वाला हिस्सा (मोशन टेल): यह सबसे दिलचस्प हिस्सा है। जब रोबोट चलने का निर्णय लेता है, तो वह केवल "आगे बढ़ो" नहीं कहता। वह अगले कुछ सेकंड के लिए चालों के एक पूरे क्रम की भविष्यवाणी करता है। लेकिन वह वास्तव में केवल पहले कुछ कदम ही चलता है और फिर दोबारा सोचने के लिए रुक जाता है। "मोशन टेल" उस भविष्यवाणी का वह हिस्सा है जो अभी तक किया नहीं गया है। ChainVla इस अधूरे प्लान को सहेज लेता है और इसे अगले चरण के लिए रोबोट के मस्तिष्क में वापस फीड कर देता है। यह एक धावक की तरह है जो, जूता बाँधने के लिए रुकने के बाद भी, ठीक से याद रखता है कि वह कितनी तेज़ और किस दिशा में दौड़ रहा था, ताकि उसे शून्य से शुरू न करना पड़े।
व्यवहार में यह कैसे काम करता है
शोधकर्ताओं ने इस विचार का परीक्षण कुछ कठिन कार्यों पर किया। इनमें से एक सबसे कठिन कार्य "पुट बैक ब्लॉक" (Put Back Block) था। कल्पना कीजिए कि एक रोबलेट को एक स्थान पर ब्लॉक ले जाना है, फिर एक अन्य वस्तु को हटाना है, और अंत में ब्लॉक को उसी मूल स्थान पर वापस रखना है। समस्या क्या है? जब तक रोबोट ब्लॉक को वापस रखने के लिए तैयार होता है, तब तक मूल स्थान नई वस्तु द्वारा कैमरे से छिपा हुआ हो सकता है। एक सामान्य रोबोट क्या करेगा? वह कैमरे की ओर देखेगा, कुछ भी नहीं देखेगा, और भ्रमित हो जाएगा। वह भूल जाएगा कि वह स्थान कहाँ था।
हालाँकि, ChainVLA अपने "स्टोरी" हिस्से का उपयोग यह याद रखने के लिए करता है, "हे, मैंने वह ब्लॉक पहले वहाँ रखा था, भले ही मैं अब उसे देख नहीं पा रहा हूँ।" साथ ही, इसका "मोशन टेल" हिस्सा यह सुनिश्चित करता है कि जब वह ब्लॉक वापस रखने के लिए चलता है, तो वह अपनी भुजा को किसी अजीब, नए दिशा में झटके से न घुमाए जो उस दिशा से टकराती हो जहाँ उसकी भुजा अभी इशारा कर रही थी।
इसके परिणाम काफी नाटकीय थे। RMBench नामक एक कठिन परीक्षण पर, ChainVLA 62.8% बार सफल रहा। अन्य स्मार्ट रोबोटों से तुलना करें:
- यदि आप "स्टोरी" (प्रोग्रेस कॉन्टेक्स्ट) को हटा देते हैं, तो सफलता दर गिरकर 3.0% रह जाती है। रोबोट कार्य को पूरी तरह से भूल जाता है।
- यदि आप "मोशन टेल" को हटा देते हैं, तो सफलता दर गिरकर 11.2% हो जाती है। रोबोट कार्य को तो याद रखता है लेकिन इतनी अनाड़ी तरह से चलता है कि वह विफल हो जाता है।
यह दर्शाता है कि दोनों हिस्से आवश्यक हैं। "स्टोरी" रोबोट को बताती है कि क्या करना है, और "मोशन टेल" इसे बिना लड़खड़ाए सुचारू रूप से करने में मदद करती है।
यह क्यों महत्वपूर्ण है
पेपर सुझाव देता है कि "अधूरे मोशन" को जीवित रखना वास्तव में कार्य को याद रखने के लिए महत्वपूर्ण है। यह एक नृत्य की तरह है: यदि आप चरणों के बीच में नृत्य करना पूरी तरह से बंद कर देते हैं, तो आप लय भूल सकते हैं। लेकिन यदि आप लय को जारी रखते हैं (मोशन टेल), तो आपका मस्तिष्क कोरियोग्राफी (प्रोग्रेस कॉन्टेक्स्ट) को बेहतर ढंग से याद रखने में सक्षम होता है।
जब शोधकर्ताओं ने रोबोट की अनाड़ीपन को ठीक करने के लिए केवल उन चालों को स्मूथ करने की कोशिश की जो रोबोट ने पहले ही तय कर ली थीं (जो अन्य रोबोटों में एक सामान्य तकनीक है), तो यह काम नहीं आया। रोबोट फिर भी विफल रहा। यह साबित करता है कि रहस्य केवल चालों को सुंदर दिखाने के बारे में नहीं है; यह अगली चाल के विचार को नया निर्णय लेने से पहले रोबोट के मस्तिष्क में फीड करने के बारे में है।
संक्षेप में, ChainVLA सुझाव देता है कि लंबे, जटिल कार्यों को संभालने के लिए, रोबोटों को केवल फोटो खींचने वाले कैमरे की तरह नहीं, बल्कि एक ऐसे कहानीकार की तरह होना चाहिए जो किताब में अपनी जगह कभी नहीं खोता, और साथ ही संगीत की ताल पर अपने पैर चलते रहने चाहिए। यह उन रोबोटों की ओर एक छोटा सा कदम है जो वास्तविक जीवन के बिखरे हुए, बहु-चरणीय कार्यों में हमें बिना भ्रमित हुए या सब कुछ गिराए बिना वास्तव में मदद कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।