FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference
FlashVLA एक एकीकृत स्ट्रीमिंग एक्शन डिकोडिंग फ्रेमवर्क है जो चंक-वाइज कॉज़ल अटेंशन के साथ एक मल्टी-चंक एक्शन बफ़र को बनाए रखकर तेज़, एसिंक्रोनस VLA इन्फरेंस को सक्षम बनाता है, जिससे सुचारू, टेम्पोरल रूप से सुसंगत रोबोटिक निष्पादन सुनिश्चित करते हुए 30Hz से अधिक नियंत्रण आवृत्ति प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
ऐसे रोबोट जो देख सकें, समझ सकें और मानवीय दक्षता के साथ हिल-डुल सकें, लंबे समय से स्वचालन (ऑटोमेशन) का एक परम लक्ष्य रहे हैं। वर्षों से, शोधकर्ताओं ने ऐसे सिस्टम बनाए हैं जो मेज पर रखे कप को पहचान सकते हैं या "इसे उठाओ" जैसे मौखिक आदेश का पालन कर सकते हैं। हालाँकि, उस समझ को सुचारू, वास्तविक समय की भौतिक गति में बदलना एक कठिन बाधा बना हुआ है। मुख्य कठिनाई समय (टाइमिंग) में निहित है: एक रोबोट को लगातार दुनिया को देखना होगा, उस छवि को प्रोसेस करना होगा, यह तय करना होगा कि आगे क्या करना है, और फिर अपने हाथ को हिलाना होगा, वह भी एक सेकंड के एक अंश के भीतर। यदि सोचने की प्रक्रिया में बहुत अधिक समय लगता है, तो रोबोट पिछड़ जाता है, पुरानी जानकारी पर कार्य करता है और अपने लक्ष्य को चूक जाता है। यह देरी विजन-लैंग्वेज-एक्शन (Vision-Language-Action) मॉडल के रूप में जानी जाने वाली नवीनतम पीढ़ी के रोबोटिक मस्तिष्क में विशेष रूप से गंभीर है। ये सिस्टम शक्तिशाली हैं क्योंकि वे देखने और पढ़ने की क्षमता को गतिविधियों की योजना बनाने की क्षमता के साथ जोड़ते हैं, लेकिन वे धीमे भी हैं। वे अक्सर एक गति को छोटे टुकड़ों में तोड़ने और मोटर को कमांड भेजने से पहले क्रमिक, समय लेने वाली गणनाओं की एक श्रृंखला के माध्यम से प्रत्येक टुकड़े को परिष्कृत करने के तरीके से काम करते हैं। इसका परिणाम एक ऐसा रोबोट होता है जो हिचकिचाता है, अटकता है, या एक ऐसी देरी (लैग) के साथ चलता है जो नाजuk कार्यों को असंभव बना देती है।
इसे हल करने के लिए, यूसी सैन डिएगो और एमआईटी के शोधकर्ताओं की एक टीम ने 'फ्लैशवीएलए' (FlashVLA) नामक एक नया फ्रेमवर्क पेश किया है, जिसे इन रोबोटिक मस्तिष्कों को क्रमिक (sequentially) के बजाय एक साथ सोचने और चलने के लिए डिज़ाइन किया गया है। कल्पना कीजिए कि एक फैक्ट्री असेंबली लाइन में एक कर्मचारी उत्पाद के पूरी तरह से निरीक्षण होने तक अगले उत्पाद को शुरू करने के लिए प्रतीक्षा करता है; इससे लाइन बार-बार रुकती है। फ्लैशवीएलए इस वर्कफ़्लो को इस तरह बदलता है कि कार्यकर्ता हमेशा एक ही समय में उत्पाद के विभिन्न चरणों को संभाल रहा होता है, जिससे एक निरंतर, स्थिर प्रवाह सुनिश्चित होता है। तकनीकी शब्दों में, शोधकर्ताओं ने एक बार में एक पूर्ण गति को डिकोड करने की पुरानी पद्धति को एक "स्ट्रीमिंग" दृष्टिकोण से बदल दिया है। एक पूर्ण गति योजना के पूर्ण होने का इंतजार करने के बजाय, सिस्टम पूर्णता के विभिन्न चरणों में कई गति योजनाओं का एक 'बफर' बनाए रखता है। कुछ योजनाएं लगभग पूरी हो चुकी हैं और निष्पादित करने के लिए तैयार हैं, जबकि अन्य अभी शुरू ही हुई हैं और अभी भी परिष्कृत की जा रही हैं। सिस्टम इन सभी योजनाओं को एक ही चरण में, एक साथ अपडेट करता है, और तुरंत सबसे अधिक पूर्ण योजना को रोबोट के मोटरों को भेज देता है। यह रोबोट को तब भी चलते रहने की अनुमति देता है जब कंप्यूटर अगले कुछ चरणों को समझने में लगा होता है, जो प्रभावी रूप से सोचने में लगने वाले समय को छिपा देता है।
इस बदलाव का प्रभाव नाटकीय है। अपने परीक्षणों में, शोधकर्ताओं ने पाया कि इस स्ट्रीमिंग पद्धति ने मानक दृष्टिकोण की तुलना में एक एकल क्रिया उत्पन्न करने के लिए आवश्यक समय को बीस गुना तक कम कर दिया। एक सिंगल ग्राफिक्स कार्ड पर, सिस्टम ने प्रति सेकंड कम से कम तीस बार नियंत्रण आवृत्ति (control frequency) प्राप्त की, जो एक मानव पर्यवेक्षक के लिए तात्कालिक महसूस होती है। अधिक महत्वपूर्ण बात यह है कि यह गति सटीकता की कीमत पर नहीं आई। चूंकि सिस्टम इन गति के टुकड़ों को एक साथ प्रोसेस करता है, इसलिए भविष्य के चरण स्वाभाविक रूप से उन चरणों से सीखते हैं जो अभी होने वाले हैं। यह एक सुचारू, निरंतर गति बनाता है जो उन झटकेदार, विखंडित गतियों से बचता है जो अक्सर पुरानी जानकारी पर कार्य करने वाले रोबोटों को परेशान करती हैं। सिम्युलेटेड वातावरण और रोबोटिक भुजाओं के वास्तविक दुनिया के परीक्षणों में, नया सिस्टम धीमे, पारंपरिक मॉडलों की तुलना में सफलता दर के बराबर या उससे बेहतर प्रदर्शन करता है, जबकि यह काफी तेजी से चलता है।
शोधकर्ताओं ने यह भी पाया कि इस पद्धति ने रोबोटों को आश्चर्यजनक रूप से लंबे, जटिल कार्यों में बेहतर बनाया। जब एक रोबोट को ऐसे कार्यों का क्रम पूरा करना होता है जिसमें लंबा समय लगता है, तो नए सिस्टम की आगे देखने और तत्काल अतीत को याद रखने की क्षमता उसे ट्रैक पर रहने में मदद करती है। लंबे समय तक चलने वाले कार्यों (long-horizon tasks) से जुड़े प्रयोगों के एक सेट में, सफलता दर पिछले सर्वश्रेष्ठ तरीके की तुलना में छत्तीस प्रतिशत से अधिक बढ़ गई। यह सुझाव देता है कि जिस तरह से सिस्टम अपनी वर्तमान क्रियाओं को अपनी भविष्य की योजनाओं से जोड़ता है, वह एक प्रकार की अल्पकालिक स्मृति (short-term memory) बनाता है जो रोबोट को बिना भटके जटिल अनुक्रमों को नेविगेट करने में मदद करता है। टीम ने विभिन्न रोबोटिक सेटअपों, जिनमें सिंगल-आर्म और टू-आर्म सिस्टम शामिल हैं, पर इन विचारों का परीक्षण किया और पाया कि गति और सुचारूता में सुधार विभिन्न हार्डवेयर और विभिन्न प्रकार के कार्यों में भी समान रूप से प्रभावी रहे।
यह कार्य विशेष रूप से महत्वपूर्ण क्यों है, इसका कारण यह है कि यह दो समस्याओं को एक साथ हल करता है: गणना की सुस्ती और जो रोबोट देखता है और जहाँ वह वास्तव में है, उसके बीच का अंतर। सुस्ती को ठीक करने के पिछले प्रयासों ने अक्सर रोबोट को पुराने डेटा पर कार्य कराया, जबकि डेटा के अंतर को ठीक करने के प्रयासों के लिए अक्सर जटिल, अतिरिक्त गणनाओं की आवश्यकता होती थी जो रोबोट को फिर से धीमा कर देती थीं। फ्लैशवीएलए इस ट्रेड-ऑफ को हटा देता है क्योंकि यह सोचने की प्रक्रिया को ही निरंतर बनाता है। शोधकर्ताओं ने प्रदर्शित किया कि केवल अपने मूवमेंट प्लान को प्रोसेस करने के तरीके को बदलकर—तैयार होने के विभिन्न चरणों में योजनाओं का एक रोलिंग बफर रखकर—वे उस स्तर की तरलता (fluidity) प्राप्त कर सकते थे जो पहले पहुंच से बाहर थी। परिणाम एक ऐसा रोबोट है जो तेजी से प्रतिक्रिया कर सकता है, सुचारू रूप से चल सकता है, और जटिल हेरफेर कार्यों को उस विश्वसनीयता के साथ संभाल सकता है जो चुस्त, वास्तविक दुनिया के स्वचालन के सपने को वास्तविकता के एक कदम और करीब लाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।