← नवीनतम पेपर
💻 computer science

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1 एक एकीकृत स्ट्रीमिंग विजन-लैंग्वेज-एक्शन आर्किटेक्चर पेश करता है जो स्वायत्त ड्राइविंग के लिए एक साझा बैकबोन और मेमोरी चैनल के माध्यम से ऑटोरेग्रेसिव लैंग्वेज रीजनिंग को फ्लो-मैचिंग कंटीन्यूअस एक्शन जनरेशन के साथ एकीकृत करता है, जिससे भाषा-निर्देशित प्रक्षेपवक्र नियंत्रण (ट्रैजेक्टरी कंट्रोल) सक्षम होता है जो वास्तविक समय की थ्रूपुट बनाए रखते हुए WOD-E2E बेंचमार्क पर मानव प्रदर्शन से बेहतर प्रदर्शन करता है।

मूल लेखक: Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

प्रकाशित 2026-05-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को गाड़ी चलाना सिखा रहे हैं। लंबे समय तक, ऐसा करने का सबसे अच्छा तरीका एक ऐसा सिस्टम बनाना था जो केवल सड़क को देखे और तुरंत निर्णय ले कि स्टीयरिंग कैसे घुमानी है या ब्रेक कैसे लगाना है। यह एक प्रतिवर्त (reflex) की तरह है: आप देखते हैं कि एक गेंद आपकी ओर लुढ़क रही है, और आपका हाथ बिना सोचे उसे पकड़ने के लिए हिल जाता है। इस पेपर में, इसे विज़न-टू-एक्शन (VA) मॉडल कहा गया है। यह अविश्वसनीय रूप से तेज़ और सटीक है, लेकिन यह एक "ब्लैक बॉक्स" है। आप इससे यह नहीं पूछ सकते कि इसने कोई कदम क्यों उठाया, और जब यह कुछ अजीब देखता है जो इसने पहले नहीं देखा है, तो यह संघर्ष करता है।

फिर, शोधकर्ताओं ने एक "दिमाग" जोड़ने का प्रयास किया जो बात कर सके और तर्क दे सके, जिससे एक विज़न-लैंग्वेज-एक्शन (VLA) मॉडल बना। विचार यह था: "आइए कार को एक लैंग्वेज मॉडल दें ताकि वह इंसानों की तरह दुनिया को समझ सके।" लेकिन समस्या यह थी: इनमें से अधिकांश नए सिस्टम अनाड़ी थे। वे धीमे थे, वे केवल रिफ्लेक्स वाले मॉडलों की तरह सटीक रूप से स्टीयरिंग नहीं कर पाते थे, और "बात करने" वाले हिस्से ने वास्तव में "ड्राइविंग" वाले हिस्से की मदद नहीं की। यह एक शानदार दार्शनिक को रेस कार चलाने के लिए काम पर रखने जैसा था, लेकिन वह दार्शनिक पीछे की सीट पर बैठा हुआ चिल्ला रहा था और उसके निर्देश इतने देर से पहुँच रहे थे कि वे उपयोगी न रहें।

MindVLA-U1 वह समाधान है जिसे लेखक प्रस्तावित करते हैं। उनका तर्क है कि समस्या यह नहीं थी कि "सोचना" और "गाड़ी चलाना" आपस में असंगत हैं; समस्या यह थी कि उन्हें गलत इंटरफ़ेस के साथ बनाया गया था।

यहाँ बताया गया है कि MindVLA-U1 कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "एक-मस्तिष्क" आर्किटेक्चर (The "One-Brain" Architecture)

अलग-अलग "सोचने वाले" मॉड्यूल और अलग-अलग "ड्राइविंग" मॉड्यूल रखने के बजाय, जो एक-दूसरे को नोट्स भेजते हैं, MindVLA-U1 एक एकल, एकीकृत मस्तिष्क का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि एक कंडक्टर एक ऑर्केस्ट्रा का नेतृत्व कर रहा है। पुराने सिस्टमों में, कंडक्टर (लैंग्वेज मॉडल) एक स्कोर लिखता था, उसे संगीतकारों के एक अलग विभाग (एक्शन मॉडल) को सौंप देता था, और उम्मीद करता था कि वे इसे सही ढंग से बजाएंगे। MindVLA-U1 में, कंडक्टर ही ऑर्केस्ट्रा है। वही न्यूरॉन्स जो भाषा ("सड़क बर्फीली है") को समझते हैं, वही न्यूरॉन्स स्टीयरिंग एंगल की गणना भी करते हैं।
  • परिणाम: कार स्वाभाविक रूप से देख रही चीज़ों के बारे में बोल सकती है और साथ ही सेंटीमीटर-स्तर की सटीकता के साथ गाड़ी भी चला सकती है, दोनों कार्यों के लिए एक ही "वेट्स" (मेमोरी) का उपयोग करके।

2. "स्ट्रीमिंग" मेमोरी (कोई अधिक चंकिंग नहीं)

पिछले सिस्टमों ने सड़क को छोटे, निश्चित क्लिप्स (जैसे 5-सेकंड के टुकड़ों में फिल्म देखना) देखकर सीखने का प्रयास किया। इसके कारण कार क्लिप्स की सीमाओं पर "हकलाने" लगती थी, जिससे वह पिछले एक सेकंड में क्या हुआ था, उसे भूल जाती थी।

  • उपमा: कल्पना कीजिए कि आप एक किताब को केवल एक बार में एक पेज देखकर पढ़ रहे हैं, फिर किताब बंद कर देते हैं, फिर अगला पेज खोलते हैं। आप प्रवाह खो देते हैं। MindVLA-U1 किताब को एक बार में एक शब्द की तरह, निरंतर पढ़ता है।
  • तंत्र: यह एक "स्ट्रीमिंग मेमोरी" चैनल का उपयोग करता है। इसे एक कन्वेयर बेल्ट के रूप में सोचें जो ड्राइविंग के पिछले कुछ सेकंडों का एक छोटा, संकुचित सारांश ले जाता है। जैसे-जैसे कार चलती है, वह बेल्ट के पीछे से पुराना सारांश गिरा देती है और सामने की तरफ एक नया सारांश जोड़ देती है। यह कार को लंबी दूरियों तक सुचारू रूप से योजना बनाने की अनुमति देता है बिना हर बार पूरे वीडियो को दोबारा पढ़े हुए भारी हुए।

3. "इंटेंट" ब्रिज (भाषा द्वारा स्टीयरिंग व्हील को नियंत्रित करना)

यह इस पेपर की सबसे बड़ी सफलता है। पिछले सिस्टमों में, कार की "भाषा" केवल एक साइड इफेक्ट थी; वह वास्तव में स्टीयरिंग को नियंत्रित नहीं करती थी।

  • उपमा: कल्पना कीजिए कि एक जीपीएस कहता है, "बाएं मुड़ें," लेकिन कार उसे अनदेखा करती है और सीधे चलती रहती है। MindVLA-U1 में, भाषा वाला हिस्सा ही स्टीयरिंग व्हील है।
  • यह कैसे काम करता है: कार पहले शब्दों में एक सरल "इरादा" (intent) अनुमानित करती है (जैसे, "सीधे जाओ" या "लेन बदलें")। फिर यह इस शब्द का उपयोग ड्राइविंग पथ उत्पन्न करने वाले गणित को निर्देशित करने के लिए एक रिमोट कंट्रोल के रूप में करती है। यदि कार "सीधे जाओ" का अनुमान लगाती है, तो गणित को एक सीधा रास्ता बनाने के लिए प्रेरित किया जाता है। यदि कार "मुड़ने" का अनुमान लगाती है, तो गणित को मुड़ने के लिए प्रेरित किया जाता है। यह साबित करता है कि भाषा केवल बात नहीं कर रही है; यह भौतिक रूप से कार के निर्णयों को मोड़ रही है।

4. फास्ट और स्लो मोड (रिफ्लेक्स बनाम विचारक)

AI कारों के बारे में एक आम शिकायत यह है कि आपात स्थिति में प्रतिक्रिया देने के लिए वे बहुत धीमी होती हैं क्योंकि वे बहुत अधिक "सोच" रही होती हैं।

  • उपमा: एक मानव ड्राइवर के बारे में सोचें। जब आप हाईवे पर क्रूज कर रहे होते हैं, तो आप रिफ्लेक्स (सिस्टम 1) पर गाड़ी चलाते हैं। जब आप एक जटिल चौराहे के पास पहुँचते हैं, तो आप सोचते हैं (सिस्टम 2)।
  • नवाचार: MindVLA-U1 उसी मस्तिष्क का उपयोग करके इन मोड के बीच तुरंत स्विच कर सकता है।
    • फास्ट मोड: यह "सोचने" वाले हिस्से को छोड़ देता है और केवल रिफ्लेक्स पर गाड़ी चलाता है। यह पुराने, बिना बात करने वाले मॉडलों जितना ही तेज़ है।
    • स्लो मोड: यह जटिल परिदृश्यों को समझने के लिए पूर्ण भाषा तर्क (language reasoning) को संलग्न करता है।
    • लाभ: आपको एक रिफ्लेक्स ड्राइवर की गति से समझौता किए बिना एक सोचने वाले ड्राइवर की सुरक्षा मिलती है।

परिणाम: इंसानों को पछाड़ना

लेखकों ने इसे एक बहुत ही कठिन, वास्तविक दुनिया के ड्राइविंग डेटासेट (Waymo Open Dataset) पर परखा।

  • स्कोर: उन्होंने "रेटर फीडबैक स्कोर" (RFS) नामक एक मीट्रिक का उपयोग किया, जहाँ मानव विशेषज्ञ 0 से 10 के पैमाने पर एक ड्राइविंग पथ कितना अच्छा है, इसकी रेटिंग देते हैं।
  • उपलब्धि: MindVLA-U1 ने 8.20 का स्कोर प्राप्त किया, जबकि डेटासेट में सर्वश्रेष्ठ मानव ड्राइवरों ने 8.13 का स्कोर किया।
  • इसका क्या अर्थ है: पहली बार, एक AI सिस्टम को ऐसे ड्राइविंग पथों की योजना बनाने के लिए दिखाया गया है जिन्हें मानव विशेषज्ञ अनुभवी मानव ड्राइवरों की तुलना में थोड़ा बेहतर मानते हैं, और वह भी सड़क के बारे में बात करने और तर्क करने की क्षमता बनाए रखते हुए।

सारांश

MindVLA-U1 "इंटरफ़ेस" की समस्या को ठीक करता है। यह भाषा और ड्राइविंग को दो अलग-अलग कामों के रूप में मानना बंद कर देता है जिन्हें आपस में चिपकाया जाना आवश्यक है। इसके बजाय, यह एक एकल प्रणाली बनाता है जहाँ सोचना और करना एक ही क्षण में होता है, जो मेमोरी के निरंतर प्रवाह का उपयोग करता है और एक सीधा ब्रिज प्रदान करता है जहाँ शब्द भौतिक रूप से कार को मोड़ सकते हैं। यह साबित करता है कि आपको ऐसी कार चुनने की ज़रूरत नहीं है जो बात कर सके या ऐसी कार जो अच्छी तरह से गाड़ी चला सके; आप दोनों पा सकते हैं, और वे वास्तव में एक-दूसरे की मदद कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →