← नवीनतम पेपर
💻 computer science

DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving

DriveWorld-VLA एक नवीन फ्रेमवर्क है जो नियंत्रित, एक्शन-कंडीशन्ड सीन इमेजिनेशन को सक्षम करने और स्वायत्त ड्राइविंग निर्णय लेने में सुधार करने के लिए एक साझा लेटेंट स्पेस में विजन-लैंग्वेज-एक्शन प्लानिंग को वर्ल्ड मॉडलिंग के साथ एकीकृत करता है, जो NAVSIM और nuScenes बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Feiyang jia, Lin Liu, Ziying Song, Caiyan Jia, Hangjun Ye, Xiaoshuai Hao, Long Chen

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Feiyang jia, Lin Liu, Ziying Song, Caiyan Jia, Hangjun Ye, Xiaoshuai Hao, Long Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार को गाड़ी चलाना सिखा रहे हैं। वर्तमान की अधिकांश विधियाँ एक छात्र को एक आदर्श ड्राइव का वीडियो दिखाने और यह कहने जैसी हैं, "इसे कॉपी करो।" यदि छात्र लाल बत्ती देखता है, तो वह रुक जाता है। यदि वह हरी बत्ती देखता है, तो वह आगे बढ़ जाता है। लेकिन यदि कुछ अप्रत्याशित हो जाता है—जैसे सड़क पर एक गेंद लुढ़क कर आ जाए—तो वे घबरा सकते हैं क्योंकि उन्होंने यह नहीं सीखा है कि चीजें क्यों होती हैं, केवल यह कि क्या करना है।

यह पेपर DriveWorld-VLA पेश करता है, जो कार को सिखाने का एक नया तरीका है जो उसे कार्य करने से पहले भविष्य की कल्पना करने की एक "सुपरपावर" देने जैसा है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: दो अलग-अलग दिमाग

पहले, शोधकर्ता दो प्रकार के AI को संयोजित करने की कोशिश करते थे:

  • "परसेप्शन" (Perception) दिमाग (VLA): यह हिस्सा सड़क को देखता है, संकेतों को पढ़ता है और भाषा को समझता है। यह एक बहुत ही बुद्धिमान ड्राइवर की तरह है जो नियमों को जानता है।
  • "इमेजिनेशन" (Imagination) दिमाग (World Model): यह हिस्सा भविष्य का अनुकरण (simulate) करता है। यह एक क्रिस्टल बॉल की तरह है जो कहता है, "अगर मैं यहाँ बाएं मुड़ता हूँ, तो मैं उस पेड़ से टकरा सकता हूँ।"

पुराना तरीका यह था कि इन दोनों दिमागों को अलग-अलग काम करने के लिए रखा जाता था। "परसेप्शन" दिमाग "इमेजिनेशन" दिमाग से पूछता था, "क्या होगा अगर मैं मुड़ूँ?" इमेजिनेशन दिमाग जवाब देता था, लेकिन क्योंकि वे अलग-अलग थे, परसेप्शन दिमाग वास्तव में उनके जवाब से सीख नहीं पाता था। यह किसी मित्र से सलाह माँगने और फिर उसके तर्क को अनदेखा करने जैसा था।

2. समाधान: एक एकीकृत मन (One Unified Mind)

DriveWorld-VLA इन दोनों दिमागों को एक एकल, एकीकृत प्रणाली में मिला देता है। दो अलग-अलग कमरों के बजाय, अब वे एक ही कार्यालय साझा करते हैं।

  • साझा भाषा (Latent Space): कल्पना कीजिए कि कार के दिमाग की एक गुप्त कोड भाषा है। दोनों "देखने" वाले हिस्से और "कल्पना करने" वाले हिस्से इसी एक गुप्त कोड में बात करते हैं। जब कार एक पैदल यात्री को देखती है, तो वह केवल एक छवि नहीं देखती; वह उस छवि को इस गुप्त कोड में अनुवादित करती है। "इमेजिनेशन" वाला हिस्सा फिर उस सटीक कोड का उपयोग करके यह सिम्युलेट करता है कि आगे क्या होगा। इसका मतलब है कि कार दुनिया के भौतिक विज्ञान (physics) को वास्तव में समझती है, न कि केवल चित्रों को।

3. "क्या होगा अगर" (What-If) की सुपरपावर

सबसे बड़ा नवाचार एक्शन-कंडीशनड "व्हाट-इफ" रीजनिंग है।

इसे एक वीडियो गेम की तरह सोचें जहाँ आप प्रतिबद्ध होने से पहले विभिन्न चालें आज़माने के लिए गेम को पॉज़ कर सकते हैं:

  • पुराना तरीका: कार स्टॉप साइन देखती है और रुक जाती है।
  • DriveWorld-VLA: कार सोचती है, "ठीक है, मेरे पास तीन विकल्प हैं: रुकना, धीमा होना, या तेज़ होना।"
    • यह तुरंत अपने मन में तीनों विकल्पों के लिए भविष्य की कल्पना करती है।
    • यह देखती है कि "तेज़ होना" उसके इमेजिनेशन में एक दुर्घटना की ओर ले जाता है।
    • यह देखती है कि "रुकना" एक सुरक्षित परिणाम की ओर ले जाता है।
    • फिर यह सुरक्षित पथ चुनती है।

यह केवल इस बात पर प्रतिक्रिया नहीं करती कि अभी क्या हो रहा है; यह सबसे अच्छा विकल्प चुनने के लिए अपने मन में विभिन्न भविष्यों का परीक्षण करने के लिए सक्रिय रूप से प्रयास करती है।

4. उन्होंने इसे कैसे सिखाया (तीन-चरणीय प्रशिक्षण)

आप इस सिस्टम को बस चालू नहीं कर सकते और उम्मीद नहीं कर सकते कि यह काम करेगा। लेखकों ने इसे तीन चरणों में प्रशिक्षित किया, जैसे कि वीडियो गेम में लेवल अप करना:

  • चरण 1: बुनियादी बातें सीखना। कार सड़क को देखना और कुछ सेकंड बाद सड़क कैसी दिखेगी, इसकी भविष्यवाणी करना सीखती है, और साथ ही यह भी अनुमान लगाना सीखती है कि एक मानव ड्राइवर क्या करेगा। यह एक साथ "देखना" और "चलना" सीख रही है।
  • चरण 2: नियंत्रण सीखना। अब, कार सीखती है कि उसके कार्य भविष्य को बदलते हैं। यदि वह बाईं ओर मुड़ती है, तो भविष्य की छवि में कार को बाईं ओर दिखना चाहिए। वह अपने स्वयं के "क्रिस्टल बॉल" को नियंत्रित करना सीखती है।
  • चरण 3: अंतिम परीक्षा (क्लोज्ड लूप)। यह सबसे महत्वपूर्ण हिस्सा है। कार एक चाल की भविष्यवाणी करती है, भविष्य के परिणाम की कल्पना करती है, और फिर पूछती है, "क्या यह एक अच्छी चाल थी?" यदि काल्पनिक भविष्य खतरनाक दिखता है, तो उसे "खराब स्कोर" मिलता है और वह अगली बार अलग चाल आज़माने के लिए सीखती है। वह अपनी कल्पना से सीखती है।

5. परिणाम

इस सिस्टम का परीक्षण वास्तविक दुनिया के ड्राइविंग डेटासेट्स (जैसे NAVSIM और nuScenes) पर किया गया।

  • सुरक्षा: इसने अन्य शीर्ष विधियों की तुलना में काफी कम टक्कर की (परीक्षणों में केवल 0.16% टकराव दर)।
  • दक्षता: यह बिना अटके या बहुत अधिक सतर्क हुए सुचारू रूप से आगे बढ़ती रही।
  • तुलना: इसने अन्य उन्नत सिस्टमों को भी पीछे छोड़ दिया जिन्होंने विजन और इमेजिनेशन को मिलाने की कोशिश की थी लेकिन उन्हें इतनी मजबूती से एकीकृत नहीं किया था।

सारांश में

DriveWorld-VLA एक सेल्फ-ड्राइविंग कार को मानसिक पूर्वाभ्यास स्थान (mental rehearsal space) देने जैसा है। सड़क पर केवल प्रतिक्रिया करने के बजाय, यह लगातार अपने दिमाग में अलग-अलग कार्यों का परीक्षण करने के लिए "सिमुलेशन" चलाती रहती है। "देखने" और "कल्पना करने" वाले हिस्सों को एक ही भाषा बोलने में सक्षम बनाकर, कार अधिक स्मार्ट, सुरक्षित और मानव जैसी निर्णय लेने में सक्षम होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →