← नवीनतम पेपर
🤖 AI

VERDI: VLM-Embedded Reasoning for Autonomous Driving

VERDI एक प्रशिक्षण-समय का ढांचा (training-time framework) है जो मध्यवर्ती मॉड्यूल आउटपुट को टेक्स्टुअल रीजनिंग फीचर्स के साथ संरेखित करके बड़े विजन-लैंग्वेज मॉडल्स की कॉमनसेन्स रीजनिंग क्षमताओं को मॉड्यूलर डिफरेंशिएबल एंड-टू-एंड ऑटोनॉमस ड्राइविंग स्टैक्स में संकुचित (distill) करता है, जिससे विशाल VLMs को तैनात करने की उच्च इन्फरेंस लागत के बिना बेहतर सुरक्षा और प्रदर्शन प्राप्त होता है।

मूल लेखक: Bowen Feng, Zhiting Mei, Julian Ost, Filippo Ghilotti, Baiang Li, Roger Girgis, Anirudha Majumdar, Felix Heide

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bowen Feng, Zhiting Mei, Julian Ost, Filippo Ghilotti, Baiang Li, Roger Girgis, Anirudha Majumdar, Felix Heide

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आपके पास इसे सिखाने के दो मुख्य तरीके हैं:

  1. "रटने वाला" दृष्टिकोण (The "Memorizer" Approach): आप रोबोट को इंसानों के ड्राइविंग के हजारों वीडियो दिखाते हैं। रोबोट ठीक वही नकल करता है जो इंसान ने किया। अगर इंसान ने बाएँ मुड़ा, तो रोबोट भी बाएँ मुड़ेगा। लेकिन अगर रोबोट कुछ ऐसा देखता है जो उसने पहले कभी नहीं देखा (जैसे सड़क पर एक विशाल हवा से भरा हुआ बत्तख), तो वह घबरा जाता है क्योंकि वह यह नहीं समझता कि इंसान ने उस तरह से गाड़ी क्यों चलाई, वह केवल यह जानता है कि इंसान ने क्या किया।

  2. "सुपर-ब्रेन" दृष्टिकोण (The "Super-Brain" Approach): आप रोबोट को एक विशाल, सुपर-स्मार्ट दिमाग (एक विशाल AI मॉडल) देते हैं जो इंसान की तरह पढ़ सकता है, देख सकता है और तर्क कर सकता है। वह देख सकता है और कह सकता है, "वह ट्रक डगमगा रहा है, इसलिए मुझे धीमा हो जाना चाहिए।" समस्या यह है कि यह सुपर-ब्रेन इतना भारी और धीमा है कि उसे एक निर्णय लेने में घंटों लग जाते हैं। यह ऐसा है जैसे आप अपनी पीठ पर पियानो लादकर मैराथन दौड़ने की कोशिश कर रहे हों। यह वास्तविक समय (real-time) में ड्राइविंग के लिए बहुत धीमा है।

पेश है, VERDI।

यह पेपर VERDI (VLM-Embedded Reasoning for autonomous DrIving) को पेश करता है, जो एक शानदार नए शिक्षण तरीके की तरह है जो इन दोनों दुनियाओं का सबसे अच्छा हिस्सा प्राप्त करता है।

मुख्य विचार: "शैडो टीचर" (The "Shadow Teacher")

VERDI को एक ट्रेनिंग कैंप के रूप में सोचें जहाँ एक छोटा, तेज़ छात्र (ड्राइविंग रोबट) एक विशाल, धीमे जीनियस शिक्षक (विज़न-लैंग्वेज मॉडल या VLM) से सीखता है।

  • समस्या: आमतौर पर, छात्र केवल शिक्षक के अंतिम उत्तर (स्टीयरिंग व्हील का मूवमेंट) की नकल करता है।
  • VERDI का समाधान: केवल उत्तर की नकल करने के बजाय, VERDI छात्र को शिक्षक की तरह सोचने के लिए मजबूर करता है।

यहाँ प्रशिक्षण कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "सोच कर बोलने" का सत्र (The "Think Aloud" Session)

कल्पना कीजिए कि शिक्षक (विशाल AI) ड्राइविंग के एक दृश्य को देख रहा है। केवल स्टीयरिंग व्हील घुमाने के बजाय, शिक्षक कदम-दर-कदम ज़ोर से बोलता है:

  • अनुभूति (Perception): "मैं आगे एक लाल ट्रक और बाईं ओर एक पैदल यात्री देख रहा हूँ।"
  • पूर्वानुमान (Prediction): "ट्रक धीमा हो रहा है, और पैदल यात्री सड़क पार करने वाला है।"
  • योजना (Planning): "चूंकि ट्रक धीमा हो रहा है, इसलिए मुझे भी धीमा होना होगा, लेकिन मुझे पैदल यात्री से बचने के लिए अपनी लेन में रहना चाहिए।"

2. "माइंड-मेल्ड" (The "Mind-Meld")

पुराने दिनों में, छात्र रोबोट केवल अंतिम परिणाम (स्टीयरिंग व्हील का मोड़) देखता था। VERDI के साथ, रोबोट को शिक्षक के बोले गए शब्दों के साथ अपने आंतरिक "विचारों" को मिलाने के लिए मजबूर किया जाता है।

  • जब शिक्षक कहता है "मैं एक लाल ट्रक देख रहा हूँ," तो रोबट की "आंखें" (परसेप्शन मॉड्यूल) एक विशिष्ट पैटर्न के साथ चमकनी चाहिए जो "लाल ट्रक" के अर्थ से मेल खाती हो।
  • जब शिक्षक कहता है "धीमा हो जाओ," तो रोबोट का "दिमाग" (प्लानिंग मॉड्यूल) उस तर्क के साथ संरेखित होना चाहिए।

रोबोट केवल चाल को याद नहीं कर रहा है; वह तर्क को आत्मसात कर रहा है। वह निर्णय के पीछे के सामान्य ज्ञान (common sense) को सीख रहा है।

3. ग्रेजुएशन डे (Inference)

एक बार प्रशिक्षण पूरा हो जाने के बाद, विशाल शिक्षक (धीमा AI) को हटा दिया जाता है। वह कार में ले जाने के लिए बहुत भारी है।

  • छात्र रोबोट अब ड्राइवर की सीट में अकेला है।
  • चूंकि उसने प्रशिक्षण के दौरान कैसे सोचना है यह सीखा है, इसलिए अब वह बिना किसी विशाल शिक्षक के तुरंत स्मार्ट और सुरक्षित निर्णय ले सकता है। उसके पास एक रेस कार की गति है लेकिन एक मानव चालक का सामान्य ज्ञान भी है।

यह एक बड़ी बात क्यों है?

  • गति (Speed): पुराने "सुपर-ब्रेन" तरीके वास्तविक कारों के लिए बहुत धीमे हैं (उन्हें निर्णय लेने में सेकंड लग सकते हैं, जो दुर्घटना के समय एक अनंत काल के समान है)। VERDI एक मानक रोबोट जितना तेज़ है, जिससे यह वास्तविक सड़कों के लिए सुरक्षित हो जाता है।
  • सुरक्षा (Safety): मानक रोबोट अक्सर अजीब स्थितियों में दुर्घटनाग्रस्त हो जाते हैं क्योंकि उन्होंने अपने प्रशिक्षण डेटा में वह सटीक परिदृश्य नहीं देखा होता है। VERDI, जिसने ड्राइविंग के तर्क को सीखा है, उन नई और डरावनी स्थितियों (जैसे हिरण का अचानक सामने आना) को बहुत बेहतर तरीके से संभाल सकता है क्योंकि वह उनके माध्यम से तर्क कर सकता है।
  • दक्षता (Efficiency): यह एक पीएचडी थीसिस को 10 मिनट के सारांश में बदलने जैसा है। कार को पूरी लाइब्रेरी की ज़रूरत नहीं है; उसे बस उस ज्ञान की ज़रूरत है।

परिणाम

लेखकों ने एक वर्चुअल ड्राइविंग सिम्युलेटर (HugSim) और वास्तविक दुनिया के डेटा (nuScenes) में VERDI का परीक्षण किया।

  • परिणाम: VERDI ने पिछले तरीकों की तुलना में अधिक सुरक्षित और सुचारू रूप से ड्राइविंग की। इसने मौजूदा सर्वश्रेष्ठ रोबोट ड्राइवरों की तुलना में 10% अधिक बार टक्करों से बचाव किया।
  • उपमा: यदि पुराना रोबोट एक ऐसा छात्र था जिसने उत्तर कुंजी (answer key) रट ली थी लेकिन प्रश्न बदलने पर फेल हो गया, तो VERDI वह छात्र है जिसने वास्तव में गणित को समझा और टेस्ट में उत्कृष्ट प्रदर्शन किया, भले ही प्रश्न नए थे।

संक्षेप में: VERDI एक तेज़ रोबोट को प्रशिक्षण के दौरान एक स्मार्ट इंसान की तरह "सोचना" सिखाकर ड्राइविंग सिखाता है, ताकि वह बिना किसी सुपरकंप्यूटर के सुरक्षित और तेज़ी से गाड़ी चला सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →