← नवीनतम पेपर
💻 computer science

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving

यह शोध पत्र DH-VLM का प्रस्ताव करता है, जो एक डुअल-होरिज़न कोऑपरेटिव लेटेंट रीजनिंग फ्रेमवर्क है जो कुशल लेटेंट गाइडेंस के माध्यम से ईगो-व्हीकल निर्णय लेने को परिष्कृत करने के लिए इंफ्रास्ट्रक्चर-एग्रीगेटेड ग्लोबल रीजनिंग का लाभ उठाता है, जिससे मौजूदा विधियों की तुलना में संचार लागत और मेमोरी उपयोग को काफी कम करते हुए अत्याधुनिक प्लानिंग प्रदर्शन प्राप्त होता है।

मूल लेखक: Ziyi Song, Chen Xia, Hang Yu, Sheng Zhou, Zhisheng Niu

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ziyi Song, Chen Xia, Hang Yu, Sheng Zhou, Zhisheng Niu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक आँखों पर पट्टी बांधकर एक विशाल, अराजक शहर में रास्ता खोजने की कोशिश कर रहे हैं, जहाँ से आप केवल अपने सामने कुछ ही फीट देख सकते हैं। आपके पास आपकी जेब में एक सुपर-स्मार्ट जीपीएस है, लेकिन वह आपसे केवल उसी के बारे में बात कर सकता है जो ठीक यहाँ है। यदि एक विशाल ट्रक तीन ब्लॉक आगे लाल बत्ती को आपके दृश्य से रोक देता है, या यदि कोई पैदल यात्री खड़ी कार के पीछे छिपा हुआ है, तो आपका जीपीएस अंधा होकर उड़ रहा होता है। यह आज की सेल्फ-ड्राइविंग कारों का दैनिक संघर्ष है। वे अपने ठीक सामने की चीज़ों को देखने में अविश्वसनीय रूप से अच्छी हैं, लेकिन वे अक्सर बड़ी तस्वीर को मिस कर देती हैं क्योंकि उनकी "आंखें" उनके अपने सेंसरों तक ही सीमित होती हैं।

इस समस्या को हल करने के लिए, वैज्ञानिक "सहकारी ड्राइविंग" (cooperative driving) की ओर देख रहे हैं, जहाँ कारें और सड़क का बुनियादी ढांचा (जैसे ट्रैफिक लाइट और खंभों पर लगे कैमरे) एक-दूसरे से बात करते हैं। इसे "टेलीफोन" के खेल की तरह समझें जहाँ सड़क के संकेत कारों को रहस्य फुसफुसाते हैं। हालाँकि, इसमें एक पेंच है: उस अतिरिक्त जानकारी को भेजने के लिए बहुत अधिक बैंडविड्थ (जैसे बहुत अधिक पानी से एक संकीर्ण पाइप को जाम करना) की आवश्यकता होती है और इसके लिए भारी कंप्यूटरों की जरूरत होती है जिन्हें कारें हमेशा नहीं उठा सकतीं। बड़ा सवाल यह है: एक कार बिना धीमे हुए या अपनी मेमोरी खत्म किए बिना सड़क का एक सुपर-स्मार्ट, वैश्विक दृश्य कैसे प्राप्त कर सकती है?

यहीं पर एक नया विचार जिसे DH-VLM कहा जाता है, काम आता है। इस पेपर के पीछे के शोधकर्ता एक चतुर प्रणाली प्रस्तावित करते हैं जो सड़क और कार के बीच एक "ब्रेन ट्रस्ट" (brain trust) की तरह काम करती है। बुनियादी ढांचे द्वारा कच्चा वीडियो फीड या लंबे, जटिल टेक्स्ट संदेश कार को भेजने के बजाय (जो धीमा और अव्यवस्थित होगा), वे समझ का एक संक्षिप्त "गुप्त कोड" भेजते हैं। कल्पना करें कि बुनियादी ढांचा एक बुद्धिमान, सर्वव्यापी लाइटहाउस की तरह है जो पूरे तूफान को देखता है। हर जहाज को एक विस्तृत मौसम रिपोर्ट चिल्लाने के बजाय, यह एक विशिष्ट, कोडेड लाइट पैटर्न फ्लैश करता है जो जहाज को चट्टानों से बचने के लिए सटीक रूप से दिशा बताने के लिए पर्याप्त है। जहाज (कार) अभी भी अपने स्वयं के निर्णय लेता है, लेकिन अब उसके पास एक लाभ है: भविष्य की एक झलक जो वह अपने आप नहीं देख सकता था।

यह पेपर सुझाव देता है कि यह तरीका, जिसे वे "डुअल-होरिज़न कोऑपरेटिव लेटेंट रीजनिंग" (Dual-Horizon Cooperative Latent Reasoning) कहते हैं, इस विचार के माध्यम से काम करता है कि शक्तिशाली स्ट्रीट कंप्यूटर पूरे दृश्य को समझने का भारी काम करें, और फिर उस ज्ञान को एक छोटे, कुशल "लेटेंट" सिग्नल में कंप्रेस (संक्षिप्त) कर दें। यह सिग्नल कार को भेजा जाता है, जो अपने स्वयं के सुपरकंप्यूटर की आवश्यकता के बिना अपनी सोच को परिष्कृत करने के लिए इसका उपयोग करती है। उनके परीक्षणों में, इस दृष्टिकोण ने न केवल काम किया; इसने कारों को काफी सुरक्षित और सटीक बनाया। शोधकर्ताओं ने पाया कि इस प्रणाली का उपयोग करने से कार की ड्राइविंग त्रुटियों में 14.6% की कमी आई और दुर्घटना की संभावना में 26.9% की कमी आई। इससे भी बेहतर, इसने संचार स्थान की एक बड़ी मात्रा को बचाया—डेटा भेजे जाने को 57.3% कम कर दिया—और अन्य सहकारी प्रणालियों की तुलना में कम कंप्यूटर मेमोरी का उपयोग किया।

टीम ने इन प्रणालियों के लिए एक विशेष "प्रशिक्षण स्कूल" भी बनाया, जिससे प्रश्नों और उत्तरों का एक डेटासेट तैयार हुआ जिसने बुनियादी ढांचे को विशेष रूप से कार की जरूरतों के बारे में सोचना सिखाया, जैसे "क्या होगा अगर मैं यहाँ बाएं मुड़ जाऊं?" या "क्या वह पैदल यात्री बाहर कदम रखने वाला है?" इसे सिमुलेशन में टेस्ट करके, उन्होंने दिखाया कि भले ही कार और सड़क के बीच का कनेक्शन थोड़ा अस्थिर या विलंबित हो जाए, कार फिर भी सुरक्षित रूप से चल सकती है, सिग्नल कमजोर होने पर अपने स्वयं के मस्तिष्क पर भरोसा करती है और सिग्नल मजबूत होने पर "गुप्त कोड" का उपयोग करती है। यह एक सह-पायलट होने जैसा है जो पूरे मानचित्र को जानता है लेकिन आपको स्टीयरिंग व्हील थामने के लिए भरोसा करता है, और केवल तभी सलाह फुसफुसाता है जब सभी को सुरक्षित रखने के लिए यह अत्यंत आवश्यक हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →