← नवीनतम पेपर
🤖 AI

LightEMMA: A Longitudinal Evaluation of Vision-Language Models for Autonomous Driving

यह शोधपत्र LightEMMA का परिचय देता है, जो एक अनुदैर्ध्य मूल्यांकन ढांचा (longitudinal evaluation framework) है जो यह प्रदर्शित करता है कि विज़न-लैंग्वेज मॉडल्स की क्रमिक पीढ़ियाँ nuScenes बेंचमार्क पर स्वायत्त ड्राइविंग प्रदर्शन में लगातार सुधार नहीं करती हैं, जिससे आवर्ती विफलता मोड (recurring failure modes) को संबोधित करने और सुरक्षा सुनिश्चित करने के लिए डोमेन-विशिष्ट अनुकूलन की आवश्यकता पर प्रकाश पड़ता है।

मूल लेखक: Zhijie Qiao, Haowei Li, Zhong Cao, Henry X. Liu

प्रकाशित 2026-09-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhijie Qiao, Haowei Li, Zhong Cao, Henry X. Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

स्व-चालित कारें लंबे समय से कठोर, नियम-आधारित प्रणालियों पर निर्भर रही हैं जो एक सख्त स्क्रिप्ट का पालन करती हैं, या सीखने पर आधारित ढांचों पर जो कच्चे सेंसर डेटा को सीधे स्टीयरिंग कमांड में मैप करते हैं। हालांकि इन दृष्टिकोणों ने महत्वपूर्ण प्रगति की है, लेकिन वे अक्सर अप्रत्याशित स्थितियों के साथ संघर्ष करते हैं: ऐसी दुर्लभ और जटिल स्थितियां जो उनके प्रशिक्षण डेटा से बाहर होती हैं, जैसे कि किसी निर्माण कार्यकर्ता का हाथ हिलाना या अचानक, अस्पष्ट यातायात पैटर्न। इस अंतर को पाटने के लिए, शोधकर्ताओं ने विजन-लैंग्वेज मॉडल्स (दृष्टि-भाषा मॉडलों) की ओर रुख किया है। ये शक्तिशाली आर्टिफिशियल इंटेलिजेंस सिस्टम हैं जिन्हें छवियों और मानवीय भाषा दोनों को समझने के लिए प्रशिक्षित किया गया है, जो एक मानव चालक की तरह दृश्य के बारे में तर्क करने, दृश्य का वर्णन करने, इरादे की व्याख्या करने और संदर्भ के आधार पर निर्णय लेने में सक्षम हैं। प्रचलित आशा यह रही है कि जैसे-जैसे ये मॉडल अधिक उन्नत और सामान्य तर्क करने में सक्षम होंगे, वे स्वाभाविक रूप से बेहतर ड्राइवर बन जाएंगे, और अंततः केवल सड़क के लिए डिज़ाइन किए गए विशिष्ट सिस्टमों से आगे निकल जाएंगे।

मिशिगन विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस धारणा का परीक्षण करने के लिए एक कठोर, दीर्घकालिक अध्ययन किया कि ये मॉडल वास्तव में कैसा प्रदर्शन करते हैं। उन्होंने 'लाइटईएमएमए' (LightEMMA) नामक एक नया मूल्यांकन ढांचा पेश किया, जिसे इन मॉडलों को बिना किसी विशेष प्रशिक्षण या उनकी आंतरिक सेटिंग्स में बदलाव किए, उनकी ड्राइविंग कौशल को मापने के लिए डिज़ाइन किया गया है। मॉडलों को ड्राइविंग सिखाने के बजाय, शोधकर्ताओं ने उन्हें बस एक सड़क के दृश्य को देखने और यह भविष्यवाणी करने के लिए कहा कि कार को आगे कहाँ जाना चाहिए। उन्होंने पांच प्रमुख परिवारों के पंद्रह अलग-अलग मॉडलों का परीक्षण किया, जो तीन वर्षों के तीव्र विकास के कालखंड को कवर करते हैं, और इसके लिए वास्तविक दुनिया के शहरी ड्राइविंग दृश्यों के एक चुनौतीपूर्ण डेटासेट का उपयोग किया। लक्ष्य यह देखना था कि क्या नवीनतम, सबसे शक्तिशाली मॉडल अपने पूर्ववर्तियों की तुलना में वास्तव में बेहतर ड्राइवर हैं, या क्या सामान्य बुद्धिमत्ता की छलांग सुरक्षित और सटीक ड्राइविंग में अनुवाद करने में विफल रही है।

इस अनुदैर्ध्य अध्ययन के परिणाम एक आश्चर्यजनक विसंगति प्रकट करते हैं। भले ही मॉडल बड़े, सामान्य तर्क करने में तेज़ और जटिल भाषा को समझने में अधिक सक्षम हुए हों, वे वाहन के प्रक्षेपवक्र (ट्रैजेक्टरी) की भविष्यवाणी करने में लगातार बेहतर नहीं हो सके। वास्तव में, कुछ नवीनतम पीढ़ी के मॉडल उसी परिवार के पुराने संस्करणों की तुलना में खराब प्रदर्शन करते हैं। जब शोधकर्ताओं ने वास्तविक कारों द्वारा लिए गए वास्तविक पथों के विरुद्ध अनुमानित पथों की सटीकता को मापा, तो उन्होंने पाया कि नए मॉडल अक्सर अधिक त्रुटियां करते हैं। उदाहरण के लिए, जबकि GPT परिवार के शीर्ष प्रदर्शन करने वाले मॉडलों में से एक ने तीन सेकंड की भविष्यवाणी विंडो में केवल एक मीटर से थोड़ा अधिक का औसत त्रुटि स्तर प्राप्त किया, उसी परिवार या अन्य परिवारों के अन्य नए मॉडलों ने उच्च त्रुटि दर दिखाई, जो कभी-कभी दो मीटर से अधिक थी। यह सुझाव देता है कि केवल एक मॉडल को सामान्य अर्थों में "स्मार्ट" बनाना उसे स्वचालित रूप से एक बेहतर ड्राइवर नहीं बनाता है।

अध्ययन ने यह भी उजागर किया कि ये मॉडल वास्तविक ड्राइविंग परिदृश्यों का सामना करते समय किन विशिष्ट तरीकों से विफल होते हैं। एक सामान्य त्रुटि में कार के हालिया इतिहास पर अत्यधिक निर्भरता शामिल थी। यदि कोई वाहन चौराहे पर अभी-अभी दाईं ओर मुड़ा था, तो मॉडलों ने अक्सर दाईं ओर के घुमाव की भविष्यवाणी जारी रखी, भले ही कार सीधी हो गई हो और आगे का रास्ता साफ हो। वे वर्तमान दृश्य के आधार पर अपने मानसिक मॉडल को अपडेट करने में संघर्ष करते थे, बल्कि पिछले कार्य को आगे की ओर प्रक्षेपित करते थे। अन्य मामलों में, मॉडल विरोधाभासी दृश्य संकेतों के बीच सामंजस्य बिठाने में विफल रहे। जब एक ट्रैफिक लाइट हरी हुई लेकिन उसके ठीक आगे एक वाहन रुका हुआ था, तो कुछ मॉडलों ने सही ढंग से भविष्यवाणी की कि कार को रुकना चाहिए, जबकि अन्य ने बाधा को अनदेखा कर दिया और भविष्यवाणी की कि कार चौराहे से गुजर जाएगी। इसी तरह, रेड लाइट के पास पहुँचने पर, कुछ मॉडलों ने अचानक, कठोर ब्रेक लगाने की भविष्यवाणी की, बजाय इसके कि वे सुचारू रूप से धीमे हों, जबकि अन्य बिल्कुल भी धीमे नहीं हुए।

सटीकता के अलावा, शोधकर्ताओं ने इन मॉडलों का उपयोग करने की व्यावहारिक लागतों की भी जांच की। उन्होंने पाया कि इन्फरेंस टाइम (वह समय जो मॉडल को एक छवि को संसाधित करने और भविष्यवाणी उत्पन्न करने में लगता है) व्यापक रूप से भिन्न होता है। सबसे तेज़ मॉडल को एक फ्रेम को प्रोसेस करने में लगभग 4.5 सेकंड लगे, जबकि सबसे धीमे को 40 सेकंड से अधिक का समय लगा। हाईवे की गति पर चल रही कार के लिए, निर्णय लेने के लिए कुछ सेकंड का इंतजार करना भी बहुत लंबा है; वास्तविक समय की ड्राइविंग के लिए मिलीसेकंड में निर्णय लेने की आवश्यकता होती है। इसके अलावा, इस कार्य के लिए वाणिज्यिक मॉडलों का उपयोग करने की लागत महत्वपूर्ण थी, क्योंकि कुछ मॉडलों की लागत प्रति फ्रेम कई सेंट थी, जो निरंतर संचालन के लिए एक निषेधाधिकार खर्च में बदल सकती थी। अध्ययन में यह भी नोट किया गया कि बेहतरीन मॉडल भी कभी-कभी निर्देशों का पालन करने में विफल रहे, जिससे ऐसे आउटपुट उत्पन्न हुए जिन्हें पढ़ना या समझना कठिन था, हालांकि शोधकर्ताओं ने अधिकांश स्वरूपण (फॉर्मेटिंग) त्रुटियों को ठीक करने के लिए एक विधि विकसित की।

अंततः, यह कार्य सुझाव देता है कि विजन-लैंग्वेज मॉडल्स का उपयोग करके सुरक्षित, स्वायत्त ड्राइविंग का मार्ग केवल अगली पीढ़ी के सामान्य-उद्देश्य वाले AI की प्रतीक्षा करने से कहीं अधिक है। मॉडल दृश्य का वर्णन करने और भाषा को समझने में सक्षम हैं, लेकिन उनमें भौतिक दुनिया को सुरक्षित और विश्वसनीय रूप से नेविगेट करने के लिए आवश्यक विशिष्ट, डोमेन-प्रशिक्षित अंतर्ज्ञान की कमी है। शोधकर्ता निष्कर्ष निकालते हैं कि इन प्रणालियों को व्यवहार्य बनाने के लिए, उन्हें केवल अपनी व्यापक, सामान्य तर्क क्षमताओं पर निर्भर रहने के बजाय, ड्राइविंग के विशिष्ट नियमों और गतिशीलता को सीखने के लिए विशेष अनुकूलन की आवश्यकता होगी। लाइटईएमएमए ढांचा अब समुदाय के लिए इन मॉडलों का परीक्षण और परिशोधन जारी रखने के लिए एक उपकरण के रूप में खड़ा है, जो यह सुनिश्चित करता है कि आर्टिफिशियल इंटेलिजेंस में भविष्य के विकास वास्तविक सड़क सुधारों में अनुवादित हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →