← नवीनतम पेपर
🤖 machine learning

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

यह शोध पत्र DriveJudge को प्रस्तुत करता है, जो एक नवीन स्वायत्त ड्राइविंग मूल्यांकन एजेंट है जो मानव-संरेखित बेंचमार्क कार्यों पर श्रेष्ठ, व्याख्यात्मक और संदर्भ-जागरूक प्रदर्शन प्राप्त करने के लिए विजन-लैंग्वेज मॉडल तर्क (Vision-Language Model reasoning) को भौतिक रूप से-आधारित नियम फलनों (physically-grounded rule functions) के साथ एकीकृत करता है।

मूल लेखक: Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

प्रकाशित 2026-06-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार को गाड़ी चलाना सिखा रहे हैं। इसके प्रदर्शन का मूल्यांकन करने के लिए, आपको एक जज की आवश्यकता है। लेकिन समस्या यह है: पारंपरिक जज सख्त, नियम-बद्ध रोबोट की तरह हैं, जबकि नए AI जज अस्पष्ट, अपनी राय रखने वाले आलोचकों की तरह हैं जो दूरियों को सटीक रूप से नहीं माप सकते।

यह पेपर DriveJudge पेश करता है, जो एक नया प्रकार का मूल्यांकनकर्ता है जो दोनों दुनियाओं की सर्वश्रेष्ठ विशेषताओं को जोड़ता है। यह एक मानव ड्राइविंग इंस्ट्रक्टर (ड्राइविंग प्रशिक्षक) को काम पर रखने जैसा है जो जानता है कि नियमों को कब लचीला बनाना है, लेकिन सुरक्षा की जांच करने के लिए लेजर-मेजरिंग टेप का उपयोग करता है।

DriveJudge कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: दो दोषपूर्ण जज

वर्तमान में, हमारे पास सेल्फ-ड्राइविंग कारों को ग्रेड देने के दो मुख्य तरीके हैं, और दोनों में बड़ी खामियां हैं:

  • "रूल रोबोट" (पारंपरिक मेट्रिक्स): यह जज हर एक नियम की सख्ती से जांच करता है। क्या कार लेन में रही? क्या उसने किसी से टक्कर की? क्या वह आगे बढ़ी?
    • खामी: इसमें सामान्य समझ (common sense) की कमी है। यदि कोई कार अचानक आए किसी अवरोध से बचने के लिए लेन से थोड़ा बाहर निकलती है, तो "रूल रोबोट" उसे "लेन उल्लंघन" के लिए फेल कर देता है, भले ही ड्राइवर ने सही काम किया हो। यह एक ऐसे शिक्षक की तरह है जो छात्र को बिना अनुमति हाथ उठाने के लिए फेल कर देता है, भले ही वह सवाल का सही जवाब दे रहा हो।
  • "अस्पष्ट आलोचक" (शुद्ध AI/VLM जज): ये बड़े AI मॉडल हैं जो वीडियो देखते हैं और "वाइब्स" या सामान्य तर्क के आधार पर स्कोर देते हैं।
    • खामी: वे ज्यामिति (geometry) में खराब हैं। वे कह सकते हैं, "कार सुरक्षित लग रही है," लेकिन वे वास्तव में यह गणना नहीं कर सकते कि कार एक पैदल यात्री से 1 इंच दूर है या 1 फुट। वे एक फिल्म क्रिटिक की तरह हैं जो कहते हैं, "अभिनय वास्तविक लगा," लेकिन यह नहीं बता सकते कि स्टंट वास्तव में सुरक्षित रूप से किया गया था या नहीं।

2. समाधान: DriveJudge (स्मार्ट इंस्पेक्टर)

DriveJudge एक AI एजेंट है जो एक स्मार्ट इंस्पेक्टर की तरह कार्य करता है। यह केवल कार को नहीं देखता; यह पहले संदर्भ (context) को देखता है।

  • चरण 1: संदर्भ की जांच (दिमाग): DriveJudge दृश्य को समझने के लिए विजन-लैंग्वेज मॉडल (VLM) का उपयोग करता है। यह पूछता है: "यहाँ क्या हो रहा है? क्या यहाँ निर्माण कार्य चल रहा है? क्या कोई अचानक अवरोध आया है? क्या यह एक सामान्य हाईवे है या व्यस्त चौराहा?"
  • चरण 2: चयनात्मक नियम अनुप्रयोग (फिल्टर): संदर्भ के आधार पर, DriveJudge तय करता है कि कौन से नियम महत्वपूर्ण हैं।
    • उदाहरण: यदि कार एक पार्क की गई ट्रक के पास से गुजर रही है, तो DriveJudge कहता है, "इस क्षण के लिए 'लेन में रहें' नियम को अनदेखा करें। यह उचित है।"
    • उदाहरण: यदि कार किसी पैदल यात्री के करीब पहुंच रही है, तो DriveJudge कहता है, " 'टक्कर न हो' वाला नियम महत्वपूर्ण है। इसकी सटीक जांच करें।"
  • चरण 3: परिशुद्धता की जांच (रूलर): उन नियमों के लिए जिन्हें वह लागू करने का निर्णय लेता है, DriveJudge सटीक, गणितीय गणनाओं (पारंपरिक मेट्रिक्स की तरह) का उपयोग करता है ताकि सुरक्षा और अनुपालन को मापा जा सके। यह सुनिश्चित करता है कि निर्णय शारीरिक रूप से सटीक हो, न कि केवल एक अनुमान।

3. उन्होंने इसे कैसे प्रशिक्षित किया

इस सूक्ष्मता को सिखाने के लिए, शोधकर्ताओं ने 33,577 चुनौतीपूर्ण ड्राइविंग क्लिप्स का एक विशाल डेटासेट बनाया। ये केवल सामान्य ड्राइविंग नहीं थे; ये "लॉन्ग-टेल" परिदृश्य थे—दुर्लभ, पेचीदा स्थितियां जहाँ मानव चालक सुरक्षित रहने के लिए नियम तोड़ सकते हैं।

  • मानव लेबलिंग: मनुष्यों ने इन क्लिप्स को देखा और उत्तर दिया: "क्या यह ड्राइविंग व्यवहार उचित था?"
  • तर्क: यदि किसी इंसान ने कहा "हाँ, यह उचित था," लेकिन कार ने तकनीकी रूप से एक नियम तोड़ा (जैसे लेन से बाहर निकलना), तो DriveJudge ने सीखा कि इस विशिष्ट संदर्भ में, उस नियम को अनदेखा किया जाना चाहिए।
  • प्रशिक्षण विधि: उन्होंने दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया:
    1. सुपरवाइज्ड फाइन-ट्यूनिंग: AI को यह पहचानने के लिए सिखाना कि नियमों को कब चालू या बंद करना है।
    2. रीइन्फोर्समेंट लर्निंग: जब AI का अंतिम निर्णय मानव प्राथमिकताओं (जैसे, तकनीकी रूप से "परफेक्ट" लेकिन खतरनाक पथ के बजाय सुरक्षित और समझदारी भरा पथ चुनना) से मेल खाता था, तो उसे पुरस्कृत किया गया।

4. परिणाम: यह क्यों बेहतर है

पेपर दिखाता है कि DriveJudge पिछले तरीकों की तुलना में ड्राइविंग गुणवत्ता को परखने में काफी बेहतर है:

  • यह सूक्ष्मता को समझता है: यह सही ढंग से पहचानता है कि किसी बाधा से बचने के लिए कार का मुड़ना "अच्छी ड्राइविंग" है, जबकि पुराना "रूल रोबोट" इसे "खराब ड्राइविंग" कहेगा।
  • यह अधिक सटीक है: उन परीक्षणों में जहाँ मनुष्यों को दो ड्राइविंग पथों के बीच चयन करना था, DriveJudge पिछले सर्वश्रेष्ठ AI क्रिटिक (DriveCritic) की तुलना में 6.5% अधिक बार मानव प्राथमिकताओं से सहमत हुआ।
  • यह विफलताओं को बेहतर तरीके से पकड़ता है: यह वास्तव में खतरनाक व्यवहारों (जैसे रेड लाइट जंप करना) को पकड़ने में बहुत बेहतर है क्योंकि यह मामूली, उचित नियम-भंग से भ्रमित नहीं होता है।

5. एक रचनात्मक उपमा

ड्राइविंग मूल्यांकन को एक डांस प्रतियोगिता के जज के रूप में सोचें:

  • रूल रोबोट वह जज है जिसे केवल इस बात की परवाह है कि आपके पैर फर्श पर चिह्नित स्थानों पर बिल्कुल सटीक हों। यदि आप केबल से टकराने से बचने के लिए निशान से थोड़ा हटते हैं, तो आपको शून्य दिया जाता है, भले ही आपका डांस सुंदर हो।
  • अस्पष्ट आलोचक वह जज है जो कहता है, "मुझे लय महसूस हुई," लेकिन यह नहीं बता सकता कि आपने वास्तव में उच्च स्वर (high note) छुआ या बस उसके करीब गुनगुनाया।
  • DriveJudge वह जज है जो पूरे प्रदर्शन को देखता है। यदि आप केबल से बचने के लिए निशान से हटते हैं, तो वे कहते हैं, "अच्छा बचाव, फुट प्लेसमेंट नियम को अनदेखा करें।" लेकिन यदि आप उच्च स्वर चूक जाते हैं, तो वे सटीक दूरी मापने के लिए ट्यूनर का उपयोग करते हैं। वे सामान्य समझ को सटीक माप के साथ जोड़ते हैं।

सारांश

DriveJudge परिशुद्धता में संदर्भ जोड़कर सेल्फ-ड्राइविंग कारों को ग्रेड देने के तरीके को फिर से परिभाषित करता है। यह कारों को समझदारी भरे नियम-भंग के लिए दंडित करना बंद करता है और जटिल स्थितियों में स्मार्ट, सुरक्षित निर्णयों के लिए उन्हें पुरस्कृत करना शुरू करता है। यह मूल्यांकन प्रक्रिया को अधिक मानव-समान, अधिक सटीक और अधिक उपयोगी बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →