← नवीनतम पेपर
🤖 AI

DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models

DriveCritic एक नवीन ढांचा है जिसमें संदर्भ-महत्वपूर्ण परिदृश्यों का एक क्यूरेटेड डेटासेट और एक फाइन-ट्यून्ड विजन-लैंग्वेज मॉडल शामिल है जो बेहतर संदर्भ जागरूकता के माध्यम से मेट्रिक स्कोर को मानवीय निर्णय के साथ संरेखित करके स्वायत्त ड्राइविंग मूल्यांकन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Jingyu Song, Zhenxin Li, Shiyi Lan, Xinglong Sun, Nadine Chang, Maying Shen, Joshua Chen, Katherine A. Skinner, Jose M. Alvarez

प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jingyu Song, Zhenxin Li, Shiyi Lan, Xinglong Sun, Nadine Chang, Maying Shen, Joshua Chen, Katherine A. Skinner, Jose M. Alvarez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आप चाहते हैं कि वह एक इंसान की तरह सुरक्षित, कुशल और विनम्र हो। लेकिन आप यह कैसे जानेंगे कि रोबोट अच्छा काम कर रहा है या नहीं?

लंबे समय से, उद्योग रोबोट को ग्रेड देने के लिए एक "नियम पुस्तिका" (Rulebook) का उपयोग करता रहा है। यह नियम पुस्तिका एक सख्त गणित के शिक्षक की तरह है जो केवल संख्याओं को देखता है: "क्या आप लेन के बिल्कुल केंद्र में थे? हाँ/नहीं। क्या आप ठीक 50 मीटर आगे बढ़े? हाँ/नहीं।"

समस्या: नियम पुस्तिका "संदर्भ-अंध" (Context-Blind) है
यह पेपर बताता है कि इस पुराने तरीके को EPDMS कहा जाता है। समस्या यह है कि नियम पुस्तिका यह नहीं समझती कि ड्राइवर कोई काम क्यों कर रहा है।

  • परिदृश्य: कल्पना करें कि आपके सामने एक कार रुकी हुई है। उससे बचने के लिए, आपको कुछ सेकंड के लिए अपनी कार को धीरे से अगली लेन में थोड़ा खिसकाना पड़ता है।
  • मानवीय दृष्टिकोण: एक मानव ड्राइवर कहेगा, "अच्छा काम किया! आप सुरक्षित थे, आप चलते रहे, और आपने केवल इसलिए रास्ता बदला क्योंकि आपको इसकी आवश्यकता थी।"
  • नियम पुस्तिका का दृष्टिकोण: नियम पुस्तिका चिल्लाएगी, "उल्लंघन! आपने अपनी लेन का केंद्र छोड़ दिया! आपको खराब ग्रेड मिलता है!" उसे इस बात की परवाह नहीं है कि आप किसी दुर्घटना से बच रहे थे या आगे बढ़ रहे थे; वह केवल यह देखती है कि आपने "बीच में रहने" के नियम को तोड़ दिया।

इस कारण से, रोबोट बहुत अधिक सतर्क होकर फंस सकता है, या सही काम करने पर भी उसे खराब ग्रेड मिल सकता है।

समाधान: "DriveCritic" का आगमन
लेखकों ने एक नई प्रणाली बनाई जिसे DriveCritic कहा जाता है। Drive-Critic को एक गणित शिक्षक के रूप में नहीं, बल्कि बगल वाली सीट पर बैठे एक अनुभवी ड्राइविंग इंस्ट्रक्टर के रूप में सोचें।

यहाँ बताया गया है कि DriveCritic कैसे काम करता है, जिसे सरल भागों में विभाजित किया गया है:

1. "ट्रिकी टेस्ट" (डेटासेट)

शोधकर्ताओं ने केवल रैंडम ड्राइविंग क्लिप्स नहीं लीं। उन्होंने विशेष रूप से उन "कठिन" क्षणों को खोजा जहाँ पुरानी नियम पुस्तिका विफल हो जाती है।

  • उपमा: कल्पना करें कि एक ड्राइविंग टेस्ट में परीक्षक पूछता है, "क्या गड्ढे से बचने के लिए थोड़ा मुड़ना ठीक है?" पुरानी नियम पुस्तिका कहती है "नहीं, आपको सीधा रहना चाहिए।" नया टेस्ट (DriveCritic) ऐसे हजारों "ग्रे एरिया" वाले परिदृश्यों को इकट्ठा करता है और वास्तविक मानव विशेषज्ञों से पूछता है: "किस ड्राइवर ने बेहतर विकल्प चुना?"
  • उन्होंने इन "ट्रिकी" परिदृश्यों का एक विशाल पुस्तकालय बनाया, जिसे इस आधार पर लेबल किया गया कि एक मानव विशेषज्ञ क्या पसंद करेगा।

2. "स्मार्ट जज" (मॉडल)

उन्होंने एक विज़न-लैंग्वेज मॉडल (VLM) का उपयोग करके एक AI जज बनाया।

  • उपमा: एक नियमित AI को कैलकुलेटर की तरह समझें। वह संख्याओं को जोड़ सकता है। लेकिन DriveCritic एक कैमरे वाले जासूस की तरह है।
  • यह केवल संख्याओं को नहीं देखता। यह वीडियो (जो कार देख रही है), मैप (लेन कहाँ हैं), और संदर्भ (क्या वहां कोई रुकी हुई कार है? क्या रेड लाइट है?) को देखता है।
  • यह निर्णय लेने के लिए इस दृश्य जानकारी को "नियम पुस्तिका" की संख्याओं के साथ जोड़ता है।

3. "ट्रेनिंग कैंप" (दो-चरणीय सीखना)

आप केवल एक स्मार्ट AI चालू नहीं कर सकते और उम्मीद नहीं कर सकते कि वह तुरंत एक आदर्श जज बन जाएगा। लेखकों ने इसे दो चरणों में प्रशिक्षित किया:

  • चरण 1 (सुपरवाइज्ड फाइन-ट्यूनिंग): उन्होंने AI को "मानव विशेषज्ञ बनाम रोबोट" के हजारों उदाहरण दिखाए और कहा, "देखो, यहाँ विशेषज्ञ ने क्या चुना, और उसने ऐसा क्यों किया।" AI ने विशेषज्ञ के तर्क की नकल करना सीखा।
  • चरण 2 (रीइन्फोर्समेंट लर्निंग): यह एक वीडियो गेम की तरह है। AI जज की भूमिका निभाता है। यदि वह मानव विशेषज्ञ के साथ सहमत होता है, तो उसे एक "पॉइंट" मिलता है। यदि वह असहमत होता है, तो वह एक पॉइंट खो देता है। समय के साथ, वह बिल्कुल एक मानव विशेषज्ञ की तरह सोचना सीख जाता है, न कि केवल एक स्क्रिप्ट का पालन करना।

यह क्यों महत्वपूर्ण है
इसके परिणाम प्रभावशाली हैं। इन कठिन परिदृश्यों पर परीक्षण करने पर:

  • पुराने नियम पुस्तिका (EPDMS) ने केवल 41% बार सही निर्णय लिया। वह मूल रूप से केवल अनुमान लगा रहा था।
  • नए DriveCritic ने 76% बार सही निर्णय लिया।

बड़ी तस्वीर:
DriveCritic उन स्व-चालित कारों को बनाने की दिशा में एक कदम है जो केवल कठोर नियमों का पालन नहीं करतीं, बल्कि सड़क की भावना को समझती हैं। यह हमें यह मूल्यांकन करने में मदद करता है कि क्या एक स्व-चालित कार वास्तव में "सुरक्षित और स्मार्ट" है, या वह केवल एक स्प्रेडशीट का पालन करने में अच्छी है।

संक्षेप में: DriveCritic हमें स्व-चालित कारों को उसी तरह ग्रेड देना सिखाता है जैसे एक इंसान करेगा—सामान्य ज्ञान और संदर्भ के साथ, न कि केवल एक रूलर (पैमाने) के साथ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →