← नवीनतम पेपर
🤖 AI

RAG-Driver: Generalisable Driving Explanations with Retrieval-Augmented In-Context Learning in Multi-Modal Large Language Model

RAG-Driver एक नवीन रिट्रीवल-ऑगमेंटेड मल्टी-मोडल लार्ज लैंग्वेज मॉडल है जो बिना किसी महंगे रिट्रेनिंग की आवश्यकता के या कैटास्ट्रोफिक फॉरगेटिंग से ग्रस्त हुए, विशेषज्ञ प्रदर्शनों के साथ इन-कॉन्टेक्स्ट लर्निंग का लाभ उठाकर अत्याधुनिक, व्याख्या योग्य और ज़ीरो-शॉट सामान्यीकरण योग्य स्वायत्त ड्राइविंग प्राप्त करता है।

मूल लेखक: Jianhao Yuan, Shuyang Sun, Daniel Omeiza, Bo Zhao, Paul Newman, Lars Kunze, Matthew Gadd

प्रकाशित 2026-03-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianhao Yuan, Shuyang Sun, Daniel Omeiza, Bo Zhao, Paul Newman, Lars Kunze, Matthew Gadd

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार में सवारी कर रहे हैं। आप खिड़की से बाहर देखते हैं, और अचानक कार ज़ोर से ब्रेक लगाती है या थोड़ा मुड़ जाती है। आप सोच सकते हैं, "इसने ऐसा क्यों किया? क्या यह दुर्घटनाग्रस्त होने वाला है? क्या यह भ्रमित है?"

आजकल की अधिकांश सेल्फ-ड्राइविंग कारें ब्लैक बॉक्स की तरह हैं। वे जटिल गणित के आधार पर निर्णय लेती हैं, लेकिन वे आपको यह नहीं बता सकतीं कि उन्होंने वह निर्णय क्यों लिया। वे बस काम करती हैं। यह हमें घबरा देता है। हम उन पर भरोसा करना चाहते हैं, लेकिन हम ऐसा तब तक नहीं कर सकते जब तक हम उनके तर्क को समझ न लें।

यह पेपर RAG-Driver नामक एक नई प्रणाली पेश करता है। इसे ऐसे समझें कि यह एक ऐसी सेल्फ-ड्राइविंग कार है जो न केवल गाड़ी चलाती है; बल्कि यह आपसे बात भी करती है और साधारण अंग्रेजी (या सरल भाषा) में अपने विचारों को समझाती है, ठीक वैसे ही जैसे एक मानव ड्राइविंग इंस्ट्रक्टर करता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "भूलने की बीमारी" और "भाषा की बाधा"

वर्तमान सेल्फ-ड्राइविंग AI के साथ दो बड़ी समस्याएँ हैं:

  • ब्लैक बॉक्स: यह समझना कठिन है कि इसने कोई निर्णय क्यों लिया।
  • "नए शहर" की समस्या: यदि आप एक कार को धूप वाले कैलिफोर्निया में चलाने के लिए प्रशिक्षित करते हैं, तो अक्सर यह लंदन की बारिश में भ्रमित हो जाती है। इसे फिर से शुरू से प्रशिक्षित करना पड़ता है, जो महंगा और धीमा है। साथ ही, यदि आप बाद में इसे नई चीजें सिखाने की कोशिश करते हैं, तो यह अक्सर वह भूल जाती है जो इसने पहले सीखा था (इसे कैटैस्ट्रोफिक फॉरगेटिंग यानी विनाशकारी विस्मृति कहा जाता है)।

2. समाधान: एक लाइब्रेरी वाला "सुपर-स्टूडेंट"

RAG-Driver एक प्रतिभाशाली छात्र की तरह है जिसके पास उसके ठीक बगल में ड्राइविंग अनुभवों की एक विशाल लाइब्रेरी है।

हर सड़क के नियम को याद करने की कोशिश करने के बजाय (जो कि असंभव है), यह सिस्टम रिट्रीवल-ऑगमेंटेड इन-कॉन्टेक्स्ट लर्निंग (Retrieval-Augmented In-Context Learning) नामक तकनीक का उपयोग करता है।

यहाँ इसका उदाहरण दिया गया है:

  • पुराना तरीका: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। उसे केवल उसी पर भरोसा करना होता है जो उसने अपने दिमाग में याद किया है। यदि परीक्षा का प्रश्न किसी ऐसी स्थिति के बारे में है जिसे उसने पहले कभी नहीं देखा, तो वह विफल हो सकता है या गलत अनुमान लगा सकता है।
  • RAG-Driver का तरीका: कल्पना कीजिए कि वही छात्र परीक्षा दे रहा है, लेकिन उसे उत्तर देने से पहले लाइब्रेरी में पिछले समान परीक्षाओं को देखने की अनुमति है।
    • कार एक पेचीदा स्थिति देखती है (जैसे, बारिश में सड़क के पास दौड़ता हुआ एक बच्चा)।
    • यह तुरंत अपने "लाइब्रेरी" में उन शीर्ष 2 सबसे समान स्थितियों की खोज करती है जो उसने पहले देखी थीं जहाँ एक मानव विशेषज्ञ ने सुरक्षित रूप से गाड़ी चलाई थी।
    • वह देखता है कि विशेषज्ञ ने उन पिछले मामलों में अपने कार्यों को कैसे समझाया था ("मैं धीमा हो गया क्योंकि सड़क फिसलन भरी थी और एक बच्चा पास में था")।
    • वह उन उदाहरणों का उपयोग यह समझने के लिए करता है कि अभी क्या करना है और आपको कैसे समझाना है।

3. यह वास्तव में क्या करता है?

जब कार चल रही होती है, तो RAG-Driver तीन चीजें एक साथ करता है:

  1. चाल का पूर्वानुमान लगाना: यह सटीक स्टीयरिंग एंगल और गति की गणना करता है (शरीर की मांसपेशियों की हरकतें)।
  2. कार्य की व्याख्या करना: यह कहता है, "मैं धीमा हो रहा हूँ क्योंकि बाईं ओर एक पैदल यात्री है।"
  3. कारण का औचित्य सिद्ध करना: यह जोड़ता है, "मैं ऐसा इसलिए कर रहा हूँ क्योंकि सड़क गीली है, और मुझे रुकने के लिए अतिरिक्त दूरी की आवश्यकता है।"

4. यह एक बड़ी बात क्यों है?

शोधकर्ताओं ने इस प्रणाली का परीक्षण दो तरीकों से किया:

  • परिचित क्षेत्र में: इसने मौजूदा सर्वोत्तम प्रणालियों के समान ही प्रदर्शन किया, लेकिन बहुत बेहतर स्पष्टीकरणों के साथ।
  • अपरिचित क्षेत्र में (जादुई हिस्सा): उन्होंने परीक्षण के लिए एक पूरी तरह से अलग शहर (लंदन) का उपयोग किया जिसमें अलग मौसम और सड़क शैलियाँ थीं, और ऐसा डेटा उपयोग किया जिसे कार ने पहले कभी नहीं देखा था।
    • अन्य प्रणालियाँ: बुरी तरह विफल रहीं। वे भ्रमित हो गईं क्योंकि "नियम" अलग दिख रहे थे।
    • RAG-Driver: सफल रहा! क्योंकि यह नियमों को याद रखने पर निर्भर नहीं था; यह सादृश्य (Analogy) पर निर्भर था। इसने लाइब्रेरी में एक समान स्थिति ढूँढी और कहा, "ओह, यह उस समय जैसा है जब मैं कैलिफोर्निया में था। तब विशेषज्ञ ने क्या किया था, यहाँ वह है, इसलिए मैं अब वही करूँगा।"

5. "बिना प्रशिक्षण" की सुपरपावर

आमतौर पर, किसी रोबोट को नई जगह पर स्मार्ट बनाने के लिए, आपको उसे हजारों घंटों का नया वीडियो खिलाना पड़ता है और कई दिनों तक उसे फिर से प्रशिक्षित करना पड़ता है। यह एक छात्र को केवल एक नया शहर सीखने के लिए एक साल तक वापस स्कूल भेजने जैसा है।

RAG-Driver अलग है। यह चलते-चलते (on the fly) सीखता है। इसे फिर से प्रशिक्षित करने की आवश्यकता नहीं है। इसे बस अपने पिछले उदाहरणों की लाइब्रेरी को देखने की आवश्यकता है ताकि यह तुरंत अनुकूल हो सके। यह इसे नए शहरों या देशों में तैनात करना बहुत सस्ता और तेज़ बनाता है।

सारांश

RAG-Driver एक ऐसा सेल्फ-ड्राइविंग सिस्टम है जो एक अनुभवी और बुद्धिमान ड्राइविंग इंस्ट्रक्टर की तरह कार्य करता है। केवल चुपचाप गाड़ी चलाने के बजाय, यह:

  • वर्तमान समस्याओं को हल करने के लिए पिछले समान अनुभवों को देखता है।
  • यह समझाने के लिए कि वह निर्णय क्यों ले रहा है, आपसे बात करता है।
  • बिना दोबारा "स्कूल" (रिट्रेनिंग) जाए, तुरंत नए वातावरण के अनुकूल हो जाता है।

यह सेल्फ-ड्राइविंग कारों के "ब्लैक बॉक्स" को एक पारदर्शी, भरोसेमंद साथी में बदल देता है जिसे आप वास्तव में समझ सकते हैं और जिस पर भरोसा कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →