← नवीनतम पेपर
💻 computer science

CoLT-Drive: Counterfactual Long-Tail Benchmarking and Knowledge-Preserving Adaptation for Driving Affordance Prediction

यह शोधपत्र ड्राइविंग अफोर्डेंस प्रेडिक्शन (driving affordance prediction) के मूल्यांकन के लिए एक काउंटरफैक्चुअल लॉन्ग-टेल बेंचमार्क, CoLT-Drive पेश करता है, और KPA का प्रस्ताव देता है, जो एक नॉलेज-प्रिजर्विंग अडैप्टेशन फ्रेमवर्क है जो इन-डोमेन क्षमताओं को बनाए रखते हुए दुर्लभ ड्राइविंग परिदृश्यों पर छोटे विजन-लैंग्वेज मॉडल्स के प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Zhengxu Tang, Guofeng Cui, Ziyu Gong, Xiaozhou Zhang, Ruifeng Deng, Chengzhi Qi, Ke Chen, Sachin Patil, Tianjun Xiao, Langechuan Liu, Pichao Wang

प्रकाशित 2026-09-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhengxu Tang, Guofeng Cui, Ziyu Gong, Xiaozhou Zhang, Ruifeng Deng, Chengzhi Qi, Ke Chen, Sachin Patil, Tianjun Xiao, Langechuan Liu, Pichao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

स्वायत्त वाहन (ऑटोनॉमस व्हीकल) रोज़मर्रा की दुनिया में नेविगेट करने में उल्लेखनीय रूप से कुशल हो गए हैं। वे राजमार्ग के निरंतर प्रवाह को संभाल सकते हैं, बारिश में लेन मार्किंग का पालन कर सकते हैं, और शहर के चौराहों की अनुमानित लय पर प्रतिक्रिया दे सकते हैं। हालाँकि, ये सिस्टम असामान्य स्थितियों का सामना करने पर अक्सर लड़खड़ा जाते हैं: जैसे सड़क पर आया हुआ एक शॉपिंग कार्ट, गिरा हुआ पेड़, या एक प्लास्टिक की थैली जो पत्थर जैसी दिखती हो। वर्षों से, इंजीनियरों ने इन विफलताओं को सरल पहचान त्रुटियों के रूप में माना है, यह मानकर कि यदि कार के कंप्यूटर केवल उस अजीब वस्तु का सही नाम जान सके, तो वह जान जाएगा कि क्या करना है। लेकिन यह दृष्टिकोण एक महत्वपूर्ण चरण को छोड़ देता है। किसी वस्तु को पहचानना केवल शुरुआत है; असली चुनौती यह समझने में है कि उस वस्तु का कार के अगले कदम के लिए क्या अर्थ है। एक प्लास्टिक की थैली को सुरक्षित रूप से ऊपर से चलाया जा सकता है, जबकि एक गिरा हुआ पेड़ तत्काल रुकने की मांग करता है। अंतर वस्तु के नाम में नहीं, बल्कि उस स्थान में है जो वह कार्रवाई के लिए खुला छोड़ती है।

NVIDIA के शोधकर्ताओं की एक टीम ने इस विशिष्ट कौशल को परखने और सुधारने के लिए एक नया तरीका प्रस्तावित किया है, जिसे वे "ड्राइविंग अफोर्डेंस" (driving affordance) कहते हैं। केवल एक दुर्लभ वस्तु की पहचान करने के बजाय, वे कंप्यूटर से यह तय करने के लिए कहते हैं कि वाहन वास्तव में आगे क्या करने की अनुमति है। ऐसा करने के लिए, उन्होंने CoLT-Drive नामक एक विशेष परीक्षण बनाया है। यह बेंचमार्क 29 मानक ड्राइविंग दृश्यों को लेता है और उनमें 50 अलग-अलग प्रकार की दुर्लभ बाधाओं को डाल देता है, जिससे हजारों नियंत्रित परिदृश्य बनते हैं। शोधकर्ता फिर विभिन्न आर्टिफिशियल इंटेलिजेंस मॉडलों से सही उच्च-स्तरीय कार्यों की भविष्यवाणी करने के लिए कहते हैं, जैसे कि धीमा होना, लेन बदलना, या रुकना। लक्ष्य यह देखना है कि क्या मॉडल एक अजीब वस्तु की दृश्य उपस्थिति को एक सुरक्षित, तार्किक ड्राइविंग निर्णय से जोड़ सकते हैं, बजाय इसके कि वे स्वयं उस वस्तु की नवीनता में उलझ जाएं।

इस परीक्षण के परिणामों ने एक महत्वपूर्ण समस्या को उजागर किया। जब शोधकर्ताओं ने छोटे AI मॉडलों को सामान्य ड्राइविंग डेटा की विशाल मात्रा पर प्रशिक्षित किया ताकि उन्हें नियमित कार्यों में बेहतर बनाया जा सके, तो वे मॉडल वास्तव में इन दुर्लभ, असामान्य स्थितियों को संभालने में और भी खराब हो गए। सामान्य परिस्थितियों में गाड़ी चलाने के तरीके को बहुत अच्छी तरह सीखकर, मॉडल अप्रत्याशित चीजों के बारे में सोचना भूल गए। वे सड़क के सामान्य पैटर्न में इतने विशेषज्ञ हो गए कि जब नियम बदल गए, तो वे विफल हो गए। यह घटना, जिसे 'ओवर-स्पेशलाइजेशन' (over-specialization) कहा जाता है, का अर्थ था कि एक मॉडल सामान्य ट्रैफ़िक के सिमुलेशन में तो बेहतरीन गाड़ी चला सकता था, लेकिन एक अकेली असामान्य वस्तु आने पर घबरा सकता था या खतरनाक गलतियाँ कर सकता था।

इसे हल करने के लिए, शोधकर्ताओं ने KPA नामक एक नई अनुकूलन विधि विकसित की। यह दृष्टिकोण मॉडल को यह सिखाने के लिए डिज़ाइन किया गया है कि वह दुनिया के बारे में अपने पास पहले से मौजूद व्यापक, सामान्य ज्ञान को मिटाए बिना, दुर्लभ स्थितियों में सुरक्षित रूप से कैसे ड्राइव करे। यह प्रक्रिया तीन चरणों में काम करती है। सबसे पहले, टीम एक "रूढ़िवादी" (conservative) शुरुआती बिंदु बनाती है, जो ड्राइविंग डेटा पर प्रशिक्षित मॉडल के भार (weights) को मूल, प्री-ट्रेंड मॉडल के साथ सावधानीपूर्वक मिलाता है। यह सुनिश्चित करता है कि सिस्टम वस्तुओं और दृश्यों की अपनी सामान्य समझ बनाए रखे। इसके बाद, वे एक विशेष मॉड्यूल जोड़ते हैं जो मॉडल को सामना की जाने वाली स्थिति के प्रकार के आधार पर अपना व्यवहार बदलने की अनुमति देता है। यदि कार बस हाईवे पर चल रही है, तो सिस्टम निर्णय के नियमों का एक सेट उपयोग करता है। यदि वह किसी खतरे का पता लगाती है जिसके लिए अचानक रुकने या लेन बदलने की आवश्यकता है, तो यह नियमों का एक अलग सेट सक्रिय करता है। यह मॉडल को उसके बुनियादी ज्ञान को खोए बिना लचीला और संदर्भ-जागरूक बनाता है।

CoLT-Drive बेंचमार्क पर परीक्षण करने पर, इस नई विधि ने स्पष्ट सुधार दिखाया। मानक मॉडल, ड्राइविंग डेटा पर प्रशिक्षित होने के बाद भी, इन दुर्लभ वस्तुओं का सामना करने पर केवल 32 प्रतिशत बार ही सही कार्य की भविष्यवाणी कर पाए। मूल, अप्रशिक्षित मॉडल 50 प्रतिशत पर थोड़ा बेहतर प्रदर्शन कर रहा था, क्योंकि उसने अपने सामान्य तर्क कौशल को नहीं खोया था। हालाँकि, नई KPA विधि ने सफलता दर को लगभग 61 प्रतिशत तक बढ़ा दिया। इसने साबित कर दिया कि मॉडल के 'ओपन-वर्ल्ड' ज्ञान को संरक्षित करते हुए विशिष्ट, लचीले निर्णय लेने वाले उपकरण जोड़ने से, सिस्टम अप्रत्याशित स्थितियों को बहुत अधिक प्रभावी ढंग से संभाल सकता है। शोधकर्ताओं ने यह भी पाया कि यह विधि एक छोटे, कुशल मॉडल पर अच्छी तरह काम करती है जो वास्तव में कार के कंप्यूटर पर चल सकता है, बजाय इसके कि भारी-भरकम, अत्यधिक बिजली खपत करने वाले सर्वरों की आवश्यकता हो।

अध्ययन ने इन प्रणालियों के परीक्षण के महत्व पर भी प्रकाश डाला। शोधकर्ताओं ने प्रत्येक परीक्षण दृश्य के दो संस्करण बनाए: एक जिसमें सभी आसपास का ट्रैफ़िक बरकरार था और एक जहाँ बैकग्राउंड वाहनों को हटा दिया गया था। उन्होंने पाया कि कुछ मॉडल निर्णय लेने के लिए अन्य कारों के व्यवहार पर बहुत अधिक निर्भर थे। यदि आगे वाली कार धीमी हो रही थी, तो मॉडल भी बिना वास्तव में यह समझे कि क्यों, धीमा हो जाता था। नया तरीका अधिक स्थिर था, जो केवल आसपास के ट्रैफ़िक के व्यवहार की नकल करने के बजाय बाधा के आधार पर निर्णय लेता था। यह सुझाव देता है कि स्वायत्त ड्राइविंग को वास्तव में सुरक्षित होने के लिए, प्रणालियों को सड़क की भौतिक वास्तविकता में अपने निर्णयों को स्थापित करने में सक्षम होना चाहिए, यह समझना चाहिए कि एक दुर्लभ वस्तु उनके अपने पथ के लिए क्या निहितार्थ रखती है, चाहे अन्य चालक कुछ भी कर रहे हों।

हालाँकि परिणाम आशाजनक हैं, शोधकर्ता उनके काम की सीमाओं को नोट करने में भी सावधान हैं। बेंचमार्क उन छवियों का उपयोग करता है जिन्हें बाधाओं को डालने के लिए डिजिटल रूप से संपादित किया गया है, जिसका अर्थ है कि सिस्टम का परीक्षण एक पूर्ण, वास्तविक दुनिया के क्रैश या जटिल ट्रैफ़िक प्रवाह के बजाय एक नियंत्रित नैदानिक (diagnostic) पर किया जा रहा है। अध्ययन यह मापता है कि क्या मॉडल सही उच्च-स्तरीय क्रिया, जैसे कि "धीमा होना", चुन सकता है, लेकिन यह उस क्रिया के भौतिक परिणामों या एक क्लोज्ड लूप में अन्य एजेंटों के साथ कार कैसे इंटरैक्ट करेगी, इसका सिमुलेशन नहीं करता है। लक्ष्य यह पहचानना था कि मॉडल में दुर्लभ घटनाओं के बारे में सोचने के तरीके में एक विशिष्ट कमी कहाँ है और इसे ठीक करने के लिए एक उपकरण प्रदान करना था। निष्कर्ष बताते हैं कि सुरक्षित स्वायत्त ड्राइविंग का मार्ग केवल अधिक वस्तुओं को देखने में नहीं है, बल्कि उन विशिष्ट स्थानों को समझने में है जो वे वस्तुएं वाहन के चलने के लिए छोड़ती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →