← नवीनतम पेपर
💬 NLP

Beyond the Beep: Scalable Collision Anticipation and Real-Time Explainability with BADAS-2.0

BADAS-2.0 दुर्लभ सुरक्षा-महत्वपूर्ण परिदृश्यों के लिए एक बड़े पैमाने के लॉन्ग-टेल बेंचमार्क को पेश करके टकराव के पूर्वानुमान को उन्नत करता है, कुशल नॉलेज डिस्टिलेशन के माध्यम से वास्तविक समय में एज पर तैनाती सक्षम करता है, और ऑब्जेक्ट-सेंट्रिक अटेंशन हीटमैप्स एवं विजन-लैंग्वेज रीजनिंग के माध्यम से व्याख्या योग्य भविष्यवाणियां प्रदान करता है।

मूल लेखक: Roni Goldshmidt, Hamish Scott, Lorenzo Niccolini, Hernan Matzner

प्रकाशित 2026-04-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Roni Goldshmidt, Hamish Scott, Lorenzo Niccolini, Hernan Matzner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आपका लक्ष्य केवल रोबोट को यह बताना नहीं है कि "अरे, टक्कर हो गई!" जब दुर्घटना हो चुकी हो। आप चाहते हैं कि रोबोट दुर्घटना होने से पहले ही कहे, "रुको! तीन सेकंड में एक हिरण बाहर कूदने वाला है!"

यह पेपर BADAS-2.0 को पेश करता है, जो ठीक यही करने के लिए डिज़ाइन किए गए एक सिस्टम का एक विशाल अपग्रेड है। इसे एक घबराए हुए, आसानी से भ्रमित होने वाले छात्र ड्राइवर से एक शांत, अत्यधिक जागरूक पेशेवर में विकसित होते हुए समझें जिसके पास एक भविष्य बताने वाला क्रिस्टल बॉल (crystal ball) है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे तीन सरल अध्यायों में विभाजित किया गया है।

अध्याय 1: "स्मार्ट सर्च" (डेटा को सुधारना)

समस्या:
पिछरा संस्करण (BADAS-1.0) अच्छा था, लेकिन इसमें एक अंधा मोड़ (blind spot) था। इसने हजारों सामान्य ड्राइविंग वीडियो देखे थे, लेकिन इसने शायद ही कभी अजीब और डरावनी चीजें देखी थीं: जैसे रात में सड़क पार करती हुई गाय, बर्फबारी में एक साइकिल चालक, या भारी कोहरे में आपके सामने अचानक आ जाने वाली कार। क्योंकि इसने इन "लॉन्ग-टेल" (दुर्लभ) घटनाओं को नहीं देखा था, इसलिए यह या तो घबरा जाता था या उन्हें पूरी तरह से मिस कर देता था।

समाधान:
लाखों घंटों के उबाऊ ड्राइविंग वीडियो में दुर्लभ दुर्घटना खोजने के लिए हजारों इंसानों को काम पर रखने के बजाय, टीम ने एक चतुर ट्रिक का उपयोग किया।

  • द ओरकल (The Oracle): उन्होंने पुराने रोबोट (BADAS-1.0) को लाखों घंटों के वीडियो देखने दिया।
  • द फिल्टर (The Filter): जब भी पुराना रोबोट घबरा जाता और कहता, "रुको, यह जोखिम भरा लग रहा है!", तो उन्होंने उस क्लिप को सुरक्षित कर लिया।
  • द ह्यूमन टच (The Human Touch): वास्तविक इंसानों ने फिर उन विशिष्ट "जोखिम भरे" क्लिप्स की समीक्षा की ताकि पुष्टि की जा सके कि क्या वह वास्तव में एक खतरा था।

उपमा:
कल्पना कीजिए कि आप रेत के एक विशाल ढेर में एक विशिष्ट, दुर्लभ सिक्के की तलाश कर रहे हैं।

  • पुराना तरीका: आप फावड़े से बेतरतीब ढंग से खुदाई करते हैं। आपको एक सिक्का मिल सकता है, लेकिन ज्यादातर आपको सिर्फ रेत मिलेगी।
  • BADAS-2.0 का तरीका: आप एक मेटल डिटेक्टर का उपयोग करते हैं (पुराना रोबोट) जो केवल धातु का पता चलने पर बीप करता है। आप केवल वहीं खुदाई करते हैं जहाँ वह बीप करता है। अचानक, आप दुर्लभ सिक्के बहुत तेज़ी से खोज लेते हैं।

ऐसा करके, उन्होंने अपने ट्रेनिंग लाइब्रेरी को 40,000 वीडियो से बढ़ाकर लगभग 180,000 कर दिया, विशेष रूप से डरावनी और दुर्लभ स्थितियों की कमियों को पूरा किया।

अध्याय 2: "शिक्षक और छात्र" (इसे तेज़ बनाना)

समस्या:
नया, अधिक स्मार्ट रोबोट (BADAS-2.0) अविश्वसनीय रूप से सटीक था, लेकिन वह एक विशालकाय चीज़ था। यह एक स्मार्टफोन पर चलने वाले सुपरकंप्यूटर जैसा था। इसे सोचने में बहुत समय लगता था, जिससे इसे एक वास्तविक कार में उपयोग करना असंभव हो जाता था जिसे मिलीसेकंड में प्रतिक्रिया देने की आवश्यकता होती है।

समाधान:
उन्होंने नॉलेज डिस्टिलेशन (Knowledge Distillation) का उपयोग किया।

  • द टीचर (The Teacher): विशाल, सुपर-स्मार्ट रोबोट (BADAS-2.0) जो सब कुछ जानता है लेकिन धीमा है।
  • द स्टूडेंट्स (The Students): दो छोटे, तेज़ रोबोट (BADAS-2.0-Flash और Flash-Lite)।

लेकिन यहाँ असली राज है: छात्रों को शुरू करने से पहले, उन्हें एक "हेड स्टार्ट" दिया गया। टीम ने छोटे छात्रों को लाखों अनलेबल वीडियो (बिना उत्तर वाले वीडियो) का उपयोग करके ड्राइविंग दृश्यों को समझने के लिए प्रशिक्षित किया। यह एक छात्र को सड़क के नियमों को सीखने से पहले सड़क के आकार या कार की गति को पहचानने के लिए सिखाने जैसा है।

उपमा:

  • बिना हेड स्टार्ट के: एक छोटे बच्चे को शतरंज के नियम दिखाकर उसे शतरंज खेलना सिखाने की कोशिश करना। वे असफल होंगे।
  • हेड स्टार्ट के साथ: पहले, आप बच्चे को घंटों तक मोहरों के साथ खेलने देते हैं ताकि वे समझ सकें कि मोहरे कैसे चलते हैं और महसूस होते हैं। फिर आप उन्हें खेल के नियम सिखाते हैं। छात्र खेल को 10 गुना तेज़ी से सीखता है और लगभग ग्रैंडमास्टर जितना अच्छा बन जाता है, लेकिन वह एक छोटे फोन पर खेल सकता है।

परिणाम? छोटे मॉडल बड़े वाले की तुलना में 7 से 12 गुना तेज़ हैं, फिर भी वे लगभग उतने ही स्मार्ट हैं। अब वे एक कार के कंप्यूटर में रियल-टाइम में चल सकते हैं।

अध्याय 3: "व्याख्यात्मक जासूस" (आपने क्यों रोका?)

समस्या:
यदि कार अचानक ब्रेक लगाती है, तो ड्राइवर पूछता है, "क्यों?" पुराना सिस्टम केवल एक नंबर देता था: "जोखिम स्तर: 90%"। यह मददगार नहीं है। यह एक डॉक्टर के कहने जैसा है, "आपको बीमार होने की 90% संभावना है," बिना यह बताए कि क्या गलत है।

समाधान:
BADAS-2.0 के पास अब दो महाशक्तियाँ हैं:

  1. द हीटमैप (The Heatmap): यह स्क्रीन पर एक चमकती हुई स्पॉटलाइट बनाता है जो दिखाता है कि यह वास्तव में किस चीज़ को देख रहा है (जैसे, "मैं फुटपाथ से उतरते हुए उस पैदल यात्री को देख रहा हूँ")।
  2. द ट्रांसलेटर (The Translator - BADAS-Reason): यह उस विजुअल फोकस को मानवीय भाषा में बदलने के लिए एक विशेष AI का उपयोग करता है।

उपमा:

  • पुराना सिस्टम: एक सुरक्षा गार्ड चिल्लाते हुए, "अलर्ट! खतरा!" जबकि वह आसमान की ओर अस्पष्ट रूप से इशारा कर रहा है।
  • नया सिस्टम: एक सुरक्षा गार्ड सीधे एक व्यक्ति की ओर इशारा करते हुए कहता है, "रुकिए! वह आदमी दाईं ओर खड़ा है और दरवाजे की ओर बढ़ रहा है। पीछे हटें!"

सिस्टम अब ऐसे वाक्य बनाता है: "एक पैदल यात्री दाईं ओर के फुटपाथ से लेन में कदम रख रहा है। तुरंत ब्रेक लगाएं।" यह तर्क (reasoning) और आवश्यक कार्रवाई (action) दोनों की व्याख्या करता है।

बड़ी तस्वीर

पेपर इस निष्कर्ष पर पहुँचता है कि AI को सुरक्षित बनाने का रहस्य केवल बड़े, फैंसी दिमाग बनाना नहीं है। यह है:

  1. सही डेटा खोजना (दुर्लभ, डरावने क्षणों को खोजने के लिए पुराने AI का उपयोग करना)।
  2. छोटे मॉडलों को सिखाना ("हेड स्टार्ट" ट्रेनिंग का उपयोग करना ताकि उन्हें स्मार्ट होने के लिए विशाल होने की आवश्यकता न हो)।
  3. इंसानों से बात करना (यह समझाना कि खतरा क्यों मौजूद है)।

BADAS-2.0 साबित करता है कि सही डेटा और सही शिक्षण पद्धति के साथ, हम ऐसे टकराव-निवारण (collision-avoidance) सिस्टम बना सकते हैं जो न केवल सुपर-स्मार्ट हैं बल्कि आपकी कार में फिट होने के लिए पर्याप्त तेज़ और आपको समझाने के लिए स्पष्ट भी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →