AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models
यह शोध पत्र AITP को प्रस्तुत करता है, जो एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो जटिल यातायात दुर्घटना उत्तरदायित्व आवंटन करने के लिए मल्टीमॉडल चेन-ऑफ-थॉट और रिट्रीवल-ऑगमेंटेड जनरेशन का लाभ उठाता है, जिसे लगभग 68,000 एनोटेटेड वीडियो वाले व्यापक DecaTARA बेंचमार्क द्वारा समर्थित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ट्रैफिक पुलिस अधिकारी हैं। हर दिन, आपको डैशकैम फुटेज देखनी होती है, यह पता लगाना होता है कि क्या गलत हुआ, और यह तय करना होता है कि किसकी गलती थी। आमतौर पर, इसमें किसी इंसान को बहुत समय लगता है क्योंकि उसे कानूनों को पढ़ना पड़ता है और वीडियो के हर सेकंड को ध्यान से देखना पड़ता है।
यह शोध पत्र एक नए "AI ट्रैफिक पुलिस" से परिचित कराता है जिसे AITP (आर्टिफिशियल इंटेलिजेंस ट्रैफिक पुलिस) कहा जाता है और एक विशाल प्रशिक्षण स्कूल DecaTARA के बारे में बताता है, जो इसे वर्तमान कंप्यूटर मॉडल की तुलना में इस काम को बेहतर ढंग से करने के लिए सिखाता है।
यहाँ सरल शब्दों में इसका विवरण दिया गया है:
1. समस्या: "भ्रमित होने वाला" रोबोट (The "Hallucinating" Robot)
वर्तमान AI मॉडल उन छात्रों की तरह हैं जो चित्र का वर्णन करने में तो बहुत अच्छे हैं लेकिन गणित की समस्या हल करने में बहुत खराब हैं।
- वे क्या अच्छा करते हैं: वे एक वीडियो देख सकते हैं और कह सकते हैं, "ओह, एक कार ने पेड़ से टक्कर मारी।" (इसे ट्रैफिक एक्सीडेंट अंडरस्टैंडिंग कहा जाता है)।
- वे कहाँ विफल होते हैं: उन्हें यह बताने में संघर्ष करना पड़ता है कि, "कानूनी रूप से जिम्मेदार कौन है?" (यह ट्रैफिक एक्सीडेंट रिस्पॉन्सिबिलिटी एलोकेशन है)।
- समस्या: यदि आप किसी मानक AI से पूछते हैं, "इस दुर्घटना का कारण कौन है?" तो वह केवल अनुमान लगा सकता है या अपनी ओर से बातें बना सकता है (हैलुसिनेट कर सकता) क्योंकि उसे वास्तव में यातायात कानूनों या चरण-दर-चरण तर्क देने का ज्ञान नहीं है। यह एक पर्यटक से कानूनी सलाह मांगने जैसा है; वे जानते होंगे कि लाल बत्ती कैसी दिखती है, लेकिन वे उसके पीछे के कानून को नहीं जानते।
2. समाधान: AITP (नया AI पुलिसकर्मी)
शोधकर्ताओं ने AITP बनाया है, जो विशेष रूप से एक ट्रैफिक जज बनने के लिए डिज़ाइन किया गया है। यह अनुमान लगाने के बजाय तर्क करने के लिए दो मुख्य "सुपरपावर्स" का उपयोग करता है:
सुपरपावर #1: "चरण-दर-चरण" जासूस (Multimodal Chain-of-Thought)
सीधे फैसले पर कूदने के बजाय, AITP को एक जासूस की तरह सोचने के लिए मजबूर किया जाता है। उसे पहले एक चेकलिस्ट के सवालों के जवाब देने होते हैं:- क्या वास्तव में कोई दुर्घटना हुई है?
- यह किस प्रकार की दुर्घटना थी?
- यह ठीक कब हुई? (फ्रेम दर फ्रेम)।
- लोग/वाहन कहाँ थे?
- इसका कारण क्या था?
- इसे कैसे टाला जा सकता था?
इन सभी के उत्तर देने के बाद ही यह तय करता है कि किसकी गलती है। यह इसे चरणों को छोड़ने और गलतियाँ करने से रोकता है।
सुपरपावर #2: "कानून की लाइब्रेरी" (Retrieval-Augmented Generation)
AITP केवल अपनी याददाश्त पर निर्भर नहीं रहता। जब इसे यह तय करने की आवश्यकता होती है कि किसकी गलती है, तो इसके साथ एक जादुई "कानून की लाइब्रेरी" (RAG) जुड़ी होती है। यह विशिष्ट यातायात कानूनों (जैसे "पैदल यात्रियों को क्रॉसिंग का उपयोग करना चाहिए") को खोजता है और अपने उत्तर में उनका उल्लेख करता है। यह इसके निर्णय को केवल एक अनुमान के बजाय वास्तविक नियमों पर आधारित बनाता है।
3. प्रशिक्षण स्कूल: DecaTARA
आप एक AI को केवल एक वीडियो दिखाकर नहीं सिखा सकते। आपको मामलों की एक विशाल लाइब्रेरी की आवश्यकता है।
- शोधकर्ताओं ने DecaTARA बनाया है, जो AI को यातायात जिम्मेदारी के बारे में सिखाने के लिए दुनिया का पहला विशाल डेटासेट है।
- इसमें लगभग 68,000 वीडियो और 195,000 प्रश्न और उत्तर शामिल हैं।
- यह AI के लिए एक "डेकाथलॉन" (10 स्पर्धाओं वाली खेल प्रतियोगिता) की तरह है। AI को 10 अलग-अलग कौशल सीखने होते हैं, दुर्घटनाओं को पहचानने से लेकर यह समझाने तक कि कार ने ब्रेक क्यों लगाया, और अंत में दोष मढ़ने तक।
4. यह कैसे काम करता है (प्रशिक्षण प्रक्रिया)
शोधकर्ताओं ने सारा डेटा एक साथ AI पर नहीं डाला। उन्होंने एक 4-चरणीय प्रशिक्षण रणनीति का उपयोग किया, जैसे कि कुत्ते को प्रशिक्षित करना:
- चरण 1 (बुनियादी बातें): AI को सामान्य ड्राइविंग (हरी बत्ती, लाल बत्ती पर रुकना) को पहचानना सिखाना ताकि वह भ्रमित न हो।
- चरण 2 (दुर्घटना को पहचानना): इसे यह पहचानने के लिए सिखाना कि क्या कोई दुर्घटना हुई है और वह किस प्रकार की थी।
- चरण 3 (कहानी को समझना): इसे दुर्घटना का वर्णन करना, यह समझाना कि यह क्यों हुई, और इसे कैसे टाला जा सकता है, यह सिखाना।
- चरण 4 (फैसला): अंत में, पिछले चरणों में सीखे गए कानूनों और तर्क का उपयोग करके जिम्मेदारी सौंपना सिखाना।
5. परिणाम
जब उन्होंने अन्य शीर्ष AI मॉडलों के मुकाबले AITP का परीक्षण किया:
- पुराने मॉडल: अक्सर दुर्घटनाओं को पूरी तरह से मिस कर देते थे या किसकी गलती थी इसके बारे में अस्पष्ट, गलत उत्तर देते थे।
- AITP: यह "स्टेट-ऑफ-द-आर्ट" (दुनिया में सबसे अच्छा) बन गया। इसने सही ढंग से दुर्घटनाओं की पहचान की, सटीक रूप से बताया कि वे कब और कहाँ हुईं, और उच्च सटीकता के साथ जिम्मेदारी सौंपी, और अक्सर उस विशिष्ट यातायात कानून का भी उल्लेख किया जिसका उल्लंघन किया गया था।
बड़ी तस्वीर
इसे एक कैमरे से, जो केवल दुर्घटना को रिकॉर्ड करता है, एक स्मार्ट जज में बदलने के रूप में देखें जो वीडियो देखता है, कानून की किताब पढ़ता है, और एक निष्पक्ष फैसला लिखता है। यह तकनीक अंततः ट्रैफिक पुलिस के काम के बोझ को कम करने, दुर्घटनाओं की प्रक्रिया को तेज करने और यह सुनिश्चित करने में मदद कर सकती है कि जिम्मेदारी निष्पक्ष और सुसंगत रूप से सौंपी जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।