UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations
यह शोध पत्र UniTraffic-Agent प्रस्तुत करता है, जो AI City Challenge 2026 में ट्रैफ़िक वीडियो रीजनिंग चुनौतियों को संबोधित करने के लिए 'ऑब्ज़र्व-रीज़न-एक्ट-वेरिफाई' (अवलोकन-तर्क-कार्य-सत्यापन) वर्कफ़्लो का उपयोग करने वाला एक एकीकृत ढांचा है, जिसने ट्रैफ़िक विसंगति तर्क और फिशआई इवेंट्स एवं पैदल यात्री इरादे के दो आउट-ऑफ-डोमेन मूल्यांकनों में शीर्ष स्तर का प्रदर्शन हासिल किया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन अपराध स्थल के बजाय, आपका साक्ष्य एक व्यस्त शहर की सड़क का एक अराजक, चलता-फिरता वीडियो है। यह ट्रैफिक वीडियो अंडरस्टैंडिंग (यातायात वीडियो समझ) की दुनिया है, जहाँ कंप्यूटर यह समझने की कोशिश करते हैं कि हमारी सड़कों पर क्या हो रहा है। लंबे समय तक, कंप्यूटर एक स्थिर फोटो में एक अकेली वस्तु, जैसे कि लाल कार या स्टॉप साइन, को पहचानने में माहिर थे। लेकिन वास्तविक जीवन एक फोटो नहीं है; यह एक फिल्म है। किसी यातायात दुर्घटना या बाल-बाल बचने की घटना को समझने के लिए, एक कंप्यूटर को केवल "देखने" से कहीं अधिक करने की आवश्यकता है; उसे देखना (watch), सोचना (think), और समय के साथ कड़ियों को जोड़ना (connect the dots) होगा। उसे यह पता लगाना होगा कि किसने क्या किया, उन्होंने ऐसा क्यों किया, और यह कब हुआ। यह मुश्किल है क्योंकि ट्रैफिक वीडियो अव्यवस्थित होते हैं: कैमरा एक अजीब फिश-आई लेंस हो सकता है, क्रिया एक सेकंड के अंश में हो सकती है, और एक ही क्लिप को कई अलग-अलग सवालों के जवाब देने की आवश्यकता हो सकती है। इस शोध का लक्ष्य एक ऐसा कंप्यूटर सिस्टम बनाना है जो एक अत्यंत बुद्धिमान, धैर्यवान जासूस की तरह काम करे जो कभी भी कोई विवरण मिस न करे, चाहे कैमरा कैसे भी सेट किया गया हो।
UniTraffic-Agent से मिलिए, एक नया डिजिटल जासूस जिसे शोधकर्ताओं की एक टीम ने "ट्रैफिक एनोमली रीजनिंग" (यातायात विसंगति तर्क) चुनौती से निपटने के लिए बनाया है। इस एजेंट को एक अत्यधिक संगठित अन्वेषक के रूप में सोचें जो केवल वीडियो पर एक नज़र डालकर अनुमान नहीं लगाता है। इसके बजाय, यह एक सख्त चार-चरणीय दिनचर्या का पालन करता है: अवलोकन (Observe), तर्क (Reason), कार्य (Act), और सत्यापन (Verify)।
सबसे पहले, अवलोकन (Observe) चरण में, एजेंट वीडियो को देखने के मामले में स्मार्ट है। हर एक फ्रेम को प्रोसेस करने के बजाय (जो कि एक किताब के सारांश के लिए हर शब्द को पढ़ने जैसा होगा), यह सबसे महत्वपूर्ण क्षणों को चुनता है। यदि कोई प्रश्न किसी विशिष्ट समय पर होने वाली चीज़ के बारे में पूछता है, तो एजेंट उस क्षण के ठीक पहले और बाद के सेकंडों पर ज़ूम करता है, जबकि बड़ी तस्वीर को ध्यान में रखने के लिए शुरुआत और अंत से कुछ फ्रेम भी लेता है। यह एक ऐसे जासूस की तरह है जो जानता है कि महत्वपूर्ण सुराग पकड़ने के लिए सुरक्षा फुटेज के किन सेकंडों को रिवाइंड करना है।
इसके बाद आता है तर्क (Reason)। यहीं पर यह एजेंट चमकता है। अक्सर, एक एकल वीडियो क्लिप के साथ कई प्रश्न जुड़े होते हैं, जैसे "ट्रैफिक लाइट किसने तोड़ी?" या "मौसम कैसा था?" या "कार कितनी देर रुकी?" पुराने सिस्टम प्रत्येक प्रश्न का एक-एक करके उत्तर देने का प्रयास कर सकते हैं, जिससे विरोधाभास पैदा हो सकता है—जैसे एक उत्तर में कार को लाल कहना और दूसरे में नीला। UniTraffic-Agent कुछ अलग करता है: यह पूरे क्लिप को एक बार देखता है, जो हुआ उसकी एक एकल, साझा कहानी बनाता है, और फिर उसी कहानी का उपयोग करके एक साथ सभी प्रश्नों के उत्तर देता है। यह सुनिश्चित करता है कि जासूस की कहानी शुरू से अंत तक सुसंगत रहे।
फिर, कार्य (Act) चरण सक्रिय होता है। अलग-अलग कार्यों के लिए अलग-अलग प्रारूपों की आवश्यकता होती है। एक कार्य में सरल "हाँ" या "नहीं" की आवश्यकता हो सकती है, जबकि दूसरे में यातायात उल्लंघन का वर्णन करने वाले 13 विभिन्न फ़ील्ड के साथ एक विस्तृत JSON फ़ाइल की आवश्यकता हो सकती है। एजेंट विशेष "एडेप्टर" (adapters) का उपयोग करता है—इन्हें अनुवादकों या आकार बदलने वालों के रूप में सोचें—जो उसकी साझा कहानी को लेने और उसे प्रत्येक विशिष्ट कार्य के लिए आवश्यक सटीक प्रारूप में ढालने का काम करते हैं।
अंत में, सत्यापन (Verify) चरण एक गुणवत्ता नियंत्रण निरीक्षक की तरह कार्य करता है। यह उत्तरों की दोबारा जाँच करता है, सुनिश्चित करता है कि नाम और समय मेल खाते हों, और यदि कुछ अजीब लगता है, तो यह फिर से कोशिश करने के लिए कैश किए गए वीडियो फ्रेमों पर वापस जाता है। यह "रिट्राय" (पुनः प्रयास) तंत्र एजेंट को मानवीय मदद के बिना अपनी गलतियों को सुधारने में मदद करता है।
शोधकर्ताओं ने इस एजेंट का परीक्षण तीन बहुत अलग प्रकार के ट्रैफिक वीडियो पर किया: मानक निगरानी फुटेज, विकृत फिश-आई लेंस वीडियो, और कारों के डैशकैम वीडियो। परिणाम प्रभावशाली थे। फिश-आई कार्य पर, एजेंट सभी प्रतिस्पर्धियों में से दूसरे स्थान पर रहा, और पैदल यात्री इरादे (pedestrian intention) के कार्य पर, यह चौथे स्थान पर रहा। मुख्य, सबसे कठिन कार्य पर भी, यह 16वें स्थान पर रहा। टीम ने पाया कि हालांकि एजेंट अभिनेताओं (actors) को पहचानने और घटनाओं के सामान्य प्रवाह को पकड़ने में उत्कृष्ट था, लेकिन कभी-कभी इसे बहुत लंबे, विस्तृत विवरणों या फिश-आई लेंस के विकृत ज्यामिति की व्याख्या करने में संघर्ष करना पड़ा। हालाँकि, अध्ययन यह सुझाव देता है कि स्मार्ट अवलोकन को एक एकीकृत तर्क प्रक्रिया के साथ जोड़कर, हम पहले की तुलना में बहुत अधिक विश्वसनीय और सुसंगत ट्रैफिक AI बना सकते हैं। इस "जासूस" का कोड अब दूसरों के सीखने और सुधारने के लिए खुला है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।