← नवीनतम पेपर
💻 computer science

From Detection to Understanding: TAR and TAR-Bench for Multi-Task Traffic Anomaly Reasoning

यह शोध पत्र TAR और TAR-Bench प्रस्तुत करता है, जो एक व्यापक डेटासेट और बेंचमार्क है जिसमें 10 कार्यों केAcross 44,040 चेन-ऑफ-थॉट एनोटेशन शामिल हैं, जिसका उद्देश्य वीडियो-लैंग्वेज मॉडल्स को सरल डिटेक्शन से परे मल्टी-टास्क ट्रैफिक विसंगति तर्क (traffic anomaly reasoning) के लिए प्रशिक्षित और मूल्यांकित करना है।

मूल लेखक: Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Zheng Tang, Varun Praveen, Vidya N. Murali, David C. Anastasiu, Tomasz Kornuta

प्रकाशित 2026-08-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Zheng Tang, Varun Praveen, Vidya N. Murali, David C. Anastasiu, Tomasz Kornuta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त शहर की सड़क के सुरक्षा कैमरा फीड देख रहे हैं। वर्षों तक, इन फीड्स को देखने वाले कंप्यूटर बहुत सख्त, लेकिन थोड़े मंदबुद्धि सुरक्षा गार्डों की तरह थे। उनका एकमात्र काम था चिल्लाना, "हे! कुछ अजीब हो रहा है!" या "सब ठीक है!" वे आपको बता सकते थे कि एक दुर्घटना हुई है, लेकिन वे यह नहीं बता सकते थे कि क्या टकराया, कब हुआ, या क्यों हुआ। वे समस्या पहचानने में माहिर थे, लेकिन उसके पीछे की कहानी समझने में बहुत खराब थे।

अब, कल्पना कीजिए कि हम इन गार्डों को जासूसी पत्रकारों की एक टीम में अपग्रेड करना चाहते हैं। हम केवल यह नहीं चाहते कि वे "आग लगी है!" चिल्लाएं; हम चाहते हैं कि वे समझाएं, "एक चांदी की कार ने रेड लाइट जंप की, बाइक लेन में मुड़ी, और ड्राइवर का ध्यान भटकने के कारण एक चेन रिएक्शन शुरू हो गया।" साधारण "डिटेक्शन" (पहचान) से गहरे "अंडरस्टैंडिंग" (समझ) की ओर यह बदलाव आर्टिफिशियल इंटेलिजेंस (AI) और वीडियो विश्लेषण की दुनिया में एक बड़ी चुनौती है। कंप्यूटर को एक जासूस बनने के लिए सिखाने के लिए, आप उसे सिर्फ एक दुर्घटना दिखाकर यह नहीं कह सकते कि यह "बुरा" है। आपको उसे दृश्य को देखना, समय को ट्रैक करना, कारण और प्रभाव (cause-and-effect) को समझना और फिर एक स्पष्ट कहानी लिखना सिखाना होगा। यह बिल्कुल वही है जो NVIDIA और सांता क्लारा यूनिवर्सिटी के शोधकर्ताओं का नया पेपर करने की कोशिश कर रहा है।

जासूस की नई ट्रेनिंग मैनुअल

यह पेपर एक बिल्कुल नया ट्रेनिंग सेट पेश करता है जिसे TAR (ट्रैफिक एनोमली रीजनिंग) और एक सख्त टेस्ट TAR-Bench कहा जाता है। TAR को एक विशाल, 26 घंटे लंबे "जासूसी बूट कैंप" के रूप में समझें। केवल वीडियो दिखाकर यह पूछने के बजाय कि "क्या कोई दुर्घटना हुई?" (एक साधारण हाँ/ना वाला सवाल), शोधकर्ताओं ने हर एक वीडियो के लिए 10 अलग-अलग प्रकार के प्रश्न वाला एक पाठ्यक्रम तैयार किया है।

ये प्रश्न कठिनाई के तीन स्तरों में विभाजित हैं, जैसे एक सीढ़ी चढ़ना:

  1. प्रश्न उत्तर (Question Answering): बुनियादी बातें। "क्या चांदी की कार ने डबल पीली रेखा पार की?" या "ट्रक का रंग क्या था?"
  2. टेम्पोरल रीजनिंग (Temporal Reasoning): समयरेखा। "कार ने ठीक कब मुड़ना शुरू किया?" या "दुर्घटना से दो सेकंड पहले क्या हुआ था?"
  3. सीन अंडरस्टैंडिंग (Scene Understanding): बड़ी तस्वीर। "पूरे सड़क, मौसम और इमारतों का वर्णन करें," या "उन घटनाओं की श्रृंखला समझाएं जिनके कारण दुर्घटना हुई।"

महत्वपूर्ण बात यह है कि AI द्वारा दिए गए प्रत्येक उत्तर के लिए, उसे एक "चेन-ऑफ-थॉट" (विचारों की श्रृंखला) ट्रेस भी प्रदान करना होगा। यह गणित के टेस्ट पर अपने काम को दिखाने के लिए जासूस से कहने जैसा है। वे केवल यह नहीं कह सकते कि "हाँ, यह एक दुर्घटना थी"; उन्हें लिखना होगा, "मैंने देखा कि कार 00:03 पर बाईं ओर मुड़ी, जिससे वह गलत लेन में आ गई, जिसके कारण 00:07 पर टक्कर हुई।"

बड़ी हैरानी: स्मार्ट होना, जासूस होने के समान नहीं है

शोधकर्ताओं ने इस नए टेस्ट, TAR-Bench पर 11 अलग-अलग AI मॉडल्स (जिनमें कुछ बहुत प्रसिद्ध और शक्तिशाली मॉडल शामिल हैं) का परीक्षण किया। वे देखना चाहते थे कि क्या दुर्घटनाओं को पकड़ने में अच्छे मॉडल उन्हें समझाने में भी अच्छे थे।

परिणाम चौंकाने वाले थे। पेपर सुझाव देता है कि साधारण डिटेक्शन में अच्छा होने का मतलब यह नहीं है कि आप रीजनिंग (तर्क) में भी अच्छे हैं।

  • कुछ मॉडल बहुत ही शानदार ट्रिविया चैंपियंस की तरह थे: वे दुर्घटनाओं के बारे में "हाँ/ना" वाले सवालों के जवाब उच्च सटीकता (80% या 90% से अधिक) के साथ दे सकते थे।
  • लेकिन जब उनसे पूछा गया कि दुर्घटना क्यों हुई या दृश्य का वर्णन करें, तो वे मॉडल बुरी तरह लड़खड़ा गए। उनके स्कोर गिरकर 20% या 30% की सीमा में आ गए।
  • पेपर का तर्क है कि केवल AI को "बड़ा" बनाने से (अधिक कंप्यूटर पावर या डेटा जोड़कर) यह समस्या हल नहीं हुई। एक विशाल मॉडल अपने आप में एक छोटे, अधिक विशिष्ट मॉडल की तुलना में बेहतर रीजनिंग करने में सक्षम नहीं था। यह एक विशाल विश्वकोश होने जैसा है जो तथ्यों को रट सकता है लेकिन एक सुसंगत कहानी नहीं लिख सकता।

मल्टी-टास्क ट्रेनिंग का जादू

तो, एक ऐसे जासूस को कैसे ठीक किया जाए जो मुसीबत को पहचान तो सकता है लेकिन उसे समझा नहीं सकता? पेपर ने पाया कि इसका गुप्त मंत्र मल्टी-टास्क ट्रेनिंग है।

शोधकर्ताओं ने एक AI मॉडल लिया और उसे एक के बजाय एक ही समय में सभी 10 प्रकार के प्रश्नों पर प्रशिक्षित किया। उन्होंने पाया कि जब मॉडल ने एक साथ सरल प्रश्न पूछने, टाइमलाइन समझने और दृश्यों का वर्णन करने का अभ्यास किया, तो वह हर चीज़ में काफी बेहतर हो गया।

  • मॉडल का समग्र स्कोर केवल इन सभी कार्यों को एक साथ सीखने से 21.4 अंक बढ़ गया।
  • इससे भी अधिक आश्चर्यजनक बात यह थी कि मॉडल को केवल "क्वेश्चन आंसरिंग" कार्यों पर प्रशिक्षित करने से उसे "सीन अंडरस्टैंडिंग" कार्यों में बेहतर बनाने में मदद मिली, भले ही उसे कभी भी दृश्य का वर्णन करने के लिए स्पष्ट रूप से नहीं सिखाया गया था। ऐसा लगता है कि एक क्षेत्र में कड़ियों को जोड़ने से सीखना AI को अन्य क्षेत्रों में भी कड़ियों को जोड़ने में मदद करता है।

यह क्यों महत्वपूर्ण है

यह कार्य केवल AI को स्मार्ट बनाने के बारे में नहीं है; यह इसे वास्तविक जीवन के लिए उपयोगी बनाने के बारे में है। यदि किसी ट्रैफिक सिस्टम को केवल यह पता है कि एक दुर्घटना हुई है, तो वह पुलिस को कारण समझने में या इंजीनियरों को सुरक्षित सड़कें डिजाइन करने में मदद नहीं कर सकता। "डिटेक्शन" से "डीप अंडरस्टैंडिंग" की ओर बढ़कर, TAR और TAR-Bench AI को हमारे सड़कों को सुरक्षित रखने में एक सच्चा भागीदार बनाने में मदद कर रहे हैं।

पेपर यह भी नोट करता है कि यह डेटासेट अब AI सिटी चैलेंज 2026 का आधिकारिक प्रशिक्षण मैदान है, जो एक प्रतियोगिता है जहाँ दुनिया भर की टीमें सबसे अच्छा ट्रैफिक-डिटेक्टिंग AI बनाने की कोशिश करेंगी। शोधकर्ता सावधानी बरतते हुए कहते हैं कि हालांकि उनका प्रशिक्षण डेटा विशाल है (44,000 से अधिक उदाहरण), इसे AI द्वारा उत्पन्न किया गया है और फिर मनुष्यों द्वारा जांचा गया है, इसलिए यह पूर्ण नहीं है। हालांकि, परिणाम दृढ़ता से सुझाव देते हैं कि यदि हम चाहते हैं कि AI वास्तव में दुनिया को समझे, तो हमें उससे केवल सरल प्रश्न पूछना बंद करना होगा और उससे पूरी कहानी सुनाने के लिए कहना शुरू करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →