Two-Pass Zero-Shot Temporal-Spatial Grounding of Rare Traffic Events in Surveillance Video
यह शोध पत्र एक ज़ीरो-शॉट, नो-फाइन-ट्यूनिंग पाइपलाइन प्रस्तुत करता है जो निगरानी वीडियो में दुर्लभ यातायात दुर्घटनाओं के स्टेट-ऑफ-द-आर्ट टेम्पोरल-स्पेशियल ग्राउंडिंग को प्राप्त करने के लिए एक टू-पास कोर्स-टू-फाइन रणनीति और विशिष्ट विजन-लैंग्वेज मॉडल रोल असाइनमेंट का लाभ उठाता है, जो ACCIDENT@CVPR 2026 बेंचमार्क पर मौजूदा बेसलाइनों से 12.7% बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक व्यस्त शहर के चौक पर हुई एक घटना को सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास केवल एक सिंगल, धुंधली सुरक्षा कैमरा फीड है जो 30 सेकंड लंबी है। आपका काम तीन विशिष्ट चीजों को खोजना है: बिल्कुल कब दुर्घटना हुई, स्क्रीन पर वह बिल्कुल कहाँ हुई, और वह किस तरह की दुर्घटना थी (जैसे, पीछे से टक्कर या साइडस्वैप)।
समस्या क्या है? आप हर वीडियो को देखने के लिए विशेषज्ञों की एक टीम को काम पर नहीं रख सकते और आपको दुर्घटनाओं को पहचानने के लिए वास्तविक क्रैश वीडियो का "अध्ययन" करने की अनुमति नहीं है (क्योंकि गोपनीयता कानून हैं)। आपको इसे केवल "ऑफ-द-शेल्फ" एआई टूल्स का उपयोग करके हल करना होगा जिन्हें विशेष रूप से दुर्घटनाओं के लिए प्रशिक्षित नहीं किया गया है।
यह पेपर इस पहेली को हल करने के लिए दो अलग-अलग प्रकार के एआई "जासूसों" का उपयोग करके एक चतुर, दो-चरणीय रणनीति प्रस्तुत करता है।
समस्या: "वन-शॉट" की गलती
यदि आप एक मानक एआई से पूरे 30 सेकंड के वीडियो को देखने और एक ही बार में दुर्घटना का समय, स्थान और प्रकार बताने के लिए कहते हैं, तो वह अक्सर भ्रमित हो जाता है। यह एक व्यक्ति से पूरी फिल्म देखने और फिर यह बताने जैसा है कि किसी विशिष्ट अभिनेता ने ठीक किस सेकंड में छींका था, साथ ही उसे स्क्रीन पर सटीक स्थान भी बताना है और छींक के प्रकार का नाम भी लेना है। वे शायद सही फिल्म का अनुमान लगा लेंगे, लेकिन समय गलत हो सकता है या वे छींक को खाँसी समझ सकते हैं।
लेखकों ने पाया कि पिछले एआई प्रयास अक्सर बहुत बड़े अंतरों से चूक जाते थे (जैसे यह अनुमान लगाना कि दुर्घटना वास्तव में होने के 21 सेकंड बाद हुई) या दुर्घटना के प्रकार को पूरी तरह से गलत बताते थे।
समाधान: "टू-पास" डिटेक्टिव टीम
लेखकों ने एक पाइपलाइन बनाई है जो दो अलग-अलग प्रकार के एआई मॉडल को एक विशिष्ट क्रम में एक साथ काम करने के लिए उपयोग करती है, जैसे एक वरिष्ठ जासूस और एक विशेषज्ञ।
पास 1: "वाइड-एंगल" स्कैन (सामान्यज्ञ)
सबसे पहले, वे एक शक्तिशाली एआई (Qwen3-VL) का उपयोग वीडियो को धीमी गति (1 फ्रेम प्रति सेकंड) पर देखते हैं।
- उपमा: कल्पना कीजिए कि एक जासूस अपराध स्थल के माध्यम से तेजी से घूम रहा है, पूरे कमरे को देख रहा है। वे अभी हर उंगली के निशान की जांच नहीं कर रहे हैं। उन्हें बस एक "अंतर्ज्ञान" मिल जाता है कि कार्रवाई कहाँ हुई और लगभग कब हुई।
- आउटपुट: यह एआई एक "खुरदरा" (coarse) अनुमान देता है: "दुर्घटना संभवतः 15वें सेकंड के आसपास हुई, स्क्रीन के बीच के पास, और यह एक एकल-कार दुर्घटना लगती है।"
- सुरक्षा जाल: यदि एआई भ्रमित हो जाता है या एपीआई (एआई से इंटरनेट कनेक्शन) विफल हो जाता है, तो सिस्टम के पास सरल भौतिकी नियमों (जैसे कारों की गति को ट्रैक करना) का उपयोग करके एक बैकअप योजना है, ताकि वीडियो कभी खाली न रहे।
पास 2: "ज़ूम-इन" रिफाइनमेंट (विशेषज्ञ)
इसके बाद, सिस्टम उस खुरदरे अनुमान को लेता है और संदिग्ध दुर्घटना समय के आसपास का एक छोटा, हाई-डेफिनिशन "ज़ूम-इन" क्लिप बनाता है।
- उपमा: अब, जासूस आवर्धक लेंस (magnifying glass) पहनता है और उन 6 सेकंड को स्लो मोशन में देखता है। वे प्रभाव के सटीक क्षण और उस सटीक स्थान को देखते हैं जहाँ कारें आपस में टकराई थीं।
- सुरक्षा द्वार: सिस्टम में दो "सुरक्षा जाँच" हैं।
- समय की जाँच: यदि ज़ूम-इन किया गया एआई कहता है, "मैं इस विशिष्ट 6-सेकंड की विंडो में कोई दुर्घटना नहीं देख पा रहा हूँ," या यदि वह एक ऐसा समय बताता है जो विंडो के बिल्कुल किनारे पर है (जिसका अर्थ है कि वह केवल अनुमान लगा रहा है), तो सिस्टम नए अनुमान को अनदेखा कर देता है और पास 1 से मिले मूल "अंतर्ज्ञान" पर टिक जाता है।
- स्थान की जाँच: यदि ज़ूम-इन किया गया एआई स्क्रीन के बिल्कुल किनारे पर कोई बिंदु दिखाता है (जो अक्सर एक गलती होती है), तो सिस्टम उसे अनदेखा कर देता है और पास 1 के मूल स्थान का उपयोग करता है।
दुर्घटना के प्रकारों के लिए "विशेषज्ञ"
अंत में, सिस्टम को एहसास होता है कि पहला एआई दुर्घटना के प्रकार (जैसे, "साइडस्वैप" और "रियर-एंड" के बीच भ्रमित होना) को पहचानने में बहुत अच्छा नहीं है।
- उपमा: इसलिए, वे उस छोटे, ज़ूम-इन किए गए क्लिप को दूसरे, अलग एआई विशेषज्ञ (Gemini 3.1) को सौंप देते हैं जो दुर्घटना के प्रकारों को पहचानने में विशेषज्ञ है। यह विशेषज्ञ केवल दुर्घटना के क्षण को देखता है और कहता है, "यह निश्चित रूप से एक साइडस्वैप है।"
परिणाम: प्रतिस्पर्धा को पछाड़ना
लेखकों ने वास्तविक दुनिया के एक बेंचमार्क पर इस "टू-पास" टीम का परीक्षण किया जिसमें 2,000 से अधिक वास्तविक सीसीटीवी वीडियो शामिल थे।
- स्कोर: उन्होंने 0.539 का स्कोर प्राप्त किया।
- तुलना: यह पिछले सर्वोत्तम प्रयासों (जिन्होंने लगभग 0.412 स्कोर किया था) से काफी बेहतर था और केवल एक एआई मॉडल का उपयोग करने की तुलना में बहुत बेहतर था।
- लागत: सभी 2,000 वीडियो चलाने के लिए पूरी प्रक्रिया की लागत लगभग $20 थी (लगभग 1 सेंट प्रति वीडियो), जिससे यह सिद्ध होता है कि अच्छे परिणाम प्राप्त करने के लिए आपको सुपरकंप्यूटर की आवश्यकता नहीं है।
उन्होंने क्या पाया (विफलता विश्लेषण)
पेपर यह भी स्वीकार करता है कि सिस्टम अभी भी कहाँ संघर्ष करता है, एक ईमानदार जासूस की तरह अपनी सीमाओं की रिपोर्ट करता है:
- देरी का पूर्वाग्रह (Late Bias): एआई का अनुमान लगाने का रुझान होता है कि दुर्घटना वास्तव में होने के थोड़ा बाद (लगभग 1.5 सेकंड बाद) हुई थी। वे अक्सर प्रभाव के क्षण के बजाय मलबे को देखते हैं।
- प्रकारों में भ्रम: सिस्टम "हेड-ऑन" दुर्घटना और "टी-बोन" दुर्घटना, या "साइडस्वैप" और "रियर-एंड" के बीच अंतर करने में अभी भी बुरा है। वे लगभग 40-80% बार इनके बीच भ्रमित हो जाते हैं।
- वीडियो की लंबाई: वीडियो जितना लंबा होगा, एआई के लिए सटीक क्षण खोजना उतना ही कठिन होगा, ठीक वैसे ही जैसे 10 मिनट के बजाय 1 घंटे के ढेर में सुई ढूंढना कठिन होता है।
सारांश
संक्षेप में, यह पेपर दिखाता है कि दुर्लभ यातायात दुर्घटनाओं को खोजने के लिए आपको शून्य से नया एआई प्रशिक्षित करने की आवश्यकता नहीं है। इसके बजाय, आप एक स्मार्ट "टू-पास" रणनीति का उपयोग कर सकते हैं: पहले व्यापक रूप से स्कैन करें, फिर सावधानी से ज़ूम इन करें, और दुर्घटना के प्रकार का नाम देने के लिए एक अलग विशेषज्ञ का उपयोग करें। यह दृष्टिकोण, सरल सुरक्षा जाँचों के साथ मिलकर जो खराब अनुमानों से बचने में मदद करते हैं, इस प्रणाली को पिछले तरीकों की तुलना में बहुत अधिक सटीक बनाता है, और यह सब कम लागत में और गोपनीयता नियमों का सम्मान करते हुए किया जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।