GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids
GridVAD एक ट्रेनिंग-मुक्त, ओपन-सेट वीडियो विसंगति पहचान (anomaly detection) पाइपलाइन है जो स्टेट-ऑफ-द-आर्ट पिक्सेल-लेवल प्रदर्शन प्राप्त करने के लिए डोमेन-विशिष्ट प्रशिक्षण के बिना विजन-लैंग्वेज मॉडल्स को विसंगति प्रस्तावक (anomaly proposers) के रूप में उपयोग करती है, जिसे सेल्फ-कंसिस्टेंसी कंसोलिडेशन द्वारा परिष्कृत और डिटेक्शन-सेगमेंटेशन मॉडल्स द्वारा ग्राउंडेड किया जाता है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, व्यस्त शहर के चौक के सुरक्षा प्रमुख (Head of Security) हैं। आपका काम किसी भी अजीब चीज़ को पकड़ना है—जैसे कोई गलत दिशा में भाग रहा हो, कोई कार फुटपाथ पर गाड़ी चला रही हो, या कहीं लड़ाई हो रही हो।
अतीत में, सुरक्षा प्रणालियाँ प्रशिक्षित कुत्तों की तरह थीं। आपको उन्हें विशेष रूप से यह सिखाना पड़ता था कि "बुरा" क्या दिखता है (जैसे, "कुत्ता भौंकना")। यदि एक बिल्ली बाड़ के ऊपर से कूद जाती, तो कुत्ते को नहीं पता होता कि क्या करना है क्योंकि उसे बिल्लियों के लिए प्रशिक्षित नहीं किया गया था।
फिर, हमें विज़न-लैंग्वेज मॉडल्स (VLMs) मिले। इन्हें सुपर-इंटेलिजेंट, विद्वान लाइब्रेरियन के रूप में सोचें जिन्होंने दुनिया की हर किताब पढ़ी है और हर फिल्म देखी है। वे किसी भी चीज़ का सटीक अंग्रेजी में वर्णन कर सकते हैं। "वह एक दौड़ता हुआ व्यक्ति है," या "वह घास पर चलती हुई कार है।"
समस्या: लाइब्रेरियन बहुत अधिक बातें करता है (और भ्रमित भी होता है)
शोधकर्ताओं ने महसूस किया कि यदि आप लाइब्रेरियन से बस पूछते हैं, "क्या यह एक आपात स्थिति है?" तो वे अक्सर गलत होते हैं।
- क्यों? लाइब्रेरियन ने फुटपाथ पर दौड़ते लोगों के लाखों वीडियो देखे हैं (जो सामान्य है) और फिल्मों में दौड़ते लोगों के लाखों वीडियो देखे हैं (जो एक आपात स्थिति हो सकती है)। उन्हें आपके शहर के चौक के विशिष्ट नियमों का पता नहीं है।
- परिणाम: यदि आप लाइब्रेरियन से हर सेकंड के वीडियो का निर्णय लेने के लिए कहते हैं, तो वे हर बार जब कोई जॉगिंग करता है, या यहाँ तक कि जब कोई छाया हिलती है, तो चिल्लाकर कहेंगे "आपात स्थिति!" वे बहुत अधिक संवेदनशील हैं और ऐसी चीजें बना लेते हैं जो वहां मौजूद ही नहीं हैं (Hallucinations)।
समाधान: GridVAD ("प्रपोज-ग्राउंड-प्रोपैगेट" टीम)
लाइब्रेरियन को जज बनाने के बजाय, लेखकों ने एक नया वर्कफ़्लो बनाया जिसे GridVAD कहा जाता है। उन्होंने इस काम को तीन अलग-अलग भूमिकाओं में विभाजित किया है, जो एक सुव्यवस्थित मशीन की तरह काम करते हैं:
1. लाइब्रेरियन "विचार जनरेटर" (प्रपोजर) बनता है
लाइब्रेरियन से "हाँ/ना" कहने के बजाय, हम उनसे केवल विचारों की सूची बनाने के लिए कहते हैं।
- ट्रिक: वे लाइब्रेरियन को एक-एक सेकंड का वीडियो नहीं दिखाते। यह बहुत अधिक काम और भ्रमित करने वाला है।
- ग्रिड (Grid): वे 10 सेकंड के क्लिप को एक 9-पैनल वाले कॉमिक स्ट्रिप (एक ग्रिड) में काट देते हैं। वे पूरे कॉमिक स्ट्रिप को एक साथ लाइब्रेरियन को दिखाते हैं।
- पूछना: "इस कॉमिक स्ट्रिप को देखें। जो कुछ भी अजीब लग रहा है उसकी एक सूची लिखें, और मुझे बताएं कि वह कब हुआ।"
- लाभ: लाइब्रेरियन अजीब चीजों का वर्णन करने में बहुत अच्छा है ("एक व्यक्ति नो-स्केट ज़ोन में स्केटबोर्डिंग कर रहा है"), लेकिन यह तय करने में बुरा है कि क्या यह वास्तव में एक आपात स्थिति है। इसलिए, हम उन्हें बस सूची लिखने देते हैं।
2. "वास्तविकता की जाँच" (सेल्फ-कंसिस्टेंसी कंसोलिडेशन)
यही असली जादू है। लाइब्रेरियन थोड़ा अस्थिर हो सकता है। यदि आप उनसे एक ही सवाल 5 बार पूछते हैं, तो वे 5 थोड़े अलग उत्तर दे सकते हैं। कभी-कभी वे सही होते हैं; कभी-कभी वे कोई काल्पनिक चीज़ बना लेते हैं।
- रणनीति: सिस्टम लाइब्रेरियन को एक ही वीडियो क्लिप को 5 अलग-अलग बार देखने के लिए कहता है (थोड़े अलग रैंडम फ्रेम्स का उपयोग करके)।
- फ़िल्टर: यदि लाइब्रेरियन 5 में से 4 बार कहता है, "मुझे एक स्केटबोर्डर दिख रहा है!" तो सिस्टम कहता है, "ठीक है, वह शायद वास्तविक है।" यदि वे केवल एक बार कहते हैं, "मुझे एक उड़ता हुआ यूनिकॉर्न दिख रहा है!" तो सिस्टम कहता है, "नहीं, वह केवल एक भ्रम था। उसे अनदेखा करें।"
- उपमा: यह 5 अलग-अलग गवाहों से अपराध का वर्णन करने के लिए पूछने जैसा है। यदि 4 लोग कहते हैं "लाल कार," तो आप उस पर भरोसा करते हैं। यदि एक व्यक्ति कहता है "बैंगनी ड्रैगन," तो आप जानते हैं कि वह मनगढ़ंत बात कर रहा है।
3. "डिटेक्टिव और पेंटब्रश" (ग्राउंडिंग और प्रोपेगेशन)
अब जब हमारे पास अजीब घटनाओं की एक विश्वसनीय सूची है (जैसे, "2:00 से 2:15 तक स्केटबोर्डर"), तो हमें उन्हें स्क्रीन पर ढूंढना है।
- डिटेक्टिव (Grounding DINO): हम उस विवरण ("स्केटबोर्डर") को लेते हैं और एक विशेष डिटेक्टिव मॉडल से पूछते है कि उस वीडियो में स्केटबोर्डर के चारों ओर सटीक बॉक्स ढूंढे।
- पेंटब्रश (SAM2): एक बार जब डिटेक्टिव उस स्केटबोर्डर को एक फ्रेम में ढूंढ लेता है, तो हम एक "स्मार्ट पेंटब्रश" (SAM2) का उपयोग करते हैं जो उस क्षण से पहले और बाद के हर फ्रेम में स्केटबोर्डर के आकार को स्वचालित रूप से ट्रेस करता है। यह एक सटीक, चलता-फिरता मास्क बनाता है जो ठीक उसी व्यक्ति को हाइलाइट करता है जो अजीब हरकत कर रहा है।
यह एक बड़ी बात क्यों है?
- प्रशिक्षण की आवश्यकता नहीं: आपको सिस्टम को "बुरी चीजों" के हजारों वीडियो खिलाकर सिखाने की आवश्यकता नहीं है। यह आउट ऑफ द बॉक्स (Zero-Shot) काम करता है क्योंकि यह लाइब्रेरियन के सामान्य ज्ञान का उपयोग करता है।
- पैसे की बचत: लाइब्रेरियन से हर फ्रेम को देखने के लिए कहने के बजाय (जिसमें बहुत अधिक कंप्यूटर समय और पैसा खर्च होगा), GridVAD केवल एक वीडियो क्लिप के लिए 5 या 6 बार ही पूछता है, चाहे वीडियो कितना भी लंबा क्यों न हो। यह 2.7 गुना अधिक कुशल है।
- बेहतर सटीकता: UCSD Ped2 टेस्ट (एक मानक सुरक्षा वीडियो डेटासेट) पर, इस पद्धति ने किसी भी अन्य विधि की तुलना में बेहतर तरीके से पिक्सेल-लेवल विसंगतियों (anomalies) को खोजा, यहाँ तक कि उन विधियों की भी जो विशेष रूप से उस डेटा पर प्रशिक्षित थीं।
कमी
यह सिस्टम सटीकता (Precision) में बहुत अच्छा है (जब यह कुछ पाता है, तो वह लगभग निश्चित रूप से वास्तविक होता है और पूरी तरह से रेखांकित होता है)। हालाँकि, यदि लाइब्रेरियन ने सबसे पहले ही उनका उल्लेख करने के बारे में नहीं सोचा, तो यह कभी-कभी कुछ चीज़ों को मिस कर देता है। हजारों गलत सूचनाओं के बजाय कुछ सटीक अलर्ट होना बेहतर है।
संक्षेप में: GridVAD AI को "जज" बनाने की कोशिश करना बंद करता है और उसे एक "गवाह" में बदल देता है। यह कई गवाहों के विवरण एकत्र करता है, झूठ बोलने वालों को फ़िल्टर करता है, और फिर वास्तविक उपद्रवियों को खोजने और हाइलाइट करने के लिए एक विशेष टीम भेजता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।