Scene-aware Transformer encoder with Multi Instance Learning-guided Attention Mechanism for Anomaly Detection in Video Surveillance
यह शोध पत्र STAM फ्रेमवर्क का प्रस्ताव करता है, जो वीडियो विसंगति पहचान (video anomaly detection) में प्रासंगिक और अस्थायी सीमाओं को प्रभावी ढंग से संबोधित करने के लिए सीन-अवेयर एम्बेडिंग हेतु कंट्रास्टिव लर्निंग को मल्टी-इंस्टेंस लर्निंग अटेंशन द्वारा निर्देशित एक ट्रांसफार्मर एनकोडर के साथ एकीकृत करता है और बेंचमार्क डेटासेट्स पर बेहतर सटीकता प्राप्त करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हलचल भरे शहर के चौक के मुख्य सुरक्षा गार्ड हैं। आपके पास सैकड़ों कैमरे हैं जो लाइव वीडियो फीड दे रहे हैं, लेकिन आप एक साथ हर एक स्क्रीन को नहीं देख सकते। आपका काम कुछ अजीब पकड़ना है—जैसे कोई लड़ाई, चोरी, या किसी व्यक्ति का गलत दिशा में भागना। पेचीदा बात यह है कि "अजीब" होना इस बात पर निर्भर करता है कि आप कहाँ हैं। एक लाइब्रेरी में, किसी का दौड़ना एक बहुत बड़ा रेड फ्लैग (चेतावनी) है। एक सॉकर स्टेडियम में, यह खेल का एक हिस्सा है। लंबे समय तक, कंप्यूटर प्रोग्राम जो यह काम करने की कोशिश करते थे, वे उन गार्डों की तरह थे जो केवल गति (movement) को देखते थे। यदि कोई दौड़ा, तो अलार्म बज जाता था, भले ही वह एक स्टेडियम में हो। वे दृश्य के संदर्भ (context) को नहीं समझते थे। वे कुछ सेकंड पहले क्या हुआ था, इसे जोड़कर देखने के लिए भी संघर्ष करते थे। यह शोध पत्र इस समस्या को हल करता है और कंप्यूटर को न केवल गति देखना, बल्कि उस स्थान के "वाइब" (vibe) को समझना सिखाता है जिसे वे देख रहे हैं।
शोधकर्ता, जामिया मिलिया इस्लामिया विश्वविद्यालय के रिफा निजाम खान और मोहम्मद अमजद ने STAM नामक एक नया सिस्टम बनाया है। इसे एक सुपर-स्मार्ट जासूस की तरह समझें जिसके सोचने के दो अलग तरीके हैं। पहले, यह एक विशेष "सीन-सेंस" (scene-sense) मॉड्यूल का उपयोग करता है ताकि यह सटीक रूप से जान सके कि यह कहाँ है—जैसे यह जानना कि एक शांत पार्क और एक व्यस्त रेलवे स्टेशन के बीच क्या अंतर है। दूसरा, यह एक शक्तिशाली मेमोरी टूल (एक ट्रांसफॉर्मर) का उपयोग करता है ताकि यह वीडियो के छोटे क्लिप्स को देख सके और यह पता लगा सके कि कौन से संदिग्ध हैं। जादू तब होता है जब ये दोनों हिस्से एक-दूसरे से बात करते हैं। सिस्टम केवल एक क्लिप को अलग से नहीं देखता; यह पूछता है, "क्या यह क्रिया यहाँ के लिए सही है?" यदि उत्तर 'नहीं' है, तो यह अलार्म बजा देता है।
यहाँ बताया गया है कि उनका नया जासूस कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:
दो-मस्तिष्क वाला दृष्टिकोण (The Two-Brain Approach)
अधिकांश पुराने सिस्टम एक ही मस्तिष्क के साथ सब कुछ करने की कोशिश करते थे, जिससे वे अक्सर भ्रमित हो जाते थे। STAM काम को विभाजित करता है।
- सीन डिटेक्टिव (The Scene Detective): एक्शन देखने से पहले, सिस्टम वातावरण का एक स्नैपशॉट लेता है। यह दृश्य का मानसिक मानचित्र बनाने के लिए "कॉन्ट्रास्टिव लर्निंग" (contrastive learning) नामक तकनीक का उपयोग करता है। इसे एक ऐसे लाइब्रेरियन के रूप में कल्पना करें जो जानता है कि लाइब्रेरी में किताब का शेल्फ से गिरना सामान्य है लेकिन जिम में अजीब है। सिस्टम स्थान के "आकार" को पहचानना सीखता है, जिससे हर स्थान के लिए एक अद्वितीय आईडी कार्ड बनता है।
- एक्शन वॉचर (The Action Watcher): यह हिस्सा एक "इन्फ्लेटेड 3D ConvNet" (या I3D) नामक टूल का उपयोग करता है। यदि आप एक सामान्य वीडियो कैमरे को एक 2D फोटो के रूप में कल्पना करें जो समय के साथ बदलती है, तो यह टूल एक 3D स्कैनर की तरह है जो वीडियो को स्थान और समय के एक ठोस ब्लॉक के रूप में देखता है। यह गति और लोगों के रूप को पकड़ता है, और उन्हें एक विस्तृत रिपोर्ट में बदल देता है।
"बैग ऑफ स्निपेट्स" का खेल (The "Bag of Snippets" Game)
सिस्टम एक बार में एक घंटे का वीडियो नहीं देखता। इसके बजाय, यह वीडियो को छोटे टुकड़ों में काट देता है जिन्हें "स्निपेट्स" (snippets) कहा जाता है। यह पूरे वीडियो को इन स्निपेट्स के एक "बैग" की तरह मानता है। यहीं पर "मल्टी-इंस्टेंस लर्निंग" (MIL) काम आती है। इसे एक शिक्षक की तरह समझें जो कक्षा को ग्रेड दे रहा है। यदि एक छात्र (एक स्निपेट) अनियमितताओं के लिए चिह्नित किया जाता है, तो पूरी कक्षा (पूरा वीडियो) को संदिग्ध मान लिया जाता है। सिस्टम सभी स्निपेट्स को देखता है और पूछता है, "इनमें से शरारती कौन है?"
जादुय अटेंशन मैकेनिज्म (The Magic Attention Mechanism)
यह सबसे शानदार हिस्सा है। सिस्टम के पास एक विशेष "सीन टोकन" (CLS टोकन) होता है जो स्थान का आईडी कार्ड रखता है। जब सिस्टम "बैग" के स्निपेट्स की समीक्षा करता है, तो यह अपने ध्यान (attention) को निर्देशित करने के लिए इस स्थान आईडी का उपयोग करता है। यह एक ऐसे सुरक्षा गार्ड की तरह है जो जानता है, "इस विशिष्ट गलियारे में, लोग आमतौर पर धीरे चलते हैं। यदि मैं किसी को दौड़ते हुए देखता हूँ, तो मुझे उस पर ध्यान केंद्रित करने की आवश्यकता है।" सिस्टम प्रत्येक स्निपेट के महत्व को निर्धारित करने के लिए एक अटेंशन मैकेनिज्म का उपयोग करता है। यदि कोई स्निपेट उस विशिष्ट दृश्य के लिए अजीब दिखता है, तो सिस्टम उसे उच्च स्कोर देता है। यदि वह अजीब है लेकिन दृश्य के अनुकूल है (जैसे स्टेडियम में दौड़ना), तो वह उसे अनदेखा कर देता है।
परिणाम: एक लगभग पूर्ण स्कोर (The Results: A Near-Perfect Score)
शोधकर्ताओं ने अपने नए STAM सिस्टम का परीक्षण वास्तविक दुनिया की घटनाओं जैसे गिरफ्तारी, आगजनी और चोरी वाले वीडियो वाले एक प्रसिद्ध डेटासेट, UCF Crime पर किया। उन्होंने एक अन्य डेटासेट, UCF101 पर भी इसका परीक्षण किया ताकि देख सकें कि क्या यह नए, अनदेखे वातावरण को संभाल सकता है।
परिणाम प्रभावशाली थे। STAM सिस्टम ने 99.85% की सटीकता और 99.98% का AUC स्कोर प्राप्त किया। इसे समझने के लिए, उन्होंने इसकी तुलना "I3D-MIL" और "GAN-MIL" जैसे अन्य स्मार्ट सिस्टम से की, जिनका स्कोर काफी कम (लगभग 90% से 96%) था। पेपर सुझाव देता है कि STAM के जीतने का कारण यह है कि यह अंततः संदर्भ (context) को समझता है। यह केवल एक व्यक्ति को दौड़ते हुए नहीं देखता; यह देखता है कि एक व्यक्ति ऐसी जगह दौड़ रहा है जहाँ दौड़ना खतरनाक है।
यह क्यों महत्वपूर्ण है?
लेखकों ने पाया कि कंप्यूटर को दृश्य के लेआउट के बारे में स्पष्ट रूप से सिखाकर और "सीन-अवेयर" अटेंशन मैकेनिज्म का उपयोग करके, वे गलत अलार्म (false alarms) को काफी कम कर सकते हैं। अतीत में, एक सिस्टम किसी के पार्क में दौड़ने के कारण "आपातकाल!" चिल्ला सकता था, भले ही वह केवल एक जॉगर हो। हालाँकि, STAM जानता है कि अंतर क्या है। यह अध्ययन दिखाता है कि यह दृष्टिकोण केवल एक छोटा सा बदलाव नहीं है, बल्कि वीडियो निगरानी को वास्तविक दुनिया की जटिलताओं को संभालने के लिए वास्तव में स्मार्ट बनाने की दिशा में एक महत्वपूर्ण कदम है। हालांकि इस सिस्टम को चलाने के लिए थोड़े अधिक कंप्यूटिंग पावर की आवश्यकता होती है (उनके विशिष्ट हार्डवेयर पर प्रति ट्रेनिंग एपोक लगभग 8 मिनट लगते है), इसके बदले में एक ऐसा सिस्टम मिलता है जो बहुत अधिक विश्वसनीय है और गलत चेतावनी देने की संभावना कम है।
संक्षेप में, यह पेपर प्रस्तावित करता है कि बुरे लोगों को पकड़ने के लिए, आपको केवल गति देखने वाली आँखों की ही नहीं, बल्कि एक ऐसे मस्तिष्क की भी आवश्यकता है जो उस स्थान की कहानी को समझ सके। और STAM के साथ, कंप्यूटर आखिरकार कहानी को समझने लगे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।