← नवीनतम पेपर
💻 computer science

Learning Where and When: Patch-Based Spatiotemporal Localization in Weakly Supervised Video Anomaly Detection

यह शोध पत्र एक पैच-आधारित स्पैटियोटेम्पोरल फ्रेमवर्क प्रस्तुत करता है जो कमजोर रूप से पर्यवेक्षित वीडियो विसंगति का पता लगाने के लिए एक प्रॉक्सिमिटी-अवेयर चयन रणनीति का उपयोग करते हुए विसंगतियों के स्थान और समय को संयुक्त रूप से सीखता है, और स्थानिक रूप से ग्राउंडेड अनुसंधान को आगे बढ़ाने के लिए नए बाउंडिंग-बॉक्स एनोटेशन और संसाधन जारी करते हुए अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Hamza Karim, Nghia Nguyen, Lokman Bekit, Yasin Yilmaz

प्रकाशित 2026-06-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hamza Karim, Nghia Nguyen, Lokman Bekit, Yasin Yilmaz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त शहर के चौक का 24 घंटे का सुरक्षा फीड देख रहे हैं। आपका काम है बुरे लोगों (विसंगतियों/anomalies) को ढूंढना।

पुराना तरीका: "केवल समय" वाला जासूस
अधिकांश पिछले कंप्यूटर प्रोग्राम उन जासूसों की तरह थे जिनके पास केवल एक स्टॉपवॉच थी। वे आपको बता सकते थे, "अरे, दोपहर 2:00 बजे से 2:15 बजे के बीच कुछ अजीब हुआ था!" लेकिन वे यह नहीं बता सकते थे कि चौक में वह कहाँ हुआ था। क्या वह फव्वारे के पास कोई लड़ाई थी? बेकरी में चोरी की कोई घटना थी? या बस एक पक्षी खिड़की से टकरा गया था? क्योंकि वे उस विशिष्ट स्थान की ओर इशारा नहीं कर सकते थे, इसलिए वास्तविक दुनिया में उन पर भरोसा करना कठिन था।

नया तरीका: "पैच-आधारित" जासूस
यह शोध पत्र एक ऐसे नए सिस्टम का परिचय देता है जो मैग्नीफाइंग ग्लास और ग्रिड मैप वाले जासूस की तरह काम करता है। पूरे वीडियो फ्रेम को एक बड़ी धुंधली तस्वीर के रूप में देखने के बजाय, यह सिस्टम हर फ्रेम को 7x7 छोटे वर्गों (पैच) के ग्रिड में काट देता है।

इसे सुडोकू बोर्ड की तरह समझें। सिस्टम वीडियो के हर सेकंड में उस बोर्ड के हर एक छोटे वर्ग को देखता है ताकि यह पता लगा सके कि कौन से वर्ग "संदिग्ध" हैं।

बिना शिक्षक के यह कैसे सीखता है
आमतौर पर, कंप्यूटर को किसी विशिष्ट बुरे व्यक्ति को खोजने के लिए सिखाने के लिए, आपको हजारों वीडियो में उनके चारों ओर एक बॉक्स बनाना पड़ता है (जैसे एक शिक्षक इशारा करते हुए कह रहा हो, "यहाँ देखो!")। यह महंगा और धीमा है।

यह पेपर वीक सुपरविज़न (Weak Supervision) का उपयोग करता है। कल्पना कीजिए कि आपके पास केवल उन वीडियो की एक सूची है जो कहती है, "इस वीडियो में एक अपराध है," लेकिन आप यह नहीं जानते कि वह कब और कहाँ हुआ।

  • चुनौती: यदि आपको पता ही नहीं है कि कहाँ देखना है, तो आप अपराधी को कैसे ढूंढेंगे?
  • समाधान: सिस्टम मल्टीपल इंस्टेंस लर्निंग (MIL) नामक रणनीति का उपयोग करता है। यह अनुमान लगाता है कि कौन से छोटे वर्ग अपराधी हैं। यदि वीडियो को "बुरा" लेबल किया गया है, तो उन छोटे वर्गों में से कम से कम एक को अपराधी होना ही चाहिए। यह परीक्षण और त्रुटि (trial and error) के माध्यम से उन्हें पहचानने के लिए सीखता है।

गुप्त मंत्र: "प्रॉक्सिमिटी" (निकटता) का नियम
लेखकों ने गौर किया कि इंसानों जैसा ही कुछ: बुरी चीजें आमतौर पर केवल एक सेकंड के लिए एक छोटे, अलग-थलग पिक्सेल में नहीं होतीं। वे एक क्लस्टर (समूह) में होती हैं। एक लड़ाई केवल एक स्थान पर एक फ्रेम के लिए नहीं होती; यह कुछ सेकंड के दौरान लोगों के एक समूह के रूप में होती है।

इसलिए, उन्होंने एक "प्रॉक्सिमिटी-अवेयर टॉप-के" (Proximity-Aware Top-k) रणनीति बनाई।

  • पुराना तरीका: "सबसे डरावने दिखने वाले 5 वर्गों को चुनें, भले ही वे मानचित्र पर बिखरे हुए हों और अलग-अलग समय पर हों।"
  • नया तरीका: "सबसे डरावने दिखने वाले 5 वर्गों को चुनें, लेकिन सुनिश्चित करें कि वे समय और स्थान में पड़ोसी हों।"
    यह कहने जैसा है कि, "केवल तेज़ आवाज़ मत खोजो; आवाज़ों के एक समूह को खोजो जो एक-दूसरे के ठीक बगल में हो रही हों।" यह कंप्यूटर को यादृच्छिक बैकग्राउंड शोर से भ्रमित होने से रोकता है और इसे वास्तविक घटना के चारों ओर एक साफ, ठोस बॉक्स बनाने में मदद करता है।

परिणाम: भविष्य के लिए एक नया मानचित्र
लेखकों ने चार प्रमुख वीडियो डेटासेट (जैसे UCF-Crime और XD-Violence) पर इनका परीक्षण किया।

  1. बेहतर सटीकता: उनके "ग्रिड डिटेक्टिव" ने पिछले तरीकों की तुलना में बहुत अधिक सटीकता के साथ बुरे लोगों को खोजा, चाहे वह कब हुए थे या कहाँ थे।
  2. नए संसाधन: चूंकि इन दो डेटासेट के लिए किसी के पास भी अच्छा "कहाँ" (where) डेटा नहीं था, इसलिए लेखकों ने टेस्ट वीडियो के लिए स्वयं बॉक्स (एनोटेशन) बनाए। वे इन नए मानचित्रों (एनोटेशन) और अपने कोड को सार्वजनिक रूप से जारी कर रहे हैं ताकि अन्य शोधकर्ता इस पर आगे बढ़ सकें।

संक्षेप में
यह पेपर कंप्यूटर को केवल यह अनुमान लगाना बंद करने के लिए सिखाता है कि कब कुछ अजीब हुआ है, और इसके बजाय यह शुरू करने के लिए कि वह ठीक कहाँ हो रहा है, एक ग्रिड-आधारित दृष्टिकोण और बुरी घटनाओं के लिए एक "साथ जुड़े रहने" वाले नियम का उपयोग करता है, और वह भी बिना किसी महंगे, हाथ से बने प्रशिक्षण डेटा के। उन्होंने समुदाय के उपयोग के लिए नए "उत्तर कुंजियाँ" (बाउंडिंग बॉक्स) भी प्रदान की हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →