← नवीनतम पेपर
💻 computer science

Action Hints: Semantic Typicality and Context Uniqueness for Generalizable Skeleton-based Video Anomaly Detection

यह शोध पत्र एक नवीन ज़ीरो-शॉट वीडियो विसंगति पहचान (zero-shot video anomaly detection) ढांचे का प्रस्ताव करता है जो विविध निगरानी दृश्यों में अत्याधुनिक सामान्यीकरण प्राप्त करने के लिए, बिना किसी लक्ष्य डोमेन प्रशिक्षण नमूनों की आवश्यकता के, कंकाल डेटा (skeleton data) पर भाषा-निर्देशित अर्थ संबंधी विशिष्टता (language-guided semantic typicality) और परीक्षण-समय संदर्भ विशिष्टता विश्लेषण (test-time context uniqueness analysis) का लाभ उठाता है।

मूल लेखक: Canhui Tang, Sanping Zhou, Haoyue Shi, Le Wang

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Canhui Tang, Sanping Zhou, Haoyue Shi, Le Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुरक्षा गार्ड हैं जो एक व्यस्त शहर के चौक का लाइव फीड देख रहे हैं। आपका काम कुछ भी अजीब होते हुए देखना है।

पुराना तरीका (द "कठोर नियम पुस्तिका" की समस्या)
वर्तमान सुरक्षा प्रणालियाँ उस गार्ड की तरह हैं जिसने केवल एक विशिष्ट पार्क में ही काम किया है। उन्होंने याद कर लिया है कि उस विशेष पार्क में लोग कैसे चलते हैं, दौड़ते हैं या बैठते हैं।

  • यदि कोई व्यक्ति उस पार्क में सामान्य रूप से चलता है, तो गार्ड कहता है, "सब ठीक है।"
  • यदि कोई व्यक्ति एक नए पार्क में चलता है जहाँ पेड़ और रोशनी अलग है, तो गार्ड भ्रमित हो जाता है। उन्हें लग सकता है कि एक सामान्य चाल संदिग्ध है क्योंकि छाया (shadows) अलग दिख रही है।
  • इससे भी बुरा यह है कि यदि कोई व्यक्ति कुछ ऐसा करता है जो गार्ड ने पहले कभी नहीं देखा (जैसे कि एक नया प्रकार का डांस), तो वे उसे मिस कर सकते हैं क्योंकि वह उनकी छोटी, रटी-रटाई नियम पुस्तिका में फिट नहीं बैठता।

यह वर्तमान वीडियो विसंगति पहचान (video anomaly detection) की समस्या है: वे लोगों के विशिष्ट बैकग्राउंड और दिखावट पर बहुत अधिक निर्भर करते हैं, जिससे नए स्थान पर जाने पर वे विफल हो जाते हैं।

नया समाधान (द "स्मार्ट डिटेक्टिव")
प्रस्तावित प्रणाली एक स्मार्ट डिटेक्टिव की तरह काम करती है जो केवल एक विशिष्ट दृश्य को याद करने के बजाय मानवीय व्यवहार को समझता है। यह "कंकाल" (skeleton) डेटा (केवल लोगों के स्टिक-फिगर आउटलाइन) का उपयोग करता है ताकि बैकग्राउंड को अनदेखा किया जा सके और केवल गति (movement) पर ध्यान केंद्रित किया जा सके।

डिटेक्टिव गड़बड़ी का पता लगाने के लिए दो मुख्य शक्तियों का उपयोग करता है:

1. "कॉमन सेंस" लाइब्रेरी (सिमेंटिक टिपिकैलिटी)

कल्पना कीजिए कि डिटेक्टिव के पास एक विशाल लाइब्रेरी है जिसमें एक सुपर-स्मार्ट AI द्वारा लिखी गई किताबें हैं।

  • ट्रेनिंग: ड्यूटी पर जाने से पहले, डिटेक्टिव ये किताबें पढ़ता है ताकि यह सीख सके कि मनुष्य सामान्य रूप से क्या "सामान्य" और क्या "असामान्य" मानते हैं।
    • सामान्य: कुत्ता टहलाना, अखबार पढ़ना, बर्तन धोना।
    • असामान्य: शहर में स्काईडाइविंग करना, सड़क पर स्कूबा डाइविंग करना, लड़ाई करना।
  • यह कैसे काम करता है: जब डिटेक्टिव सड़क पर कूदते हुए एक स्टिक-फिगर को देखता है, तो वे केवल पिक्सेल नहीं देखते। वे अपनी आंतरिक लाइब्रेरी से पूछते हैं: "क्या कूदना एक सामान्य चीज़ है जो लोग निगरानी वीडियो में करते हैं?" लाइब्रेरी कहती है: "नहीं, यह असामान्य है।"
  • लाभ: क्योंकि डिटेक्टिव ने इन नियमों को एक सामान्य "कॉमन सेंस" लाइब्रेरी से सीखा है, वे किसी भी नए शहर में अजीब व्यवहार को पहचान सकते हैं, न कि केवल उसी एक शहर को जहाँ उन्हें प्रशिक्षित किया गया था।

2. "ऑड वन आउट" रडार (कॉन्टेक्स्ट यूनिकनेस)

कभी-कभी, एक क्रिया सामान्य होती है (जैसे साइकिल चलाना), लेकिन वह इस विशिष्ट क्षण के लिए अजीब होती है।

  • परिदृश्य: कल्पना कीजिए कि एक स्की रिसॉर्ट है। हर कोई स्कीइंग कर रहा है। यदि एक व्यक्ति स्कीइंग कर रहा है, तो वह सामान्य है। लेकिन यदि अचानक एक व्यक्ति बर्फ के बीच साइकिल चलाने लगे जबकि बाकी सब स्कीइंग कर रहे हैं, तो यह अजीब है।
  • यह कैसे काम करता है: डिटेक्टिव भीड़ को देखता है। वे पूछते हैं: "क्या यह व्यक्ति कुछ ऐसा कर रहा है जो इस समय कोई और नहीं कर रहा है?"
    • यदि सभी चल रहे हैं, और एक व्यक्ति दौड़ रहा है, तो डिटेक्टिव इसे फ्लैग करता है।
    • यदि सभी स्कीइंग कर रहे हैं, और एक व्यक्ति साइकिल चला रहा है, तो डिटेक्टिव इसे फ्लैग करता है।
  • लाभ: यह उन चीजों को पकड़ने में मदद करता है जो "ग्लोबली" अजीब नहीं हैं (जैसे साइकिल चलाना) लेकिन इस विशिष्ट संदर्भ (context) में अजीब हैं।

सबको एक साथ जोड़ना

यह प्रणाली इन दोनों जांचों को मिलाती है:

  1. क्या यह क्रिया सामान्य रूप से अजीब है? (जैसे: "लड़ाई करना" हमेशा अजीब होता है)।
  2. क्या यह क्रिया इस विशिष्ट भीड़ के लिए अजीब है? (जैसे: "साइकिल चलाना" यहाँ अजीब है क्योंकि बाकी सब स्कीइंग कर रहे हैं)।

यदि इन दोनों में से किसी का भी उत्तर "हाँ" है, तो सिस्टम अलार्म बजा देता है।

यह क्यों महत्वपूर्ण है

  • गोपनीयता के अनुकूल: इसे चेहरों या कपड़ों को देखने की आवश्यकता नहीं है, केवल कंकाल के आउटलाइन की आवश्यकता है। यह उन स्थानों के लिए बहुत अच्छा है जहाँ आप लोगों की पहचान रिकॉर्ड नहीं कर सकते।
  • नए दृश्य: यह बिना किसी नए वीडियो फुटेज के पुन: प्रशिक्षित (re-train) हुए तुरंत एक नई इमारत या शहर में काम करता है।
  • गति: अन्य विशाल AI सिस्टमों की तुलना में जो हर फ्रेम के माध्यम से "सोचने" के लिए विशाल मॉडल का उपयोग करते हैं, यह आश्चर्यजनक रूप से तेज़ और हल्का है।

संक्षेप में: एक विशिष्ट कमरे को याद करने के बजाय, यह प्रणाली मानवीय व्यवहार के सामान्य नियमों को सीखती है और फिर उन नियमों को तोड़ने वाले या अपने आस-पास की भीड़ के मुकाबले अजीब व्यवहार करने वाले किसी भी व्यक्ति पर नज़र रखती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →