← नवीनतम पेपर
🤖 AI

FuseMamba-VD: Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection

यह शोधपत्र FuseMamba-VD का प्रस्ताव करता है, जो एक कुशल द्विशाखीय (dual-branch) VideoMamba आर्किटेक्चर है जिसमें गेटेड क्लास टोकन फ्यूजन का उपयोग किया गया है, जो स्टेट-स्पेस मॉडल बैकबोन के माध्यम से सटीकता और कम्प्यूटेशनल दक्षता को प्रभावी ढंग से संतुलित करके कई बेंचमार्क पर अत्याधुनिक हिंसा पहचान प्रदर्शन प्राप्त करता है।

मूल लेखक: Damith Chamalke Senadeera, Muhammad Awais, Shibo Li, Dimitrios Kollias, Gregory Slabaugh

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Damith Chamalke Senadeera, Muhammad Awais, Shibo Li, Dimitrios Kollias, Gregory Slabaugh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप सुरक्षा कैमरे के फुटेज का उपयोग करके एक भीड़भाड़ वाले शहर के चौक में लड़ाई शुरू होने का पता लगाने की कोशिश कर रहे हैं। यह एक कठिन काम है। यदि आप केवल एक एकल स्नैपशॉट देखते हैं, तो आप दो लोगों को पास खड़े देख सकते हैं, लेकिन आप यह नहीं बता पाएंगे कि वे गले मिल रहे हैं या लड़ रहे हैं। यदि आप विवरणों को देखे बिना केवल हलचल देखते हैं, तो आप उस विशिष्ट इशारे को मिस कर सकते हैं जो एक धक्के को मुक्के में बदल देता है।

यह शोध पत्र FuseMamba-VD नामक एक नया कंप्यूटर प्रोग्राम पेश करता है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। इसे एक अत्यधिक प्रशिक्षित सुरक्षा गार्ड के रूप में समझें जो कैमरों को देखने के लिए एक विशेष "दोहरे मस्तिष्क" वाले दृष्टिकोण का उपयोग करता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. पुराने तरीकों के साथ समस्या

पिछले कंप्यूटर प्रोग्रामों ने यह करने के दो मुख्य तरीके आजमाए, लेकिन दोनों में खामियां थीं:

  • "धीमी" विधि (CNNs): ये हर कुछ सेकंड में एक फोटो लेने जैसे थे। ये विवरण देखने में अच्छे थे लेकिन यह समझने में चूक जाते थे कि लड़ाई कैसे शुरू हुई और कैसे समाप्त हुई।
  • "महंगी" विधि (Transformers): ये एक कहानी को समझने के लिए एक साथ पूरी लाइब्रेरी के हर शब्द को पढ़ने की कोशिश करने जैसे थे। ये बहुत बुद्धिमान थे लेकिन इन्हें चलाने के लिए इतनी अधिक कंप्यूटर शक्ति की आवश्यकता थी कि ये वास्तविक दुनिया के कैमरों पर चलने के लिए धीमे और महंगे थे।

2. नया समाधान: एक दो-सदस्यीय टीम

लेखकों ने एक सिस्टम बनाया है जिसमें एक ही समय में काम करने वाले दो अलग-अलग "मस्तिष्क" (ब्रांच) हैं, जो Mamba (स्टेट-स्पेस मॉडल) नामक एक नई प्रकार की कुशल तकनीक से प्रेरित हैं।

  • मस्तिष्क A (डिटेल डिटेक्टिव - विवरण का जासूस): यह ब्रांच वीडियो को फ्रेम-दर-फ्रेम देखती है, जो स्थानिक विवरणों (spatial details) पर ध्यान केंद्रित करती है। यह पूछता है: "लोग कैसे दिख रहे हैं? क्या उनकी मुट्ठियाँ भिंची हुई हैं? वे कितने करीब हैं?" यह दृश्य के आकार और दिखावट को प्राथमिकता देता है।
  • मस्तिष्क B (मोशन ट्रैकर - गति का ट्रैकर): यह ब्रांच वीडियो को एक निरंतर प्रवाह के रूप में देखती है, जो कालिक गतिशीलता (temporal dynamics) पर ध्यान केंद्रित करती है। यह पूछता है: "वे कैसे हिल रहे हैं? क्या गति बढ़ रही है? क्या अचानक कोई झपट्टा मारा गया है?" यह हलचल और समय को प्राथमिकता देता है।

3. गुप्त नुस्खा: "गेटेड फ्यूजन"

आमतौर पर, आप इन दोनों मस्तिष्कों को आपस में बात करने के लिए अंत तक प्रतीक्षा करते हैं। लेकिन FuseMamba-VD अलग है। यह गेटेड क्लास टोकन फ्यूजन (GCTF) नामक एक तंत्र का उपयोग करता है।

कल्पना करें कि दोनों मस्तिष्क वीडियो देखते समय हर एक कदम पर बातचीत कर रहे हैं।

  • "डिटेल डिटेक्टिव" (मस्तिष्क A) लगातार "मोशन ट्रैकर" (मस्तिष्क B) को सुरागों के रूप में फुसफुसाता है।
  • एक विशेष गेट (एक स्मार्ट स्विच) यह तय करता है कि उस जानकारी में से कितनी जानकारी को किसी भी क्षण अंदर आने दिया जाए। यदि हलचल भ्रमित करने वाली है, तो गेट कह सकता है, "विवरणों को अधिक सुनें।" यदि विवरण धुंधले हैं, तो यह कह सकता है, "गति पर ध्यान केंद्रित करें।"

यह निरंतर, परत-दर-परत बातचीत सिस्टम को अपने नोट्स जोड़ने के लिए अंत तक प्रतीक्षा करने के बजाय, लगातार अपनी समझ को परिष्कृत करने की अनुमति देती है।

4. "क्रॉप" का कमाल

इससे पहले कि मस्तिष्क देखना शुरू करें, सिस्टम में एक क्रॉपिंग मॉड्यूल होता है। इसे एक कैमरा ऑपरेटर के रूप में समझें जो वीडियो में लोगों पर ज़ूम करता है और बैकग्राउंड (जैसे पेड़, कारें, या खाली आसमान) को काट देता है। यह सुनिश्चित करता है कि कंप्यूटर उन चीजों को देखने में ऊर्जा बर्बाद न करे जो लोग नहीं हैं, जिससे यह मानवीय अंतःक्रियाओं को पहचानने में बहुत तेज़ और अधिक सटीक हो जाता है।

5. परिणाम: तेज़ और स्मार्ट

लेखकों ने एक विशाल संग्रह (चार अलग-अलग डेटासेट्स को एक विशाल टेस्ट में मिलाते हुए) और एक नए डेटासेट DVD पर इस नए सिस्टम का परीक्षण किया।

  • सटीकता: इसने सभी पिछले "स्टेट-ऑफ-द-आर्ट" मॉडल को पछाड़ दिया। यह पुराने दिग्गजों की तुलना में हिंसा को पहचानने में बेहतर था।
  • दक्षता: यह बड़ी जीत है। नया मॉडल बहुत हल्का है। यह अपने निकटतम प्रतिद्वंद्वी, CUE-Net, की तुलना में बहुत कम कंप्यूटर शक्ति (FLOPs) का उपयोग करता है और इसमें कम "न्यूरॉन्स" (पैरामीटर्स) हैं।
  • गति: क्योंकि यह इतना कुशल है, यह उच्च-स्तरीय हार्डवेयर पर पिछले सर्वश्रेष्ठ मॉडल की तुलना में लगभग 4.7 गुना तेज़ चलता है।

सारांश

संक्षेप में, FuseMamba-VD एक वीडियो हिंसा डिटेक्टर है जो केवल वीडियो को "देखता" नहीं है; इसमें दो विशेषज्ञ हैं जो एक्शन पर ज़ूम करते समय लगातार एक-दूसरे से बात करते हैं। यह टीमवर्क इसे पहले की तुलना में अधिक सटीकता के साथ लड़ाई को पहचानने में सक्षम बनाता है, जबकि यह बहुत कम कंप्यूटर शक्ति का उपयोग करता है, जिससे यह वास्तविक दुनिया के सुरक्षा कैमरों के लिए एक व्यावहारिक समाधान बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →