← नवीनतम पेपर
🤖 AI

CoLoRSMamba: Conditional LoRA-Steered Mamba for Supervised Multimodal Violence Detection

यह शोधपत्र CoLoRSMamba को प्रस्तुत करता है, जो एक दिशात्मक वीडियो-टू-ऑडियो मल्टीमॉडल आर्किटेक्चर है जो विजुअल कॉन्टेक्स्ट के आधार पर AudioMamba के स्टेट-स्पेस पैरामीटर्स को गतिशील रूप से अनुकूलित करने के लिए CLS-गाइडेड कंडीशनल LoRA का लाभ उठाता है, जिससे क्यूरेटेड ऑडियो-फिल्टर्ड NTU-CCTV और DVD डेटासेट्स पर स्टेट-ऑफ-द-आर्ट हिंसा डिटेक्शन सटीकता और दक्षता प्राप्त होती है।

मूल लेखक: Damith Chamalke Senadeera, Dimitrios Kollias, Gregory Slabaugh

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Damith Chamalke Senadeera, Dimitrios Kollias, Gregory Slabaugh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त शहर के चौक का लाइव फीड देख रहे हैं एक सुरक्षा गार्ड (security guard) हैं। आपका काम किसी लड़ाई को तब तक पहचानना है जब तक कि वह हाथ से निकल न जाए।

कभी-कभी, वीडियो धुंधला होता है, लोग दृश्य को रोक रहे होते हैं, या क्रिया इतनी तेजी से होती है कि उसे स्पष्ट रूप से देखना मुश्किल होता है। लेकिन यदि आप ध्यान से सुनें, तो आप एक चीख, एक टक्कर, या एक गोली चलने की आवाज़ सुन सकते हैं जो उस उत्तर को दे सकती है जिसे कैमरे ने मिस कर दिया था।

यह पेपर एक नए AI सिस्टम का परिचय देता है जिसे CoLoRSMamba कहा जाता है, जो एक सुपर-स्मार्ट सुरक्षा गार्ड की तरह काम करता है जो यह जानता है कि वह जो देखता है और जो सुनता है, उनके बीच संतुलन कैसे बनाया जाए।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "शोर भरा भीड़" (The "Noisy Crowd")

वास्तविक जीवन में, वीडियो आमतौर पर सबसे विश्वसनीय सुराग होता है। आप एक मुक्का देख सकते हैं; आप हवा या ट्रैफिक के शोर के ऊपर उसे सुन नहीं सकते। हालाँकि, ऑडियो कभी-कभी झूठ बोल सकता है। कल्पना कीजिए कि पास के लाउडस्पीकर पर एक फिल्म चल रही है। ऑडियो चिल्ला रहा है "हिंसा!" लेकिन वीडियो एक शांतिपूर्ण पार्क दिखाता है। यदि कोई AI ऑडियो पर बहुत अधिक भरोसा करता है, तो वह गलतियाँ करेगा।

अधिकांश पुराने AI सिस्टम या तो:

  • ऑडियो को अनदेखा कर देते थे (केवल वीडियो पर टिके रहते थे)।
  • ऑडियो और वीडियो को समान भागीदार मानते थे (जैसे दो लोग एक-दूसरे पर चिल्ला रहे हों), जिससे भ्रम पैदा हो जाता है जब ऑडियो केवल बैकग्राउंड शोर होता है।

2. समाधान: "कंडक्टर और ऑर्केस्ट्रा" (The "Conductor and the Orchestra")

लेखकों ने एक ऐसा सिस्टम बनाया है जहाँ वीडियो कंडक्टर (Conductor) है और ऑडियो ऑर्केस्ट्रा (Orchestra) है

  • कंडक्टर (वीडियो): AI का वीडियो हिस्सा (VideoMamba) दृश्य को देखता है। वह संदर्भ (context) जानता है: "क्या यह एक भीड़भाड़ वाली सड़क है? क्या कोई दौड़ रहा है?"
  • ऑricheस्ट्रा (ऑडियो): ऑडियो वाला हिस्सा (AudioMiba) आवाजों को सुनता है।
  • जादुई ट्रिक: ऑडियो केवल अपनी राय चिल्लाने के बजाय, वीडियो कंडक्टर के पास एक बैटन (baton) थामता है। हर एक क्षण में, कंडक्टर ऑडियो ऑर्केस्ट्रा को बताता है: "हे, तुमने अभी जो आवाज़ सुनी? वह शायद सिर्फ एक कार का बैकफायर है, इसलिए उसे अनदेखा करो।" या "वह आवाज़? वह एक चीख है, इसलिए इस पर विशेष ध्यान दें!"

इसे Directional Video → Audio डिज़ाइन कहा जाता है। वीडियो नेतृत्व करता है, और ऑडियो उसके नेतृत्व का अनुसरण करता है।

3. सीक्रेट सॉस: "कंडीशनल लोरा-स्टीयरिंग" (Conditional LoRA-Steering)

यह तकनीकी हिस्सा है, लेकिन इसे रेडियो के वॉल्यूम नॉब (volume knobs) को वास्तविक समय में घुमाने की तरह समझें।

आमतौर पर, AI मॉडल में निश्चित "नॉब्स" (पैरामीटर्स) होते हैं जो ध्वनि को प्रोसेस करने का निर्णय लेते हैं। वे एक बार सेट हो जाते हैं और वैसे ही रहते हैं।

  • CoLoRSMamba नियमों को बदल देता है। यह एक विशेष तंत्र (जिसे Conditional LoRA कहा जाता है) का उपयोग करता है जो ऑडियो सिस्टम के नॉब्स को घुमाने के लिए वीडियो कंडक्टर को सक्षम बनाता है।
  • यदि वीडियो एक शांत दृश्य देखता है, तो कंडक्टर ऑडियो संवेदनशीलता (sensitivity) को कम कर देता है ताकि वह तेज़ आवाजों से न डर जाए।
  • यदि वीडियो एक अराजक (chaotic) दृश्य देखता है, तो कंडक्टर ऑडियो संवेदनशीलता को बढ़ा देता है ताकि सूक्ष्म चीखों को पकड़ा जा सके।

यह एक स्मार्ट सहायक की तरह है जो न केवल संगीत सुनता है, बल्कि कमरे में जो हो रहा है उसके आधार पर इक्वलाइज़र (equalizer) सेटिंग्स को भी बदल देता है।

4. "ऑडियो फ़िल्टर" (डेटा की सफाई)

शोधकर्ताओं ने महसूस किया कि इसे निष्पक्ष रूप से टेस्ट करने के लिए, वे ऐसे डेटासेट का उपयोग नहीं कर सकते जहाँ ऑडियो गायब हो या पूरी तरह से असंबंधित हो (जैसे वॉयसओवर वाला वृत्तचित्र/documentary)।

  • उन्होंने हजारों वीडियो को छान डाला और उन सभी क्लिप्स को निकाल दिया जहाँ ऑडियो मौन था, गायब था, या केवल बैकग्राउंड म्यूजिक था।
  • उन्होंने केवल उन्हीं क्लिप्स को रखा जहाँ आवाज़ वास्तव में स्क्रीन पर हो रही घटनाओं से मेल खाती थी। इसने यह सुनिश्चित किया कि वे AI की समझने की क्षमता का परीक्षण कर रहे हैं, न कि केवल अनुमान लगाने की।

5. परिणाम: स्मार्ट और तेज़

जब उन्होंने CoLoRSMamba का परीक्षण किया:

  • इसे अन्य AI मॉडल की तुलना में बेहतर स्कोर मिले जो या तो केवल वीडियो देखते थे या केवल ऑडियो सुनते थे।
  • यह अधिक कुशल था। इसने भारी-भरकम मॉडलों की तुलना में कम "मस्तिष्क कोशिकाओं" (पैरामीटर्स) और कम कंप्यूटिंग पावर के साथ ये उच्च स्कोर प्राप्त किए।
  • इसने गलतियों को सुधारा: कई मामलों में, वीडियो भ्रमित था (जैसे, "क्या यह लड़ाई है या खेल?") लेकिन ऑडियो ने स्पष्टता दी ("वह गोली चलने की आवाज़ है!")। सिस्टम ने वीडियो के भ्रम को दूर करने के लिए ऑडियो का उपयोग किया।

सारांश

CoLoRSMamba एक हिंसा का पता लगाने वाला (violence detection) सिस्टम है जो वीडियो को बॉस और ऑडियो को एक सहायक के रूप में मानता है। ऑडियो को वीडियो पर चिल्लाने देने के बजाय, यह वीडियो को यह तय करने देता है कि ऑडियो को कैसे सुना जाना चाहिए। एक चतुर "नॉब-ट्विस्टिंग" तकनीक का उपयोग करके, यह वास्तविक समय में दृश्य के अनुकूल ढल जाता है, जिससे यह बिना किसी सुपरकंप्यूटर के, शोर भरे वास्तविक वातावरण में लड़ाइयों को पहचानने में अविश्वसनीय रूप से सटीक बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →