← أحدث الأبحاث
🤖 AI

CoLoRSMamba: Conditional LoRA-Steered Mamba for Supervised Multimodal Violence Detection

تقدم الورقة البحثية CoLoRSMamba، وهي بنية متعددة الوسائط من نوع (فيديو إلى صوت) اتجاهية تستفيد من تقنية (CLS-guided conditional LoRA) لتكييف معاملات فضاء الحالة لنموذج AudioMamba ديناميكيًا بناءً على السياق البصري، محققةً دقة وكفاءة رائدة في اكتشاف العنف على مجموعات بيانات NTU-CCTV وDVD المنسقة والمفلترة صوتيًا.

المؤلفون الأصليون: Damith Chamalke Senadeera, Dimitrios Kollias, Gregory Slabaugh

نُشر 2026-04-07
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Damith Chamalke Senadeera, Dimitrios Kollias, Gregory Slabaugh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك حارس أمن يراقب بثاً مباشً لساحة مدينة مزدحمة. مهمتك هي رصد أي شجار قبل أن يخرج عن السيطرة.

أحياناً، تكون الصورة ضبابية، أو يحجب الناس الرؤية، أو تحدث الحركة بسرعة كبيرة بحيث يصعب رؤيتها بوضوح. ولكن، إذا أصغيت جيداً، قد تسمع صرخة، أو تحطم شيء ما، أو طلقة نارية، مما يعطيك الإجابة التي فاتتها الكاميرا.

تقدم هذه الورقة نظام ذكاء اصطناعي جديد يسمى CoLoRSMamba، والذي يعمل كحارس أمن فائق الذكاء يعرف تماماً كيف يوازن بين ما يراه وما يسمعه.

إليك تفصيل كيفية عمله، باستخدام تشبيهات بسيطة:

1. المشكلة: "الزحام الضوضائي"

في الحياة الواقعية، عادة ما يكون الفيديو هو الدليل الأكثر موثوقية. يمكنك رؤية لكمة، لكنك لا تستطيع دائماً سماعها وسط الرياح أو حركة المرور. ومع ذلك، يمكن للصوت أحياناً أن يكون مخادعاً. تخيل مشهداً يُعرض فيه فيلم عبر مكبر صوت قريب؛ الصوت يصرخ "عنف!"، لكن الفيديو يظهر حديقة هادئة. إذا وثق الذكاء الاصطناعي في الصوت أكثر من اللازم، فسيقع في الأخطاء.

معظم الأنظمة القديمة للذكاء الاصطناعي كانت إما:

  • تتجاهل الصوت (تكتفي بالاعتماد على الفيديو فقط).
  • تعامل الفيديو والصوت كشريكين متساويين (مثل شخصين يصرخان في وجه بعضهما البعض)، مما يسبب ارتباكاً عندما يكون الصوت مجرد ضوضاء في الخلفية.

2. الحل: "القائد والأوركسترا"

بنى المؤلفون نظاماً يكون فيه الفيديو هو القائد والصوت هو الأوركسترا.

  • القائد (الفيديو): جزء الفيديو في الذكاء الاصطناعي (يسمى VideoMamba) يراقب المشهد. إنه يعرف السياق: "هل هذا شارع مزدحم؟ هل هناك شخص يركض؟"
  • الأوركسترا (الصوت): الجزء الصوتي (يسمى AudioMamba) يستمع للأصوات.
  • الخدعة السحرية: بدلاً من أن يصرخ الصوت برأيه فحسب، يمسك "قائد الفيديو" عصا القيادة. في كل لحظة، يخبر القائدُ الأوركسترا الصوتية: "مهلاً، ذلك الصوت الذي سمعتِه للتو؟ من المرجح أنه مجرد صوت انفجار سيارة، لذا تجاهليه." أو "ذلك الصوت؟ إنها صرخة، لذا انتبهي جيداً!"

يُسمى هذا التصميم "فيديو ← صوت اتجاهي" (Directional Video → Audio). الفيديو هو من يقود، والصوت يتبعه.

3. السر الخفي: "التوجيه الشرطي عبر LoRA" (Conditional LoRA-Steering)

هذا هو الجزء التقني، ولكن فكر فيه كأنه ضبط أزرار التحكم في مستوى الصوت في جهاز راديو في الوقت الفعلي.

عادةً، تمتلك نماذج الذكاء الاصطناعي "أزراراً" ثابتة (بارامترات) تحدد كيفية معالجة الصوت، وتظل هذه الأزرار كما هي بمجرد ضبطها.

  • CoLoRSMamba يغير هذه القواعد. فهو يستخدم آلية خاصة (تسمى Conditional LoRA) تسم تتيح لقائد الفيديو الوصول إلى نظام الصوت ولف أزرار التحكم عليه فوراً.
  • إذا رأى الفيديو مشهداً هادئاً، يقوم القائد بخفض حساسية الصوت حتى لا ينزعج من الضوضاء العالية.
  • إذا رأى الفيديو مشهداً فوضوياً، يقوم القائد برفع حساسية الصوت لالتقاط الصرخات الخافتة.

الأمر يشبه امتلاك مساعد ذكي لا يكتفي بالاستماع للموسيقى فحسب، بل يغير إعدادات "المعادل" (Equalizer) بناءً على ما يراه يحدث في الغرفة.

4. "فلتر الصوت" (تنقية البيانات)

أدرك الباحثون أنه لكي يختبروا النظام بشكل عادل، لا يمكنهم استخدام مجموعات بيانات يكون فيها الصوت مفقوداً أو غير مرتبط بالمشهد تماماً (مثل فيلم وثائقي يحتوي على تعليق صوتي).

  • قاموا بفحص آلاف الفيديوهات واستبعدوا أي مقطع يكون فيه الصوت صامتاً، أو مفقوداً، أو مجرد موسيقى خلفية.
  • احتفظوا فقط بالمقاطع التي يتطابق فيها الصوت فعلياً مع ما يحدث على الشاشة. هذا ضمن أنهم يختبرون قدرة الذكاء الاصطناعي على فهم العلاقة، وليس مجرد التخمين.

5. النتائج: أذكى وأسرع

عندما اختبروا CoLoRSMamba:

  • حصل على درجات أفضل من نماذج الذكاء الاصطناعي الأخرى التي تعتمد على الفيديو فقط أو الصوت فقط.
  • كان أكثر كفاءة. حقق هذه الدرجات العالية باستخدام عدد أقل من "الخلايا العصبية" (البارامترات) وقوة حوسبة أقل من النماذج الضخمة والثقيلة.
  • أصلح الأخطاء: في حالات كثيرة، كان الفيديو مربكاً (مثلاً: "هل هذا شجار أم مجرد لعبة؟")، ولكن الصوت أوضح الأمر ("إنها طلقة نارية!"). استخدم النظام الصوت لتصحيح ارتباك الفيديو.

الملخص

CoLoRSMamba هو نظام للكشف عن العنف يعامل الفيديو كـ "رئيس" والصوت كـ "مساعد مفيد". بدلاً من ترك الصوت يصرخ فوق الفيديو، فإنه يسمح للفيديو بتحديد كيفية سماع الصوت. ومن خلال تقنية "لف الأزرار" الذكية، يتكيف مع المشهد في الوقت الفعلي، مما يجعله دقيقاً للغاية في رصد المشاجرات في البيئات الحقيقية المزدحمة بالضجيج دون الحاجة إلى تشغيله عبر كمبيوتر خارق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →