← 最新论文
🤖 AI

CoLoRSMamba: Conditional LoRA-Steered Mamba for Supervised Multimodal Violence Detection

本文提出了 CoLoRSMamba,一种通过 CLS 引导的条件 LoRA 将 VideoMamba 与 AudioMamba 耦合的方向性视频到音频多模态架构,利用视频 CLS 令牌动态调节音频状态空间参数以实现场景感知,并在 NTU-CCTV 和 DVD 数据集上实现了优于现有基线的暴力检测精度与效率。

原作者: Damith Chamalke Senadeera, Dimitrios Kollias, Gregory Slabaugh

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Damith Chamalke Senadeera, Dimitrios Kollias, Gregory Slabaugh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 CoLoRSMamba 的新人工智能系统,它的任务是在监控视频或网络视频中自动识别“暴力行为”

为了让你更容易理解,我们可以把这项技术想象成训练一位“超级安保侦探”

1. 核心挑战:侦探的“眼睛”和“耳朵”

想象一下,这位侦探(AI 模型)正在看一段监控录像。

  • 眼睛(视频):能看到有人跑动、推搡,但有时候画面太模糊、被人群挡住了,或者动作太快看不清。
  • 耳朵(音频):能听到尖叫声、玻璃破碎声或枪声。但在现实世界里,环境很嘈杂,有时候背景里的音乐或风声会干扰判断,甚至让人误以为有暴力发生。

以前的系统通常要么只信眼睛,要么把眼睛和耳朵的信息简单粗暴地混在一起(比如把视频和音频的“特征”直接拼起来),这就像让侦探同时看和听,但大脑处理不过来,或者被噪音带偏了。

2. CoLoRSMamba 的绝招:聪明的“指挥家”

这篇论文提出的 CoLoRSMamba 系统,设计了一个非常巧妙的**“指挥家”机制**。

  • 视频是“总指挥”(语义锚点)
    系统认为,在判断暴力时,画面(视频)通常是最可靠、最核心的证据。所以,它让视频部分(VideoMamba)充当“总指挥”。
  • 音频是“被指挥的乐手”(受控分支)
    音频部分(AudioMamba)就像一位乐手。以前,乐手是独立演奏的,或者只是被动地跟着总指挥的节奏。
  • CoLoRSMamba 的创新(条件性 LoRA steering)
    这个系统发明了一种**“动态指挥棒”**(Conditional LoRA)。
    • 怎么做? 当“总指挥”(视频)看到画面时,它会实时生成一个**“调节信号”**。
    • 调节什么? 它不是简单地告诉乐手“大声点”或“小声点”,而是直接修改乐手的“演奏规则”(即修改音频模型内部生成声音特征的数学参数)。
    • 比喻:如果画面显示“一群人安静地跳舞”,指挥棒就会告诉音频乐手:“别太敏感,把那些像尖叫的噪音过滤掉,因为画面很和平。”如果画面显示“有人推搡但看不清”,指挥棒就会告诉乐手:“竖起耳朵,仔细听有没有打斗声,那可能是关键线索!”

简单来说: 它不是把视频和音频“混”在一起,而是让视频动态地指导音频如何“听”这个世界。这让系统既利用了声音,又不会被噪音带偏。

3. 为什么它这么厉害?

  • 更聪明(方向性):它知道视频比音频更可靠,所以是“视频指挥音频”,而不是反过来。这符合现实逻辑(比如你看到有人打架,听到尖叫声是合理的;但你听到尖叫声,不一定代表有人打架,可能是电影配乐)。
  • 更高效(省资源):以前的方法为了融合信息,需要巨大的计算量(像两个大脑疯狂对话)。CoLoRSMamba 通过这种“微调规则”的方式,用更少的计算资源(参数更少、速度更快)达到了更好的效果。
  • 更公平(数据清洗):作者发现,很多旧数据集里的视频片段其实根本没有声音,或者声音和画面完全对不上(比如画面是打架,声音是背景音乐)。他们专门清洗了数据,只保留那些“画面和声音都真实相关”的片段来训练,这样模型学到的才是真本事。

4. 实际效果如何?

在两个著名的暴力检测数据集(NTU-CCTV 和 DVD)上,这位“超级侦探”表现惊人:

  • 准确率极高:在 NTU-CCTV 数据集上达到了 88.63% 的准确率,在 DVD 数据集上也达到了 75.77%
  • 超越对手:它比之前所有的“只靠眼睛”、“只靠耳朵”或者“简单混合”的模型都要强。
  • 性价比之王:它比那些体型庞大、计算量巨大的模型(像那些几百亿参数的 Transformer 模型)要轻得多,但效果却更好。

5. 总结

CoLoRSMamba 就像给 AI 装上了一双**“会思考的耳朵”**。它不再盲目地听,而是根据眼睛看到的场景,实时调整耳朵的灵敏度。

  • 当画面模糊时,它让耳朵更专注;
  • 当画面很和平但背景很吵时,它让耳朵忽略噪音;
  • 当画面和声音冲突时,它优先相信画面,但保留声音作为辅助线索。

这项技术不仅让暴力检测更准确,也为未来在监控、内容审核等安全关键领域的应用提供了一种既聪明又省电的新思路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →