← 最新论文
💻 computer science

NSP-ML: Normality-Guided and Spatiotemporal Prior-Aware Multimodal Learning for Abnormal Behavior Recognition

本文提出了 NSP-ML,这是一个将视觉数据与受正态性引导及时空先验感知的文本日志相结合的多模态学习框架,旨在显著提升对校园环境中上下文相关异常行为的识别能力,并在 CABRH8 数据集上实现了最先进的性能。

原作者: Haichuan Liu, Xianmin Zhao

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Haichuan Liu, Xianmin Zhao

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名保安,正在观看校园繁忙时刻的实时监控画面。你看到一名学生在走廊里奔跑。这是一种危险信号,还是他只是上课迟到了?如果你看到有人在走廊里哭泣,他们是受伤了,还是仅仅心情不好?

这就是 “NSP-ML” 这篇论文试图解决的问题。

问题所在:眼睛具有欺骗性

目前的多数监控摄像头就像是观察力敏锐但缺乏常识的游客。它们非常擅长描述它们“看到了什么”(例如:“一个人正在奔跑”、“一个人正在哭泣”)。然而,它们很难理解这些行为“为什么重要”。

在真实的校园环境中,一个动作的含义会根据发生的地点时间而发生彻底的变化:

  • 奔跑: 在操场上很正常,但在安静的图书馆里就很可疑。
  • 哭泣: 在心理咨询室里是一种正常的的情绪释放,但在化学实验室里则可能意味着潜在的紧急情况。

现有的系统主要依赖于“视觉证据”(摄像头看到的内容)。由于它们不知道特定时间和地点的“游戏规则”,因此经常会产生混淆。

解决方案:一位“具备上下文感知能力的侦探”

作者提出了一种名为 NSP-ML 的新系统。不要只把它看作是一个摄像头,而要把它看作是一位读过学校规则手册并了解日常日程表的侦探

该系统不仅仅是观察视频,它在做出判断之前会阅读两份特殊的“日志”(文本笔记):

  1. “常态日志”(这里通常会发生什么?): 这就像一本规则手册。它告诉系统:“在图书馆里,人们通常保持安静。”如果视频显示有人在奔跑,系统会因为它违反了“常态”规则而发出警报。
  2. “时空先验日志”(现在的氛围如何?): 这就像一份日常计划表。它告诉系统:“现在是周一早上 8:00,位于科学大楼;这是事故高风险时段。”或者,“现在是周五下午 3:00,位于体育馆;这是一个高能量的时段。”

它是如何工作的:“假设”游戏

该系统并不只是瞎猜。它在玩一场**“如果……会怎样?”**的游戏。

  1. 视觉线索: 它看到一段学生奔跑的视频。
  2. 文本线索: 它阅读了“常态日志”(图书馆 = 安静)和“先验日志”(时间 = 考试周)。
  3. 假设: 它构建了一个心理故事:“如果这是一个正常的图书馆场景,那么奔跑将是一种异常行为。”
  4. 对比: 它将视频与这个故事进行对比。因为视频(奔跑)与故事(安静的图书馆)相冲突,系统正确地识别出这是异常行为

论文引入了一种特殊的“注意力机制”(一种智能过滤器),帮助系统在视觉线索模糊时,加大对这些文本线索的权重。这就像侦探在说:“视频看起来是在奔跑,但上下文环境却在提示‘危险’,所以我决定信任上下文。”

结果:更聪明、更快速

研究人员在名为 CABRH8 的数据集上测试了这个系统,该数据集充满了复杂的校园场景——在这些场景中,动作看起来很相似,但含义却截然不同。

  • 评分: 新系统(特别是“大型”版本)在识别正确行为方面的准确率达到了 81.52%。这优于以往仅观察视频或使用简单文本标签的方法。
  • 效率: 尽管变得更聪明了,但它并不需要超级计算机来运行。实际上,它比一些重型竞争对手运行得更快,且消耗的计算资源更少。
  • 证明: 他们还在通用动作数据集(UCF-101 和 HMDB-51)上测试了它,以观察它是否只是个“只会一招的专才”。它在这些数据集上也表现出色,证明了理解上下文是任何视频分析领域都通用的有用技能。

核心结论

论文声称,通过教 AI 在观察视频的同时阅读“上下文”(规则和时间表),我们可以停止将“为了赶公交车而奔跑的学生”与“为了逃离火灾而奔跑的学生”混为一谈。该系统不仅看到了动作,还理解了动作背后的故事

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →