← 最新论文
💻 computer science

Action Hints: Semantic Typicality and Context Uniqueness for Generalizable Skeleton-based Video Anomaly Detection

本文提出了一种新颖的零样本视频异常检测框架,该框架利用语言引导的语义典型性以及对骨架数据的测试时上下文独特性分析,在无需目标域训练样本的情况下,实现了在多样化监控场景中的最先进泛化能力。

原作者: Canhui Tang, Sanping Zhou, Haoyue Shi, Le Wang

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Canhui Tang, Sanping Zhou, Haoyue Shi, Le Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名安保人员,正在监视一个繁忙城市广场的实时画面。你的任务是发现任何异常事件。

旧方法(“僵化规则手册”问题)
大多数现有的安防系统就像一名只在一个特定公园工作过的警卫。他们死记硬背了人们在该公园中行走、奔跑或坐下的确切方式。

  • 如果有人在公园内正常行走,警卫会说:“一切正常。”
  • 如果有人在拥有不同树木和照明的新公园中行走,警卫就会感到困惑。他们可能会因为阴影看起来不同,而将正常的行走误判为可疑行为。
  • 更糟糕的是,如果有人做了警卫从未见过的事情(例如一种新型舞蹈),警卫可能会忽略它,因为它不符合他们那本狭小、死记硬背的规则手册。

这就是当前视频异常检测的问题:它们过度依赖特定的背景和人物外观,导致在迁移到新地点时失效。

新方案(“智能侦探”)
该论文提出了一种新系统,它像一名智能侦探,能够理解人类行为,而不仅仅是死记硬背特定场景。它利用“骨架”数据(即人物的火柴人轮廓)来忽略背景,专注于动作本身。

这名侦探利用两大“超能力”来发现异常:

1. “常识”图书馆(语义典型性)

想象这名侦探拥有一座由超级人工智能(大型语言模型)撰写的巨型图书馆。

  • 训练过程: 在上岗前,侦探阅读这些书籍,学习人类普遍认为的“正常”与“异常”。
    • 正常: 遛狗、看报纸、洗碗。
    • 异常: 在城市中跳伞、在街道上潜水、斗殴。
  • 工作原理: 当侦探看到火柴人在街道上跳跃时,他们不会仅仅查看像素。他们会询问内部图书馆:“在监控视频中,跳跃是人们通常做的行为吗?”图书馆回答:“不,这很不寻常。”
  • 优势: 由于侦探是从通用的“常识”图书馆中学到这些规则的,因此他们可以在任何新城市中识别异常行为,而不仅仅局限于受训的那个城市。

2. “异类”雷达(上下文独特性)

有时,某个动作本身是正常的(例如骑自行车),但在特定时刻却显得奇怪。

  • 场景: 想象一个滑雪胜地。大家都在滑雪。如果有人在滑雪,那是正常的。但如果有人在所有人都在滑雪时,突然骑着自行车穿过雪地,那就很奇怪了。
  • 工作原理: 侦探观察人群。他们会问:“这个人正在做一件此刻无人正在做的事情吗?”
    • 如果大家都在走路,而一个人在跑步,侦探会发出警报。
    • 如果大家都在滑雪,而一个人在骑自行车,侦探会发出警报。
  • 优势: 这有助于捕捉那些并非“全局”奇怪(例如骑自行车),但在特定上下文中显得奇怪的行为。

综合应用

该系统结合了这两项检查:

  1. 该行为在总体上是否奇怪?(例如,“斗殴”总是奇怪的)。
  2. 该行为对这群特定人群来说是否奇怪?(例如,“骑自行车”在这里很奇怪,因为其他人都在滑雪)。

如果任一问题的答案是“是”,系统就会发出警报。

为何这很重要

  • 隐私友好: 它不需要看到面部或衣物,只需骨架轮廓。这对于无法记录人们身份的场所非常理想。
  • 适应新场景: 它无需使用新的视频素材进行重新训练,即可在新建筑或城市中立即生效。
  • 速度: 与其他试图利用庞大模型“思考”每一帧的巨型 AI 系统相比,它的速度惊人且轻量级。

简而言之: 该系统不再死记硬背特定房间,而是学习人类行为的一般规则,然后监视是否有人违反这些规则,或表现得与周围人群格格不入。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →