想象你是一名安保人员,正在监视一个繁忙城市广场的实时画面。你的任务是发现任何异常事件。
旧方法(“僵化规则手册”问题)
大多数现有的安防系统就像一名只在一个特定公园工作过的警卫。他们死记硬背了人们在该公园中行走、奔跑或坐下的确切方式。
- 如果有人在公园内正常行走,警卫会说:“一切正常。”
- 如果有人在拥有不同树木和照明的新公园中行走,警卫就会感到困惑。他们可能会因为阴影看起来不同,而将正常的行走误判为可疑行为。
- 更糟糕的是,如果有人做了警卫从未见过的事情(例如一种新型舞蹈),警卫可能会忽略它,因为它不符合他们那本狭小、死记硬背的规则手册。
这就是当前视频异常检测的问题:它们过度依赖特定的背景和人物外观,导致在迁移到新地点时失效。
新方案(“智能侦探”)
该论文提出了一种新系统,它像一名智能侦探,能够理解人类行为,而不仅仅是死记硬背特定场景。它利用“骨架”数据(即人物的火柴人轮廓)来忽略背景,专注于动作本身。
这名侦探利用两大“超能力”来发现异常:
1. “常识”图书馆(语义典型性)
想象这名侦探拥有一座由超级人工智能(大型语言模型)撰写的巨型图书馆。
- 训练过程: 在上岗前,侦探阅读这些书籍,学习人类普遍认为的“正常”与“异常”。
- 正常: 遛狗、看报纸、洗碗。
- 异常: 在城市中跳伞、在街道上潜水、斗殴。
- 工作原理: 当侦探看到火柴人在街道上跳跃时,他们不会仅仅查看像素。他们会询问内部图书馆:“在监控视频中,跳跃是人们通常做的行为吗?”图书馆回答:“不,这很不寻常。”
- 优势: 由于侦探是从通用的“常识”图书馆中学到这些规则的,因此他们可以在任何新城市中识别异常行为,而不仅仅局限于受训的那个城市。
2. “异类”雷达(上下文独特性)
有时,某个动作本身是正常的(例如骑自行车),但在特定时刻却显得奇怪。
- 场景: 想象一个滑雪胜地。大家都在滑雪。如果有人在滑雪,那是正常的。但如果有人在所有人都在滑雪时,突然骑着自行车穿过雪地,那就很奇怪了。
- 工作原理: 侦探观察人群。他们会问:“这个人正在做一件此刻无人正在做的事情吗?”
- 如果大家都在走路,而一个人在跑步,侦探会发出警报。
- 如果大家都在滑雪,而一个人在骑自行车,侦探会发出警报。
- 优势: 这有助于捕捉那些并非“全局”奇怪(例如骑自行车),但在特定上下文中显得奇怪的行为。
综合应用
该系统结合了这两项检查:
- 该行为在总体上是否奇怪?(例如,“斗殴”总是奇怪的)。
- 该行为对这群特定人群来说是否奇怪?(例如,“骑自行车”在这里很奇怪,因为其他人都在滑雪)。
如果任一问题的答案是“是”,系统就会发出警报。
为何这很重要
- 隐私友好: 它不需要看到面部或衣物,只需骨架轮廓。这对于无法记录人们身份的场所非常理想。
- 适应新场景: 它无需使用新的视频素材进行重新训练,即可在新建筑或城市中立即生效。
- 速度: 与其他试图利用庞大模型“思考”每一帧的巨型 AI 系统相比,它的速度惊人且轻量级。
简而言之: 该系统不再死记硬背特定房间,而是学习人类行为的一般规则,然后监视是否有人违反这些规则,或表现得与周围人群格格不入。
以下是论文《Action Hints: Semantic Typicality and Context Uniqueness for Generalizable Skeleton-based Video Anomaly Detection》的详细技术总结。
1. 问题陈述
零样本视频异常检测(ZS-VAD) 旨在无需使用目标域的任何训练数据的情况下,在监控视频中定位异常事件的时间位置。这对于涉及数据隐私或目标数据不可用的新监控部署场景至关重要。
- 当前局限性:
- 基于帧/对象的方法: 在迁移到新场景时,受背景和人像外观的域偏移影响严重。
- 现有的基于骨架的方法: 虽然消除了背景和外观差异,但它们依赖通过自监督学习获得的低级骨架表示(例如坐标预测、重建)。由于缺乏语义理解,它们无法区分那些与正常模式相似的新颖异常。
- 域受限边界: 现有方法盲目依赖由源训练数据定义的正常性边界,导致在新场景中无法识别的未见正常事件被误分类为异常。
2. 方法论
作者提出了一种新颖的框架,利用动作语义典型性和上下文独特性来实现可泛化的 ZS-VAD。该方法包含两个主要模块:
A. 语言引导的典型性建模(训练阶段)
该模块旨在学习动作的高级语义理解,而非低级坐标。
- 骨架 - 文本对齐: 模型使用外部动作识别数据集(Kinetics-400)而非 VAD 特定数据。它利用骨架编码器(Es)和文本编码器(Et)将骨架片段与文本标签对齐,将骨架投影到与语言对齐的语义空间中。
- 典型性知识选择(LLM 蒸馏):
- 提示大型语言模型(LLM)从 400 个动作类别中识别出20 个最典型的正常动作(例如行走、阅读)和20 个最典型的异常动作(例如打架、跳伞)。
- 基于骨架 - 文本相似度,筛选出对应这些选定“典型”类别的高质量骨架片段。
- 典型性分布学习:
- 在选定的典型正常和异常特征上训练一个归一化流(NF)。
- NF 对这些行为的概率分布进行建模。在推理过程中,异常分数(St)源自测试片段在所学“正常”分布下的负对数似然。这使得模型能够基于语义先验而非特定数据集统计信息泛化到新场景。
B. 推理时的上下文独特性分析(推理阶段)
为了处理动作并非严格“典型”的场景(例如,在特定上下文中属于异常的正常动作),模型分析时空上下文。
- 上下文图构建: 对于每个骨架片段,构建两个图:
- 跨人图(Gc): 将当前人与空间中的邻近个体连接起来。
- 自检查图(Gs): 将当前人与其自身在时间上的过去/未来状态连接起来(排除紧邻邻居以避免冗余)。
- 独特性评分: 模型计算查询片段与其在两个图中邻居的特征距离。由于异常是罕见且独特的,较大的距离表明存在异常。独特性分数(Su)是跨人距离和自检查距离的最大值。
- 整体评分: 最终的异常分数是典型性分数(St)和独特性分数(Su)的归一化组合:
Si=σtSit−μt+σuSiu−μu
这结合了语义先验(什么应该是正常/异常)与上下文证据(在此场景中什么实际上是独特的)。
3. 主要贡献
- 新颖框架: 一种基于骨架的 ZS-VAD 框架,超越了低级表示学习,转向语义典型性和上下文独特性。
- 语言引导的典型性模块: 提出了一种将 LLM 关于典型正常/异常行为的知识蒸馏到骨架编码器中的方法,在无需目标域训练的情况下创建可泛化的语义空间。
- 推理时的独特性分析: 提出了一种动态的、场景自适应的边界机制,通过分析个体与时间步之间的时空差异来检测特定上下文的异常。
- 最先进性能: 在四个大规模数据集(ShanghaiTech, UBnormal, NWPU, UCF-Crime)上取得了优越结果,涵盖超过 100 个未见监控场景,性能优于全监督和其他零样本方法。
4. 实验结果
该方法在四个数据集上进行了评估,未使用目标域的任何训练数据:
- 性能: 所提出的方法在所有数据集上均取得了最先进(SOTA) 的结果。
- ShanghaiTech: 84.1% AUC(对比全监督 STG-NF 的 85.9%,但此处为零样本)。
- UBnormal: 74.5% AUC(比零样本基线 STG-NF 显著提升 +5.7%)。
- NWPU: 62.1% AUC(比基线提升 +4.2%)。
- UCF-Crime: 62.7% AUC(比基线提升 +10.8%)。
- 与全监督方法的对比: 值得注意的是,该方法的零样本性能与在目标数据上训练的全监督方法相当,在某些情况下甚至超越了后者。
- 效率: 模型轻量级(约 5.0M 参数),显著小于基于大型视觉 - 语言模型(LVLM)的方法(例如拥有 13B+ 参数的 LAVAD)。推理速度主要受骨架提取主导,而非异常评分逻辑。
5. 意义与影响
- 隐私保护监控: 能够在不收集或训练本地视频数据的情况下在新环境中部署异常检测,解决了关键的隐私问题。
- 泛化能力: 通过从“从数据中学习正常性”转向“从语义概念和上下文中学习正常性”,模型克服了困扰传统 VAD 系统的域差距。
- 实际部署: 该框架计算高效,在推理过程中不需要复杂的多阶段推理或庞大的 LLM,适合现实世界的边缘部署。
- 范式转变: 本文证明,当结合语义先验和上下文分析时,骨架数据是零样本异常检测的高效模态,在跨场景设置中优于基于帧和基于对象的方法。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。