在现代生活的拥挤空间中——工厂车间、繁忙街道和护理设施——观察危险是一项持续且令人疲惫的任务。摄像头捕捉着无尽的运动流,但人类的双眼无法监控每一帧画面而不漏掉一次跌倒、一场冲突或一次突发的意外。几十年来,科学家们一直试图教计算机自动识别这些罕见且危险的时刻。其中的挑战是独特的:要识别出错误,机器必须首先学会什么是“正确”。由于危险事件稀少且不可预测,研究人员仅利用正常的日常行为来训练他们的系统,希望计算机能如此深刻地理解安全的节奏,以至于任何对该节奏的打破都能引起警觉。
多年来,实现这一目标最可靠的方法是剥离世界的视觉杂乱——衣服、光影、背景——而只关注人体骨架。通过追踪肘部和膝盖等关节的位置,算法可以看见运动的纯粹几何结构。这种方法既保护了隐私,又忽略了干扰,但它也遇到了瓶颈。当研究人员尝试通过向数据添加随机噪声(一种用于帮助计算机学习模式的技术)来教这些系统理解长序列运动时,骨架崩溃了。随机噪声会将肢体扭曲成不可能的角度,违反物理定律并使计算机感到困惑。系统会把精力浪费在学习如何修复“断骨”上,而不是学习如何发现一个跑错方向的人。
格拉茨理工大学和格拉茨医科大学的一个研究小组找到了一种修复这一破碎基础的方法。他们开发了一种名为 STEP 的新方法,它在计算机尝试学习之前充当数据的过滤器。他们不再将关节原始且抖动的坐标直接输入学习系统,而是先将运动转化为一个紧凑的数学空间,在这个空间里,人体解剖学的规则已经内置其中。想象一下,将一段复杂、扭曲的舞蹈简化为几条简单的、平滑的线条,这些线条捕捉了运动的本质而没有晃动。在这个全新的空间里,当研究人员加入必要的随机噪声以辅助计算机学习时,噪声不会破坏骨架。相反,它会轻轻地推动运动,创造出仍然符合物理规律的变化,比如一个人走得稍快一些,或者转弯幅度稍大一些。
这种转变让计算机能够建立起关于正常行为随时间变化的更清晰图像。研究人员在两个主要数据集上测试了他们的系统:一个包含各种场景下真实人物画面的数据集,以及另一个由高度逼真的计算机生成视频及精心标注的异常情况组成的数据集。结果令人瞩目。在合成数据集上,他们的系统正确识别异常行为的概率达到了 90.1%,相比之前的最优方法有了显著飞跃。在真实世界的数据集上,它的表现与现有的最先进系统不相上下,证明了即使在视频画面混乱或摄像角度困难的情况下,它依然有效。
至关重要的是,该系统对其自身的局限性也保持着清醒的认识。用于野外追踪人物的摄像头和软件并不完美;它们有时会丢失对人的追踪,或被阴影和模糊所迷惑。这种新方法包含了一个内置的置信度检查。如果追踪软件不确定某个关节的位置,系统会自动降低该信息的权重,从而防止瞬间的故障被误认为是危险事件。这使得检测器能够应对现实监控中不可避免的误差。
该系统的效率同样令人印象深刻。由于该方法非常精简,它可以在不到一毫秒的时间内处理单帧画面中五十个人的运动。这意味着它可以在标准硬件上实时运行,让计算机能够腾出精力去处理寻找关节这类繁重的工作。研究人员认为,通过专注于运动的几何结构并在学习前清理数据,他们解决了一个困扰该领域多年的根本问题。他们证明了,你不需要看到一个人的脸或衣服就能知道他是否陷入困境;你只需要理解其运动的形状,只要这个形状被允许在不破碎的前提下自由呼吸。
技术摘要:STEP —— 用于人体姿态视频异常检测的基于分数的时序能量模型
问题陈述
基于骨骼的视频异常检测(VAD)旨在仅利用正常训练数据来识别异常行为(如跌倒、暴力)。近期的研究方法利用通过去噪分数匹配(DSM)训练的能量模型(EBM),来对正常人体姿态的概率分布进行建模。然而,将 DSM 直接应用于原始关节坐标会带来两个关键性的失效问题:
- 结构坍塌(Structural Collapse): 向原始关节坐标注入各向同性的高斯噪声会破坏人体的运动学结构(例如,导致骨骼长度变形、破坏对称性)。随着时间窗口(T)的扩大,这一问题会不断加剧,导致模型浪费容量去学习物理上不可能存在的构型,而非有效的运动流形。
- 姿态估计不确定性: 现成的姿态估计器会引入由于遮挡或运动模糊导致的噪声、抖动以及关节缺失。将这些提取出的序列视为地面真值(ground truth),会导致能量景观(energy landscape)围绕追踪失败发生扭曲,从而降低鲁棒性。
方法论
作者提出了 STEP(用于姿态的基于分数的时序能量模型),该框架旨在解决原始坐标 DSM 中固有的结构和不确定性问题。
1. PC 空间密度估计
STEP 不在原始关节坐标空间中建模姿态序列,而是将姿态序列投影到一个紧凑且经过白化处理的主成分(PC)空间中。
- 投影: 序列通过由训练集前 K 个主成分导出的矩阵 WK 进行投影,随后使用特征值矩阵 ΛK 进行白化。
- 白化效应: 这种变换将潜在空间缩放为一个各向同性的超球体。在此空间中注入噪声会沿着学习到的基底轨迹(例如,行走、站立)扰动序列,而不是破坏运动学结构。
- 去噪: 将表示限制在前 K 个主成分内起到了去噪器的作用,过滤了高频关节波动,使模型能够专注于整体运动轨迹。
2. 置信度感知异常评分
为了减轻不可靠姿态估计器的影响,STEP 在训练目标和测试时评分中都集成了一种软置信度权重机制。
- 训练: DSM 损失通过姿态估计器提供的平均关节置信度分数 c(x) 进行重加权。这降低了低置信度序列的权重,防止追踪失败导致学习到的能量景观发生扭曲。
- 推理: 最终的异常得分是多个噪声尺度下标准化能量估计的最大值,并根据序列的置信度分数进行加权。这可以防止低置信度的追踪误差被误判为异常。
3. 架构条件化
作者引入了一个 σ-调制残差 MLP 来取代以往 EBM 框架中使用的标准 MLP。
- 机制: 噪声尺度 σ 不仅仅是作为输入进行拼接,而是通过调制模块(缩放激活值)作为全局条件信号路由到每个隐藏层。
- 优势: 这使得网络能够根据噪声水平动态调整其密度估计,性能始终优于普通的 MLP。
4. 训练与推理
- 目标: 模型使用在均匀分布的噪声尺度 σ∈[σlow,σhigh] 上的多尺度 DSM 目标进行训练(公式 5)。
- 能量估计: 在测试阶段,模型在不同的噪声尺度下评估序列。正常动作落在低能量盆地中,而异常则产生高能量得分。
- 效率: 该框架利用权重的指数移动平均(EMA)来实现稳定的评估,并能实时处理序列(在 GTX 1080 上处理 50 个人员的时间 < 1 ms),其延迟完全由上游的姿态提取过程决定。
核心贡献
- PC 空间密度估计: 本文证明了直接在原始坐标上进行 DSM 会随着时间窗口 T 的扩大而出现性能崩溃。STEP 通过在白化的 PC 空间中运行解决了这一问题,在该空间中注入噪声会产生符合物理规律的变化。
- 置信度感知评分: 引入了一种序列级置信度权重机制,以应对姿态估计的不准确性,通过防止追踪误差触发假阳性,显著提升了 AUROC。
- 架构条件化: 提出了一种 σ-调制残差 MLP,证明了对噪声尺度的显式条件化比标准架构具有更好的密度估计性能。
实验结果
该框架在两个具有挑战性的基准测试集上进行了评估:UBnormal(合成、写实)和 ShanghaiTech(真实世界)。
- UBnormal: STEP 实现了新的最先进水平(SOTA),全测试集 90.1% AUROC(人类相关拆分集为 90.9%)。这比之前的最佳骨骼基方法(SeeKer)实现了 12.2% 的绝对提升,并且显著优于 MULDE(直接的 DSM 基线),后者在 T 增加时会出现性能崩溃。
- ShanghaiTech: STEP 实现了 86.2% AUROC(全集)和 87.7%(HR),达到了或略微超过了 STG-NF 和 SeeKer 的性能。
- 消融实验:
- 去除 PC 空间投影会导致性能随 T 增加而大幅下降(例如,对于原始坐标,从 T=2 时的 80.7% 下降到 T=32 时的 70.6%)。
- 去除置信度权重会导致在使用激进过滤时 UBnormal 性能下降 4.5%,而软权重则保持了鲁棒性。
- σ-调制架构比 vanilla MLP 提供了约 1% 的稳定增益。
- 效率: 该模型处理密集人群时的计算开销极小(延迟 < 1 ms),非常适合实时部署。
意义与主张
本文声称,STEP 通过从根本上解决将基于分数的算法应用于人体姿态数据时的局限性,为基于骨骼的 VAD 建立了新的基准。通过将建模领域从原始坐标转向保留结构的 PC 空间,并结合置信度感知,作者证明了学习长时序鲁棒能量景观的可能性,从而避免了以往方法中出现的性能退化。
作者强调,其方法在实现卓越准确性的同时,保持了基于骨骼检测的隐私保护特性(剥离了像素外观)。他们也承认了在多目标交互或物体操作方面的局限性(即仅靠姿态信息可能不足),并指出重新引入视觉特征会损害仅靠骨骼实现的隐私优势。这项工作定位为一种轻量级的实时解决方案,解决了先前能量方法中固有的“结构坍塌”问题。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。