Scene-aware Transformer encoder with Multi Instance Learning-guided Attention Mechanism for Anomaly Detection in Video Surveillance
本文提出了 STAM 框架,该框架通过将用于场景感知嵌入的对比学习与由多实例学习注意力引导的 Transformer 编码器相结合,有效解决了视频异常检测中的上下文和时间局限性,并在基准数据集上实现了卓越的准确率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是某个繁忙的大型城市广场的首席安保人员。你有数百个摄像头在向你传输实时视频,但你无法同时盯着每一块屏幕。你的职责是发现异常情况——比如打斗、偷窃,或者有人在错误的方向奔跑。棘手之处在于,“异常”完全取决于你所处的环境。在图书馆里,有人奔跑是一个巨大的警示信号;但在足球场里,这只是比赛的一部分。长期以来,试图完成这项工作的计算机程序就像那些只看“动作”的保安:如果有人跑了起来,警报就会响起,哪怕那是在体育场里。它们并不理解场景的“语境”。它们也难以记住几秒钟前发生了什么,从而无法将碎片信息联系起来。这篇论文通过教计算机不仅要看到动作,还要理解其观察场景的“氛围(vibe)”,来解决这一问题。
研究人员 Rifa Nizam Khan 和 Mohd. Amjad 来自贾米亚米利希亚大学(Jamia Millia Islamia University),他们构建了一个名为 STAM 的新系统。把它想象成一个超级聪明的侦探,它有两种截然不同的思考方式。首先,它使用一个特殊的“场景感知”模块来确定它究竟在哪里——就像知道安静的公园和繁忙的火车站之间的区别一样。其次,它使用一个强大的记忆工具(Transformer)来观看短视频片段,并判断哪些片段是可疑的。神奇之处在于这两个部分是如何进行交流的。该系统不仅仅是孤立地观察一段视频;它会询问:“这个动作在这里合理吗?”如果答案是否定的,它就会拉响警报。
以下是他们这个新侦探的工作原理,分为简单的步骤:
双脑方法
大多数旧系统试图用一个大脑完成所有工作,因此经常产生混乱。STAM 将这项工作进行了拆分。
- 场景侦探: 在观察动作之前,系统会对环境进行快照。它使用一种称为“对比学习”的技术来建立场景的心理地图。想象它就像一个图书管理员,知道书从书架上掉下来在图书馆很正常,但在健身房就很奇怪。系统通过学习来识别场所的“形状”,为每个位置创建一张独特的身份证。
- 动作观察者: 这部分使用了一个“膨胀 3D 卷积网络”(或称 I3D)。如果你把普通的视频相机想象成随时间变化的 2D 照片,那么这个工具就像是一个 3D 扫描仪,将视频视为一个由空间和时间构成的实体块。它捕捉动作和人物的外貌,并将这些转化为详细的报告。
“片段包”游戏
该系统不会一次性观看一整小时的视频。相反,它将视频切成微小的块,称为“片段(snippets)”。它将整个视频视为这些片段组成的一个“包”。这就是“多实例学习(MIL)”发挥作用的地方。把它想象成一位正在给班级评分的老师:如果有一个学生(一个片段)被标记出异常,那么整个班级(整个视频)都会被标记为可疑。系统查看所有的片段,并追问:“哪一个是捣蛋鬼?”
神奇的注意力机制
这是最酷的部分。系统有一个特殊的“场景标记(Scene Token,即 CLS token)”,它持有该位置的身份证。当系统审查“片段包”时,它会利用这个位置 ID 来引导其注意力。这就像一个知道“在这个特定的走廊里,人们通常走得很慢”的保安。如果他看到有人在冲刺,那个人就是他需要关注的对象。系统使用注意力机制来权衡每个片段的重要性。如果一个片段对于该特定场景来说显得很奇怪,系统就会给它一个高分。如果它看起来很奇怪但符合场景(比如在体育场里跑步),系统就会忽略它。
结果:近乎完美的得分
研究人员在著名的犯罪监控视频数据集 UCF Crime 上测试了他们的 ST 门系统,该数据集包含超过 1,900 段真实世界的事件视频,如逮捕、纵火和商店偷窃。他们还在另一个数据集 UCF101 上进行了测试,以观察它是否能处理未见过的环境。
结果令人印象深刻。STAM 系统实现了 99.85% 的准确率和 99.98% 的曲线下面积(AUC)得分。为了直观理解,我们将它与像 “I3D-MIL” 和 “GAN-MIL” 这样得分较低(约 90% 到 96%)的智能系统进行了对比。论文指出,STAM 获胜的原因在于它终于理解了语境。它不仅看到了一个人在奔跑,还看到了一个人在“危险的地方”奔跑。
为什么这很重要
作者发现,通过显式地教授计算机关于场景布局的知识并使用“场景感知”的注意力机制,我们可以大幅减少误报。过去,由于有人在公园里跑步,系统可能会大喊“紧急情况!”,尽管那只是一个慢跑者。然而,STAM 能够分辨两者的区别。这项研究表明,这种方法不仅仅是一个微小的改进,而是朝着让视频监控真正具备处理现实世界复杂性之智能迈出的重要一步。虽然该系统需要更多的计算能力来运行(在他们的特定硬件上,每个训练轮次大约需要 8 分钟),但这种权衡换来的是一个更加可靠、且不太可能“虚报警报”的系统。
简而言之,这篇论文提出:要抓住坏人,你不仅需要能看到动作的眼睛,还需要一个能理解场所故事的大脑。有了 STAM,计算机终于开始理解这个故事了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。