Learning Where and When: Patch-Based Spatiotemporal Localization in Weakly Supervised Video Anomaly Detection
本文介绍了一种用于弱监督视频异常检测的基于补丁的时空框架,该框架通过一种亲近感知选择策略联合学习异常的位置与时间,在实现最先进性能的同时,还发布了新的边界框标注和资源,以推动空间定位研究的发展。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一个繁忙城市广场的 24 小时监控视频。你的任务是找出那些“坏家伙”(异常情况)。
旧方法:“仅限时间”侦探
大多数之前的计算机程序就像只拿着秒表的侦探。它们能告诉你:“嘿,在下午 2:00 到 2:15 之间发生了奇怪的事情!”但它们无法告诉你事情发生在广场的具体哪个位置。是喷泉附近发生了打斗?是面包店发生了偷窃?还是仅仅是一只鸟撞到了窗户?因为它们无法指向具体的地点,所以在现实世界中很难被信任。
新方法:“基于补丁”侦探
这篇论文介绍了一种新系统,它就像一个拿着放大镜和网格地图的侦探。该系统不再将每一帧视频视为一个巨大的模糊整体,而是将每一帧都切割成一个 7x7 的网格(即补丁/小方块)。
把它想象成一个数独棋盘。系统会观察这个棋盘上的每一个小方块,并观察视频中的每一秒,以此来确定哪些小方块是“可疑的”。
如何在没有老师的情况下学习
通常,为了教计算机识别特定的坏人,你需要在一千段视频中用框把他们圈出来(就像老师指着说,“看这里!”)。这既昂贵又缓慢。
这篇论文使用了 弱监督学习(Weak Supervision)。想象一下,你只有一份视频清单,上面写着“这段视频包含一起犯罪”,但你并不知道犯罪具体发生在何时何地。
- 挑战: 如果你不知道该往哪儿看,你该如何找到那个坏人?
- 解决方案: 系统使用了一种称为 多实例学习(Multiple Instance Learning, MIL) 的策略。它会猜测哪些小方块是罪魁祸首。如果一段视频被标记为“坏”,那么这些小方块中至少有一个必须是坏人。系统通过试错法来学习识别它们。
秘诀:“邻近性”规则
作者们注意到了一些类似人类的行为特征:坏事通常不会只发生在某一个微小的、孤立的像素点上,也不仅仅持续一瞬间。它们会发生在一个 集群(Cluster) 中。一场打斗不会只发生在地图上的一个点或某一帧,而是在一段时间内发生在一群人身上。
因此,他们发明了一种 “邻近感知 Top-k” (Proximity-Aware Top-k) 策略。
- 旧方法: “选出 5 个看起来最吓人的方块,即使它们散落在地图各处且时间各异。”
- 新方法: “选出 5 个看起来最吓人的方块,但要确保它们在时间和空间上都是邻居。”
这就像是在说:“不要只寻找最大的噪音,要寻找一组在空间和时间上紧挨在一起的噪音。”这能防止计算机被随机的背景噪声干扰,并帮助它在实际事件周围画出一个清晰、稳固的框。
结果:未来的新地图
作者在四个主要的视频数据集(如 UCF-Crime 和 XD-Violence)上测试了该系统。
- 更高的准确度: 他们的“网格侦探”比以往的方法更准确地找到了坏人,不仅找准了发生的“何时”,也找准了发生的“何地”。
- 新的资源: 由于其中两个数据集缺乏高质量的“何地”数据,作者亲自为测试视频绘制了这些框(标注)。他们正在向公众发布这些新的“地图”(标注)及其代码,以便其他研究人员可以在此基础上进行开发。
总结
这篇论文教会了计算机不再仅仅猜测“何时”发生了奇怪的事情,而是开始精准定位“何地”正在发生,它利用了一种基于网格的方法和一个针对坏事件的“粘连”规则,而且这一切都不需要昂贵的人工手绘训练数据。他们还为社区提供了新的“标准答案”(边界框)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。