Weakly-Supervised Spatiotemporal Anomaly Detection
本文提出了一种利用视频级标签和多实例排序损失来识别视频片段中局部异常事件的弱监督时空异常检测方法,并在 UCF Crime2Local 数据集上验证了其有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名安保人员,同时监视着数百个监控摄像头。你的任务是发现异常事件,比如斗殴或盗窃。问题在于,你无法 24 小时不间断地盯着每一块屏幕,而且异常事件发生的频率极低。你需要一台计算机来协助,但训练计算机很棘手,因为要为视频的每一秒都标注“此处有斗殴”或“彼处有盗窃”需要耗费漫长时间。
本文提出了一种巧妙的方法,让计算机在无需大量详细标注的情况下学会识别这些异常事件。以下是其工作原理的通俗解释:
“神秘盒子”类比(弱监督)
通常,为了训练计算机,你会给它看一段视频,并说:“看这特定的 5 秒片段?那是斗殴。”但在本文中,研究人员只给计算机提供整段视频,并说:“这段视频中某处包含斗殴,”或者“这段视频完全正常。”
他们称之为弱监督。这就像给一个学生一盒混杂的乐高积木,并说:“这盒子里有一块红色的积木,”却不告诉他们具体哪一块是红色的。学生必须自己找出是哪一块。
“时空立方体”(分解处理)
为了解开这个谜题,研究人员并没有将视频视为一个整体。他们将视频切分成小的三维块。想象一下,先像切面包一样切片(时间),然后将每一片切成网格(空间)。
- 时间: 他们将视频切分成短片段。
- 空间: 他们将每个片段切分成微小的方格网格。
现在,计算机不再观看整个视频,而是观看这些微小的视频“立方体”。每个立方体都是微小的时空片段。
“技巧包”(多示例学习)
研究人员使用了一种称为**多示例学习(MIL)**的策略。可以这样理解:
- 包: 整个视频片段是一个“包”。
- 示例: 视频内部的微小立方体是包里的“物品”。
他们教给计算机的规则如下:
- 如果一个“包”被标记为“正常”,那么该包内的每一个物品都必须是正常的。
- 如果一个“包”被标记为“异常”(怪异),那么该包内至少有一个物品必须是怪异的。
计算机的任务是查看“异常”包中的所有物品,找出看起来最可疑的那一个,并给它打高分。然后,它试图确保“异常”包中的最高分高于“正常”包中的最高分。
“侦探之眼”(工作原理)
计算机使用了一个预训练的“大脑”(称为 I3D),它已经擅长识别人类动作。
- 它接收一段视频片段。
- 它将视频分解为那些微小的三维立方体。
- 它让“大脑”描述在每个立方体中看到了什么。
- 它进行测试,看看是否有任何立方体看起来可疑。
如果计算机看到斗殴,它不会只说“斗殴!”。它会指出屏幕上斗殴正在发生的具体小方格,并说:“怪异之处就在这里。”
结果:表现如何?
研究人员在一个名为UCF Crime2Local的数据集上测试了这种方法,该数据集包含真实世界的犯罪视频。
- 竞争对比: 他们将他们的方法与其他方法进行了比较。另一种方法是“监督式”的,意味着在训练期间它获得了犯罪的确切坐标(就像向学生展示那块红色的积木)。该方法得分约为75%。
- 他们的结果: 他们的方法在训练期间不知道确切位置(就像学生猜测红色积木的位置),得分达到了68%。
虽然他们没有击败拥有所有答案的方法,但他们的表现比那些同样试图在没有答案的情况下进行猜测的其他方法要好得多。
下一步(结论)
该论文得出结论,同时观察事件发生的地点(空间)和时间是一个好主意。然而,他们承认他们的计算机有时会过于兴奋,在只有一个异常点的情况下标记出多个“怪异”位置。
为了变得更好,他们提出了两点建议:
- 收紧规则: 让计算机每段视频只选择一个“最怪异”的位置,而不是到处猜测。
- 观察运动: 目前,计算机主要关注事物的外观。他们建议增加第二只“眼睛”来观察事物的运动(如光流),因为运动通常是发现犯罪的重要线索。
简而言之,他们构建了一个系统,只需知道视频包含犯罪,就能猜出犯罪在视频中的发生位置,而无需人类事先为其绘制边界框。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。