Strictly Causal Streaming Video Anomaly Detection with a Theoretically-Grounded State-Space Core
本文介绍了一种基于具有输入依赖型衰减门的理论完备状态空间模型的严格因果、O(1) 流式视频异常检测器,该检测器在边缘硬件上实现了超低延迟,同时证明了其响应性受事件边界而非基础衰减的控制,尽管其目前在较小数据集上的准确率仍落后于非因果基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在监控摄像头镜头的静谧嗡鸣声中,一连串图像正一秒接一秒地源源不断地到来。几十年来,计算机一直难以实时观看这种流媒体,试图寻找那个出错的瞬间——一次跌倒、一场争斗或一次盗窃。挑战不仅在于看到事件,还在于在事件发生的瞬间就能察觉到它,而无需等待回看录像或缓冲一段视频片段稍后进行分析。这就是视频异常检测的领域,在这个领域中,机器必须学会正常行为的节奏,并能立即识别出打破节奏的节拍。传统上,系统依赖于同时观察一组帧,就像通过阅读一个段落来理解一个句子,这会在事件与警报之间产生延迟。但对于安装在机器人或移动设备上的摄像头,由于其处理能力有限,这种延迟太长了,且存储这些视频块所需的内存也太重了。目标是建立一个能够处理每一帧到达的图像、使用极小且固定内存量、并能立即做出反应的系统。
印度理工学院焦杜尔分校(IIT Jodhpur)的研究人员开发了一种新型检测器,旨在满足这一严格要求。该系统并不存储视频剪辑,而是将输入的流视为一种连续的流动,随着每张新图片的接收来更新其内部理解。该系统的核心是一个数学结构,它能记住过去,但会迅速遗忘遥远的过去,除非发生了重要的事情。团队使用仅包含正常活动的视频来训练这个系统,教它根据前后的内容来预测下一帧应该是什么样子。当实际帧到达且与预测不符时,系统就会发出警报。其独特之处在于,这不仅仅是在理论上可行;研究人员从数学上证明了系统的内存设置如何控制其反应速度,并在消费级设备中发现的真实硬件上进行了测试,而非仅仅依靠强大的超级计算机。
他们发明的核心是一个充当内存“守门人”的机制。在正常情况下,系统会保留信息一段时间,以平滑微小的变化。然而,研究人员设计了一个特定的门控,如果传入的图像与系统预期的不符,这个门可以瞬间关闭。当这种情况发生时,系统实际上会在不到一秒的时间内重置其内存,从而几乎立即对异常做出反应。为了了解反应应该有多快,团队推导出了一个将系统内存设置与反应时间联系起来的规则。他们发现,如果系统仅依赖其标准的内存设置,则需要近六十帧才能对突发变化做出完全反应。然而,当他们观察系统运行时,它的反应速度要快得多——有时仅需一两帧。这种差异表明,门控机制承担了主要的任务,在异常出现时覆盖了缓慢的内存设置。
研究人员在两个用于训练监控摄像头的标准数据集上测试了他们的系统:一个以大学校园步道为特色,另一个展示了繁忙的大道。他们在 Apple M3 Pro 芯片(一种现代笔记本电脑中的处理器)上运行了该软件,以测量其在现实世界中的实际运行速度。结果在速度方面令人瞩目。系统处理每一帧的时间不到一毫秒,达到了每秒 1,300 帧以上的速度。这远快于标准视频流的速度,意味着该系统拥有巨大的安全余量,可以轻松运行在性能弱得多的硬件上。然而,系统的准确性并非完美。在初始未调优状态下,它在校园数据集上的正确识别异常率约为 68%,在大道数据集上约为 70%。虽然这低于其他研究中常见的 90% 或更高的分数,但那些研究通常使用在事后查看视频剪辑的方法,或者需要无法在边缘设备上运行的强大显卡。作者谨慎地报告了这些数字,指出该方法是迈向严格实时解决方案的第一步,而非最终的完善产品。
对结果的深入观察揭示了关于系统学习方式的一个令人惊讶的细微差别。研究人员测试了允许瞬时内存重置的特殊“门控”是否始终是有益的。在训练视频较少的较小数据集上,移除门控反而提高了系统的准确性,这表明门控导致系统过度学习了现有的少量样本。但在拥有更多视频的较大数据集上,门控变得至关重要,移除它会导致准确率大幅下降。这表明门控是一个强大的工具,但它需要足够的数据来学习如何正确使用它而不至于产生混乱。团队还测试了系统内部内存的不同大小,并发现,在较小的数据集上,较小的内存效果更好;而在较大的数据集上,较大的内存则略有帮助。这些发现表明,系统的设计并非“一刀切”的方案;其组件与可用数据的量之间存在复杂的相互作用。
研究得出结论,尽管该系统目前还不是最准确的检测器,但它成功弥合了理论与实践之间的关键差距。它证明了一个严格的因果系统——即一个从不预判未来也不缓冲剪辑的系统——可以在消费级硬件上以惊人的速度运行。研究人员承认,他们的工作尚不完整;他们尚未在第三个更大的数据集上测试该系统,也尚未优化系统设置以缩小与旧方法的准确度差距。他们还指出,目前对视频中异常发生位置的评估是一种近似值,更精确的测试需要不同的工具。尽管如此,这项工作为如何构建快速、高效且真正实时的视频理解系统提供了清晰的蓝图,推动该领域从沉重的延迟处理转向一个摄像头能够实时思考并对异常情况做出反应的未来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。