← 最新论文
💻 computer science

Hybrid 3D-CNN, Bi-LSTM, and Transformer-Based Framework for Anomaly Detection of Human Behaviour in Video Surveillance with Adaptive Error Minimization

本文提出了一种新型混合深度学习框架,该框架集成了 3D-CNN、Bi-LSTM 和 Transformer 架构,并结合自适应阈值模块与多目标损失优化,旨在通过显著降低不同环境条件下的误报率,实现视频监控中达到最先进水平的实时异常检测。

原作者: Sameera yasam, Syed Ali Hussain, Vijaya Kumar Koppula

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Sameera yasam, Syed Ali Hussain, Vijaya Kumar Koppula

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,监控摄像头注视着我们的街道、车站和建筑,产生了人类团队无法可能实时监测的海量视觉数据。安全系统的挑战不仅在于“看见”,更在于实时“理解”所看到的内容。它们必须能够区分平凡、无害的动作与罕见且危险的事件,例如斗殴爆发或盗窃正在进行。这项任务极其困难,因为“正常”行为会随着时间、光照、人群密度和摄像机角度的变化而不断改变。一个过于敏感的系统会对每一道阴影或一阵突如其来的阵风发出警报,从而产生大量的虚假警报,使人类操作员精疲力竭;相反,一个过于严格的系统则可能会完全错过真正的威胁。多年来,研究人员一直试图构建能够学习区分平凡与危险的计算机程序,但大多数现有解决方案在处理这两类风险时难以平衡,在视频质量下降或场景变得混乱时往往表现不佳。

来自印度 SR 大学和 Koneru Lakshmaiah 教育基金会的一组研究人员提出了一种新方法来解决这一持久问题。他们设计了一个混合计算机系统,模拟人类大脑不同部分处理场景的方式,将三种不同类型的人工智能结合到一个单一的协作框架中。该系统并非依赖单一的方法来观看视频,而是使用三个并行的专业化“观察者”。第一个观察者旨在捕捉局部细节和短促的运动,就像注意到一个快速的手势或突然的一步。第二个观察者专注于随时间变化的事件序列,理解一个动作是如何开始、演变并结束的,从而确保暂停或动作的反转被识别为具有重要意义。第三个观察者则将整个场景作为一个整体来看待,连接视频中相距较远的部分,以理解更广泛的语境,例如一群人以异常模式共同移动。

这个新框架的精妙之处在于这三个观察者如何协同工作。系统并没有强迫它们就单一僵化的规则达成一致,而是学会了动态地权衡它们的意见。如果场景是一个人群密集的街道,整体的人流流动最为重要,系统就会更多地听取“全局”观察者的意见。如果场景涉及特定的快速动作,它则会倾向于“局部”观察者。这种灵活性使系统能够适应不同的环境,而无需为每个新地点重新编程。此外,研究人员还解决了视频质量变化的问题,例如夜间拍摄的颗粒感或雨天的模糊感。他们构建了一个反馈机制,不断检查图像的清晰度。如果视频变得模糊或充满噪声,系统会自动提高对何种情况算作报警的标准,从而防止其因图像质量差而“虚报”。如果图像非常清晰,它就会变得更加敏感,准备捕捉最细微的麻烦迹象。

当研究人员在三个主要的现实世界监控录像集上测试该系统时,结果令人瞩目。该系统成功地以极高的准确度识别了异常情况,显著超越了现有的最佳方法。在最具挑战性的数据集上(该数据集包含超过一千小时涵盖十三种犯罪类型的未剪辑视频),新系统的成功率接近百分之九十。在一个具有详细逐帧标签的校园数据集上,它达到了近百分之九十八的准确率。或许对现实世界安防而言最重要的一点是,该系统大幅减少了虚假报警的数量。与之前的顶尖技术相比,它将误报率降低了近百分之四十,这意味着保安人员被无害事件干扰的次数大大减少。同时,它也漏掉了更少的实际威胁,将漏报率降低了超过百分之三十。

该系统还证明了能够实时运行的能力,处理视频的速度为每秒三十二帧,足以跟上实时监控流的速度。研究人员证实,这种进步来自于所有三个组件协同工作的结合;移除其中任何一个都会导致系统性能明显下降。他们还验证了处理视频质量的自适应机制是减少误差的关键,因为它使系统即使在光照变化或相机抖动时也能保持可靠。虽然该系统在处理一段短视频时需要一个短暂的时刻,从而引入了不到一秒的延迟,但这种权衡被认为是对于获得巨大准确性和可靠性而言是可以接受的。

这项工作代表了使自动化监控真正具备实用性的重要一步。通过从僵化的、一刀切的规则转向灵活的多视角方法,研究人员创造了一个既对危险敏感,又对现实世界视频中不可避免的缺陷具有鲁棒性的系统。研究结果表明,视频安全的未来不在于构建一个单一、完美的观察者,而在于创造一个由专业观察者组成的团队,让他们能够相互学习并随着世界的变化而进行调整。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →