Frame-Level Evaluation in Weakly Supervised Video Anomaly Detection Mostly Measures Video-Level Ranking
本文揭示了弱监督视频异常检测中标准的帧级评估指标过度受限于跨视频比较而非视频内的时序排序,从而导致模型仅通过正确对视频进行排序即可获得高分,而无法准确地定位视频内的异常。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机视觉领域,存在着一场持续不断的竞赛,旨在教会机器观察视频流并发现麻烦。想象一下,一个安全摄像头正在扫描繁忙的街道、火车站或工厂车间。目标是让软件能够注意到何时发生了错误——比如发生打斗、人员跌倒或车辆逆行——并精确地指出发生的时间和地点。多年来,研究人员一直使用一种称为“弱监督”的方法来训练这些系统。他们并不是向计算机展示视频中的每一秒并标注事件发生的精确时刻,而只是告诉计算机整个视频是否包含异常情况。这是一种实用的捷径,就像老师告诉学生“这篇文章有一个错误”,却不指出具体是哪一句话。为了测试这些系统是否有效,科学家们使用了一种标准的测试方法,该测试会对数据库中每个视频的每一帧进行排名,从最可疑到最正常进行排序,并检查系统区分好坏时刻的能力。
来自韩国成均馆大学的两名研究人员,宋仁杓(Inpyo Song)和李章元(Jangwon Lee),决定对这项标准测试进行更深入的研究。他们提出了一个简单但深刻的问题:当一台计算机在排名测试中获得高分时,它是真的知道麻烦发生在何时,还是仅仅擅长猜测哪些视频包含麻烦?他们最近发表的一项研究揭示了关于如何评估这些系统的惊人真相。他们发现,这项标准测试过度侧重于不同视频之间的比较,以至于一台计算机可以在从未识别出视频内任何特定危险时刻的情况下,依然获得近乎完美的得分。这就像一名学生通过正确猜出哪些教科书含有错误,从而在历史考试中取得高分,而他甚至从未读过一页书去寻找那个错别字。
研究人员首先拆解了标准排名得分背后的数学逻辑。他们意识到,这个得分是由两种不同类型的比较构建而成的。第一种类型是将一个视频中的一个坏时刻与同一个视频中的一个好时刻进行比较;这是对“真实定位能力”的测试,即检查系统是否能区分同一段录像中的安全时刻与危险时刻。第二种类型是将一个视频中的一个坏时刻与另一个完全不同的视频中的一个好时刻进行比较。这是对“视频级排序能力”的测试,即检查系统是否能分辨出视频 A 比视频 B 更危险。当他们计算这些比较中有多少是在同一个视频内发生时,发现这个数字少得令人震惊。在领域内使用的三个主要数据集里,不到 0.4% 的比较发生在同一视频的帧之间。绝大部分的分数来自于跨视频的帧比较。
这种不平衡导致了作者所称的“时间稀释”(temporal dilution)。随着测试集中视频数量的增加,系统被测试其寻找事件确切时刻的能力的机会迅速缩小。系统主要是在被奖励于将包含异常的视频分配高分,并将不含异常的视频分配低分。为了证明这一点,研究人员进行了一系列受控实验。他们训练了一些简单的计算机模型,这些模型除了根据视频是否被标记为危险或安全来为每一帧分配一个单一且恒定的分数外,不做任何其他事情。这些模型没有区分不同时刻的能力;视频第一秒的分数与最后一秒的分数是完全相同的。尽管这些模型完全没有在时间上定位事件的能力,但它们在标准测试上的得分仍然非常高,根据数据集的不同,得分在 81% 到 97% 之间。
随后,研究人员提取了当前最先进、最复杂的系统的输出,并进行了“视频均值替换”(video-mean replacement)。他们提取了这些复杂系统产生的详细的逐秒得分,并将该视频每一秒的分数都替换为该视频的平均得分。这个过程抹去了所有的细粒度时间信息,只剩下了整体视频评分。如果这项标准测试真正衡量的是寻找异常确切时刻的能力,那么这种改变应该会导致得分大幅下降。然而,得分几乎没有变化。在 72 次受控运行中,有 69 次在剥离所有时间细节后,系统仍保留了原始得分的 90% 以上。其他领先方法的官方发布结果也呈现出同样的模式。即使研究人员打乱了视频内的帧顺序,在保持相同得分集的前提下扰乱时间线,排名性能依然基本保持不变。
研究结果表明,目前的评估标准并非研究人员所认为的衡量指标。在聚合排名测试中获得高分,并不证明系统具备定位事件的能力;它主要证明了系统可以根据整体风险对视频进行排序。研究人员认为,这种区别在实际应用中至关重要。如果保安收到一条视频包含异常的警报,他们需要知道何时去查看,而不只是知道看哪个视频。目前的评估协议奖励了挑选正确视频的能力,却未能验证寻找正确时刻的能力。作者建议,该领域必须改变报告结果的方式。他们建议研究人员应始终报告一个单独的得分,用于衡量系统在单个视频内对帧进行排序的能力,并将其与标准的视频级排名并列报告。他们还建议,未来测试的设计应确保视频数量不会稀释寻找事件确切时刻的重要性。
这项工作并非声称目前的系统是无效的,或者它们无法学会定位事件。它只是表明,它们所使用的计分板并不强制要求它们这样做。近年来看到的各种高分,很大程度上反映了系统对视频进行排序的能力,这种能力虽然有用,但与定位时间的能力截然不同。通过在评估过程中将这两项技能分开,该领域可以确保未来的系统不仅擅长猜测哪些视频是危险的,而且真正能够“观察时钟”,并在事情出错的准确秒数时精准捕捉。前进的道路需要一种转变:不再关注一个掩盖了这些差异的单一聚合数值,而是转向一个将时间的精准度视为与识别事件本身同等重要的清晰图景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。