A VLM Answer Is Not an Anomaly Score: Rank Compression in Training-Free Video Anomaly Detection
本文表明,在利用视觉-语言模型进行无需训练的视频异常检测时,使用一种利用完整答案分布的基于概率的读取方式,通过避免“秩压缩”(即不同的片段分布被压缩为相同的分数),从而显著优于标准的生成答案方法,进而保留了准确评估所需的细粒度排序。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在监控系统静谧的嗡鸣声中,摄像头注视着街角、工厂车间或地铁站,等待着异常情况的发生。几十年来,计算机一直难以识别这些被称为“异常”的麻烦时刻,因为它们稀少、不可预测,且往往在发生之前看起来毫无征兆。传统的系统需要工程师通过喂入成千上万个示例来教导它们什么是犯罪或事故,这个过程既缓慢又僵化。最近,一种被称为“视觉语言模型”的新型人工智能提供了一条不同的路径。这些强大的系统能够通过人类语言的视角来理解其所见的图像。它们不需要针对特定的暴力或盗窃案例进行训练,而是可以被问一个简单的问题:“这里正在发生危险吗?”如果模型回答“是”,系统就会标记该时刻。这听起来是一个直接的解决方案,但一项新的研究表明,我们如何倾听这个答案,与答案本身同样重要。
韩国成均馆大学的研究人员调查了这些模型如何将它们的想法转化为计算机可以用于对事件进行排序的分数。他们发现,使用这些模型的标准方式丢弃了大量有用的信息。当要求一个模型判断一段视频剪辑时,它并不仅仅是从一个列表中挑选出“是”或“否”这一个词。相反,它会为它可能给出的每一个可能的答案计算一个概率。可以将这想象成一个确定性的刻度。模型可能 94% 确定一段剪辑是危险的,而对另一段剪辑则只有 56% 的确定度。在旧方法下,这两段剪辑都会被简单地贴上“是”的标签,计算机会将它们视为完全相同。研究人员发现,这种被称为“秩压缩”(rank compression)的信息丢失,导致系统无法察觉区分“险些发生”与“明确危险”之间的微妙差异。
为了解决这个问题,团队测试了一种不同的方法。他们不再等待模型选择一个单一的词,而是观察模型为每一个可能的答案生成的完整概率分布。他们将这种确定性的整个分布转化为一个精确的单一数值。这种他们称为“概率读出”(probability readout)的方法,使得系统能够识别出 94% 的剪辑比 56% 的剪辑要危险得多,尽管两者都被标记为“是”。当他们在四种不同的大型模型和两个主要的视频异常基准测试中测试这种方法时,结果令人瞩目。新方法在每一项测试中都优于旧方法。在一个数据集中,准确率的提升高达 13 个百分点,而在另一个数据集中,提升接近 19 个百分点。这些增益并非微小的波动,而是持续且显著的,无论使用哪种特定模型或提出哪种类型的问题,结果都是如此。
研究人员还探讨了为什么旧方法经常失败。他们发现,即使给模型一个非常精细的尺度(允许它们从 91 个数字中选择,而不是仅仅两个),模型仍然会将它们的答案压缩成少数几个重复的值。系统最终仍会将许多不同的剪辑视为相同,从而在排名中产生“平局”。新方法完全避免了这个陷阱。通过使用完整的概率分布,系统可以区分视频中的几乎每一个瞬间,从而创建一个平滑、详细的排名,而不是一个充满平局的锯齿状列表。这种区别至关重要,因为在安保领域,能够在极低的误报率下将最危险的时刻排在最前面,才是最重要的。研究表明,这种新方法可以使发现实际危险的数量翻倍,同时保持较低的误报率,有效地在不需要任何新训练或额外计算能力的情况下,使系统变得两倍有用。
团队还进行了检查,以确保这种优势是真实的,而非仅仅是问题措辞或模型解释方式带来的偏差。他们尝试让模型在给出分数之前先描述场景,或者在给出分数后解释其推理过程。在每种情况下,观察完整概率分布的方法始终保持领先。他们甚至测试了更大、更强大的模型是否会缩小这一差距,发现这种优势依然存在,有时甚至有所扩大。唯独当模型被要求在给出分数前先写一段解释时,优势才会缩小,这似乎压缩了其内部的确定性。这表明,解锁这些人工智能系统全部潜力的关键在于我们如何读取它们的输出。
这项工作不仅仅是一个小小的改进,它重新定义了我们在利用人工智能进行安全监测时的一个关键步骤。研究人员证明,模型内部思维过程与最终分数之间的接口并非次要细节,而是系统性能的核心部分。通过仅仅改变读取答案的方式——即观察整个确定性图景,而非仅仅看最终的那个词——工程师可以将同一个原本固定的模型转变为一个更敏锐的检测器。研究结论指出,对于任何构建监控风险系统的人来说,如何解读模型的答案,与模型本身一样重要。它提醒我们,在人工智能的世界里,最强大的信号往往隐藏在那些“似言非言”的细微差别之中,而不仅仅是最终说出的那个词。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。