这篇论文的作者 Mert Onur Cakirooglu、Mehmet Dalkilic 和 Hasan Kurban 表示:“是的,而且我们可以做得超级快。”他们将视频检测视为一种在视频流传输过程中实时进行的“现场解说”,而不是在电影结束后的“期末考试”。他们的这种方法不是将整个视频解码成高清像素(这就像为了检查墨水而把整本书都打印出来),而是直接从压缩文件中读取“运动地图”。他们发现,AI 生成的视频往往具有“骨架式”的运动——过于简单且稀疏——而真实的视频则拥有“丰富”且复杂的运动。通过扫描这些运动地图,他们的系统几乎可以立即识别出伪造视频,且使用的计算能力仅为传统方法的一小部分。
这里有一个神奇的技巧:他们构建了一个两阶段的安全警卫系统。第一位警卫是一个轻量级、超快速的 CPU 扫描器,负责读取运动地图。它非常廉价且迅速,因此可以检查到达的每一个视频。如果运动看起来可疑地简单,这位警卫就会大喊“伪造!”,并立即拦截视频。如果运动看起来非常正常,它就会说“真实!”,并让其通过。但是,如果运动看起来很模糊,或者处于边缘地带怎么办?这时,第二位警卫就会介入。第二位警卫是一个重型、昂贵的 AI 模型,它会真正观察视频的像素以做出最终判断。其精妙之处在于,这个昂贵的警卫只会在那些令人困惑的情况下被调用——大约占 15% 的时间。这意味着该系统节省了大量的能量和时间,其使用的计算能力比用重型模型检查每个视频要少约 7 倍,同时实际上获得了略高的准确度。
论文还证明了一个非常重要的安全规则:由于第一位警卫的分数只会上升(它不会随着看到更多视频而下降),因此他们可以设置一个单一的“停止线”,确保即使他们在提前停止检查时,也不会误将太多真实的视频标记为伪造。这就像一个安检站,只有当你触发了金属探测器或看起来身份不明时,你才会接受全身扫描;如果你看起来非常安全,你就可以直接走过去。他们在数千个视频上进行了测试,发现他们的方法在看完前几秒钟(甚至只是视频的第一“块”内容)后就能识别出伪造视频,而旧方法必须等待整个片段结束。虽然该系统并不完美,如果视频的压缩方式与预期不同,它可能会感到困惑,但它提供了一种捕捉 AI 伪造视频的新方法,这种方法既快速、廉价,又足够聪明,知道何时寻求帮助。
技术摘要:及早检测,极少升级:基于压缩比特流的随时检测 AI 生成视频
1. 问题陈述
目前的 AI 生成视频(AIGV)检测器主要针对离线评估设计,即将完整的视频剪辑解码为像素并进行一次性评分,通常利用沉重的视觉语言模型(VLM)或大型神经网络。然而,现实世界的部署是在线(流式)的,视频以压缩块的形式顺序到达。这种设置对延迟预算和计算约束提出了严格要求,使得在每个传入帧上运行数十亿参数的模型变得不切实际。此外,现有的流式感知方法侧重于目标检测或动作识别,而非合成视频生成;且实时的深度伪造检测器通常依赖于解码后的面部图像,而非压缩比特流本身。