← 最新论文
💻 computer science

Detect Early, Escalate Rarely: Anytime Detection of AI-Generated Video from the Compressed Bitstream

本文通过直接从压缩比特流中分析运动场,将 AI 生成视频检测重新定义为一项流式感知任务,从而在无需新检测器架构的情况下,实现具有校准误报率和可衡量准确度-计算量权衡的随时有效且低计算量的决策。

原作者: Mert Onur Cakiroglu, Mehmet Dalkilic, Hasan Kurban

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Mert Onur Cakiroglu, Mehmet Dalkilic, Hasan Kurban

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一座庞大而混乱的图书馆,人类作者和才华横溢的机器人都在不断地编写书籍。长期以来,图书管理员(即检测器)只能在读完整个故事、一页一页检查字迹是否造假后,才能判断一本书的真实性。但现在,这些机器人的写书速度极快且水平极高,以至于阅读整个故事太耗时间,管理员们快要应接不暇了。这篇论文生活在计算机视觉领域,这是一个让机器学习“看”并理解图像和视频的领域。这里的核心思想是,视频不仅仅是一堆图片的堆砌;它们被压缩成了一份份微小的指令包(称为比特流),告诉计算机如何从一张图片过渡到下一张。就像电影导演使用分镜脚本来规划镜头运动一样,视频编解码器(用于压缩视频的软件)也会记录下一个“运动地图”以节省空间。大问题在于:我们能否仅通过观察这些运动地图,而不观看实际的电影,就能识破一段伪造的视频?

这篇论文的作者 Mert Onur Cakirooglu、Mehmet Dalkilic 和 Hasan Kurban 表示:“是的,而且我们可以做得超级快。”他们将视频检测视为一种在视频流传输过程中实时进行的“现场解说”,而不是在电影结束后的“期末考试”。他们的这种方法不是将整个视频解码成高清像素(这就像为了检查墨水而把整本书都打印出来),而是直接从压缩文件中读取“运动地图”。他们发现,AI 生成的视频往往具有“骨架式”的运动——过于简单且稀疏——而真实的视频则拥有“丰富”且复杂的运动。通过扫描这些运动地图,他们的系统几乎可以立即识别出伪造视频,且使用的计算能力仅为传统方法的一小部分。

这里有一个神奇的技巧:他们构建了一个两阶段的安全警卫系统。第一位警卫是一个轻量级、超快速的 CPU 扫描器,负责读取运动地图。它非常廉价且迅速,因此可以检查到达的每一个视频。如果运动看起来可疑地简单,这位警卫就会大喊“伪造!”,并立即拦截视频。如果运动看起来非常正常,它就会说“真实!”,并让其通过。但是,如果运动看起来很模糊,或者处于边缘地带怎么办?这时,第二位警卫就会介入。第二位警卫是一个重型、昂贵的 AI 模型,它会真正观察视频的像素以做出最终判断。其精妙之处在于,这个昂贵的警卫只会在那些令人困惑的情况下被调用——大约占 15% 的时间。这意味着该系统节省了大量的能量和时间,其使用的计算能力比用重型模型检查每个视频要少约 7 倍,同时实际上获得了略高的准确度。

论文还证明了一个非常重要的安全规则:由于第一位警卫的分数只会上升(它不会随着看到更多视频而下降),因此他们可以设置一个单一的“停止线”,确保即使他们在提前停止检查时,也不会误将太多真实的视频标记为伪造。这就像一个安检站,只有当你触发了金属探测器或看起来身份不明时,你才会接受全身扫描;如果你看起来非常安全,你就可以直接走过去。他们在数千个视频上进行了测试,发现他们的方法在看完前几秒钟(甚至只是视频的第一“块”内容)后就能识别出伪造视频,而旧方法必须等待整个片段结束。虽然该系统并不完美,如果视频的压缩方式与预期不同,它可能会感到困惑,但它提供了一种捕捉 AI 伪造视频的新方法,这种方法既快速、廉价,又足够聪明,知道何时寻求帮助。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →