← 最新论文
💻 computer science

FakeI2V-Bench: Benchmarking the Applicability of Image-level Deepfake Detectors for Deepfake Video Detection

该论文介绍了 FakeI2V-Bench,这是一个包含由先进模型生成的近 10 万个视频的综合基准测试,用于评估深度伪造检测器,揭示了图像级检测器的表现可以优于视频级检测器,并提出了 IV-Bridge 框架以显著增强其视频检测能力。

原作者: Pei Li, Sihan Chen, Delong Ran, Tianshuo Cong

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Pei Li, Sihan Chen, Delong Ran, Tianshuo Cong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正漫步在一片数字森林中,那里的树木可以凭空生长,河流可以随一声低语改变流向,而脸部可以像人体模型上的面具一样随意更换。这就是人工智能(AI)视频生成的世界。长期以来,这些“深度伪造”(deepfake)视频很容易被识破,因为它们看起来有点像拙劣的动画片。但现在,AI已经成熟了。它能创造出如此真实的电影,以至于你的眼睛无法分辨真实的人与数字幽灵之间的区别。这是一个巨大的问题。如果我们无法辨别真伪,我们可能会相信假新闻,在法庭上信任虚假证据,或者被骗子所欺骗。为了阻止这一切,科学家们构建了“检测器”——这些是经过训练的数字保安,专门用来捕捉AI留下的微小且肉眼不可见的瑕疵。多年来,这些保安一直致力于识别单张静态图片。但现在,坏人们正在制作动态的电影。一个大问题是:一个专门识别伪造照片的保安,能否胜任守护伪造电影的任务?

这正是研究人员在他们的新论文 FakeI2V-Bench 中试图解决的谜题。他们建立了一个庞大的测试场,一个为AI检测器准备的“健身房”,其中充满了由最新、最强大的AI工具生成的近10万个视频。他们想看看旧的照片检测器是否可以升级以捕捉视频伪造,还是说我们需要全新的保安。

以下是他们的发现:

照片保安在电影院里陷入困境
首先,研究人员测试了标准的照片检测器。这些是那些只见过静态图像的保安。当他们尝试观看视频时,他们感到困惑。这就像要求一个只见过单块砖头的人去评判一座移动的城堡。视频拥有运动、模糊和奇怪的闪烁,而这些都是静态照片所没有的。当这些照片检测器观察视频中的单个帧时,它们的表现显著下降。一些在照片上准确率高达98%的检测器,在视频上的表现跌到了55%左右——基本上就像抛硬币一样靠运气猜测。

“帧到视频”桥梁的魔力
但故事并没有以失败告终。研究人员意识到,虽然单帧画面可能会欺骗照片检测器,但整个视频讲述的是另一个故事。他们尝试了一个聪明的技巧:与其只看一帧,不如让检测器观看整个视频,然后综合所有帧的意见。他们测试了六种不同的结合意见的方式,比如取平均值、最高分或中间值。

令人惊讶的是,这个简单的技巧效果惊人。一个照片检测器在开始“观看”整个视频并结合其想法后,成功率从71%跃升至80%以上。事实上,这个升级后的照片检测器甚至击败了目前最好的专业视频检测器(后者仅达到约79%)。这证明了照片检测器具有巨大的潜力,它们只是需要正确观察动态画面的方式。

超级工具:IV-Bridge
为了让这些照片检测器变得更强,团队构建了一个名为 IV-Bridge 的特殊工具包。可以将其视为一个两步走的训练营:

  1. 视频-帧微调 (VFT): 他们将照片检测器带入了一场专门针对视频帧的速成班。这有助于它们学习动态图像的“语言”,例如当一个人转头时光线是如何变化的。
  2. 多模态聚合 (MMA): 他们不仅仅使用一种方式来结合视频意见。他们使用一个智能计算机程序(随机森林)来倾听六种不同的结合得分的方式,并决定哪种方式对特定视频效果最好。

结果令人赞叹。在使用 IV-Bridge 后,他们测试的12个照片检测器中有11个都变得比最好的仅限视频的检测器更强大。其中的明星检测器 RINE-IV 达到了 93.80% 的成功率,打破了 79.99% 的既往纪录。

为什么这很重要
研究人员还观察了这些检测器需要多少“脑力”。专业的视频检测器就像沉重、昂贵的坦克——速度慢且需要大型计算机。然而,升级后的照片检测器则像是敏捷的摩托车。它们快得多,也轻得多,通常只需几毫秒即可运行,但却更加准确。

简而言之,这篇论文表明,我们并不一定需要为视频世界发明全新的保安。我们可以利用我们现有的优秀照片保安,给它们一点视频训练,并教会它们如何聆听完整的故事。这使得捕捉深度伪造视频变得更快、更便宜、也更有效,为我们的数字世界提供了一道强大的盾牌。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →