Advancing Reliable Synthetic Video Detection: Insights from the SAFE Challenge
本文介绍了在 ICCV 2025 上进行的合成视频检测方法全面评估 SAFE 挑战赛,该挑战赛利用包含 6,000 个视频的大规模数据集揭示:尽管跨生成器的泛化能力有所提升,但当前的检测模型仍易受常见后处理操作的影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:任何人只需按下按钮,就能生成一段在视觉、动态和声音上都与真实生活毫无二致的视频。这就像拥有一支魔法画笔,它不仅能作画,还能让画作活过来。虽然这对创造力而言令人惊叹,但对真相而言却是一场噩梦。你如何判断一段政客发表惊人言论的视频是真实的,还是极具说服力的伪造品?
本文介绍了一场名为"SAFE 挑战赛”的“竞赛”,旨在测试我们当前的“伪造检测器”在识别这些数字伪造品方面的能力。这就像是一场高风险的“找不同”游戏,而其中的差异肉眼根本无法察觉。
以下是事件经过、实施方法以及发现结果的简要梳理。
设置:盲测
通常,当科学家测试新的检测器时,会先给它们一份“伪造”和“真实”的清单供其研究。这就像让品酒师在品尝葡萄酒前先闻一闻葡萄。本文认为,现实世界并非如此运作。在现实世界中,你拿到一段视频,必须立即做出判断:这是真的还是假的? 你无法窥探其源代码。
因此,组织者构建了一项盲测:
- 参赛者:来自大学和公司的 12 支专家团队。
- 秘密配方:组织者将“测试视频”锁在保险库中。参赛者仅能看到一小部分公开样本用于练习。他们必须将自己的“检测器”(计算机程序)提交给组织者的服务器。
- 规则:组织者将参赛者的程序与秘密视频进行比对。参赛者从未见过秘密视频,组织者也从未见过参赛者的代码。这是一场真正的“黑盒”测试。
两项挑战
比赛分为两个层级,难度逐级递增:
第一级:新鲜伪造品
参赛者需要识别由 13 种不同类型的现代 AI 生成器(如最新的文本转视频工具)创建的视频。这些视频 pristine(完好无损),直接来自 AI,未经任何编辑。
- 类比:想象试图在真苹果旁边分辨出一个完美的塑料苹果。它们看起来几乎一模一样,但塑料苹果没有任何微小的瑕疵。
第二级:“清洗”后的伪造品
这才是真正的难点。参赛者需要识别相同的伪造视频,但在它们经过像真实网络内容那样的处理之后。组织者对它们进行了 14 种不同的“清洗”流程:
- 缩小尺寸(降采样)。
- 使其模糊(运动模糊)。
- 压缩(就像上传到社交媒体时那样)。
- 甚至将视频在屏幕上播放,并用手机摄像头录制(一种“数字 - 模拟 - 数字”循环)。
- 类比:想象将那个完美的塑料苹果揉皱,放进袋子里摇晃,然后问:“这仍然是塑料做的吗?”目的是检测器在伪造品看起来杂乱无章且充满现实感时,是否仍能识破它。
结果:好消息与坏消息
好消息:我们在识别新鲜伪造品方面取得了进步。
在第一级(完好无损的视频)中,顶尖团队的表现令人难以置信。他们能够以极高的准确率区分真假。事实证明,尽管 AI 在伪造方面越来越擅长,但我们的检测器在发现 AI 留下的微小、无形的“瑕疵”方面也变得越来越强。
- 关键点:检测器在识别它们从未见过的伪造品方面表现得出奇地好。有一支团队仅用一种类型的 AI 生成器训练了他们的检测器,结果它在另外 12 种类型上依然表现优异。这就像通过观察一款模型学会识别假劳力士,然后仅凭手表的整体“感觉”就能识别出假百达翡丽或欧米茄。
坏消息:“清洗”过程会破坏检测器。
在第二级中,性能显著下降。一旦视频被压缩、调整大小或从屏幕录制,检测器就会陷入混乱。
- 类比:把检测器想象成一名保安,他非常擅长识别某种特定的假身份证。但如果你把那张假身份证复印、揉皱,再放进咖啡机里搅一遍,保安就再也无法识别它是假的了。
- 压缩是敌人:当视频被压缩(就像在 YouTube 或 TikTok 上那样)时,检测器所寻找的“法医指纹”就被抹去了。
- “相机”技巧最难:当他们在屏幕上播放视频并用另一台相机拍摄时,检测器遇到的困难最大。这种伪造的“现实世界”视频看起来太像真实的“现实世界”视频了,以至于检测器无法分辨。
什么样的检测器才是好的?
本文研究了获胜团队构建其程序的方法,发现了一些共同的技巧:
- 使用“大脑”骨干:表现最好的团队使用了预训练的“大脑”(一个已经知道如何在真实照片中识别物体的大型 AI 模型),并教导它去识别伪造品。这就像雇佣一位已经精通烹饪的大厨,只需教他一道新菜谱。
- “自动编码器”技巧:一些团队使用了一种巧妙的训练方法,他们将真实视频通过特殊工具转换为“合成”版本,然后教导检测器区分真实版本和他们自己制作的伪造副本。这就像老师制作一份与真实考试略有不同的模拟试卷来备考学生。
结论
本文总结道,虽然我们在识别高质量、未经处理的 AI 视频方面取得了巨大进步,但当这些视频在网络上传播时,我们仍然非常脆弱。一旦伪造视频被压缩、调整大小或重新录制,我们当前的技术往往无法识破。
这项挑战证明,虽然我们在对抗“新鲜”伪造品的战役中取得了胜利,但对抗那些真正在互联网上流通的“清洗”后伪造品的战争还远未结束。我们需要更强大、更不易被当今我们分享视频的混乱现实所愚弄的检测器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。