← 最新论文
💻 computer science

Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection

该论文提出了基于全息音视频内在一致性的 HAVIC 检测器,通过预训练学习模态内及跨模态的结构性先验并动态融合特征,同时发布了高保真 HiFi-AVDF 数据集,在跨数据集泛化检测中显著超越了现有最先进方法。

原作者: Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong

发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于如何识破“超级造假”视频的故事。

想象一下,现在的 AI 技术就像一位**“全能魔术师”。它不仅能变出以假乱真的视频(比如让名人说从未说过的话),还能配上完美的声音。以前的“打假警察”(检测器)主要靠找“穿帮镜头”**(比如嘴巴和声音对不上,或者脸上有奇怪的纹理)来识破魔术。但现在的魔术师太厉害了,这些老破绽几乎都消失了。

这篇论文提出了一套全新的打假方案,叫 HAVIC,并建立了一个新的**“魔鬼训练场”**(数据集)。

我们可以用三个生动的比喻来理解它的核心思想:

1. 核心思想:从“找茬”到“懂行”

  • 以前的做法(找茬): 就像警察在案发现场找指纹或脚印。如果魔术师擦掉了脚印,警察就束手无策了。
  • HAVIC 的做法(懂行): 就像一位**“资深老侦探”。他不再只盯着某一个破绽,而是通过“全方位感知”来判断真假。他不仅懂视觉,也懂听觉,更懂这两者之间“天生该是什么样”**。

论文提出了三个层面的“懂行”标准:

  1. 单模态的“常识感”(结构连贯性):
    • 比喻: 就像你听一个人说话,如果他的声带震动听起来像破锣,或者视频里的人脸像融化的蜡像,哪怕声音和嘴型对得上,老侦探也会觉得“不对劲”。这是模态内部的自然规律。
  2. 微观的“同步感”(微协调性):
    • 比喻: 就像看口型。如果一个人说“苹果”,嘴巴张开的形状和发出的声音必须严丝合缝。现在的 AI 能做到这点,但 HAVIC 会像**“节拍器”**一样,检查每一个微小的音节和嘴型动作是否在毫秒级上完美同步。
  3. 宏观的“逻辑感”(宏协调性):
    • 比喻: 这是最高级的。如果视频里一个人在**“吃火锅”,但声音里却是“在沙滩上听海浪”,这种“图文不符”的荒谬感,老侦探一眼就能看穿。这是模态之间**的整体逻辑。

2. 训练方法:先“读万卷书”,再“实战演练”

HAVIC 的训练分为两个阶段,就像培养一名侦探:

  • 第一阶段:预训练(读万卷书 - 学习“真实感”)
    • 侦探先不看任何假视频,而是疯狂阅读成千上万条真实的视频
    • 在这个过程中,它玩一种**“填词游戏”:把视频和声音遮住一部分,让它根据剩下的部分去猜**被遮住的内容。
    • 通过这种游戏,它学会了什么是**“真正的自然规律”(比如真实的皮肤纹理、真实的声音共振、真实的唇音同步)。这就叫“全息内在连贯性先验”**。
  • 第二阶段:微调(实战演练 - 动态抓包)
    • 现在让它看真假混合的视频。
    • 它不再死板地套用规则,而是有一个**“智能调度员”**(自适应聚合模块)。
    • 比喻: 如果某个视频主要是**“脸”有问题,调度员就重点看视觉线索;如果主要是“声音”有问题,它就重点听声音;如果两者都有问题,它就综合判断。它能动态调整注意力**,哪里可疑抓哪里。

3. 新武器:HiFi-AVDF 数据集(魔鬼训练场)

以前的训练场(数据集)里的假视频,大多是用几年前的老技术做的,就像**“纸糊的假人”**,一戳就破。

  • 这篇论文觉得不够用,于是自己建了一个**“地狱级训练场”**(HiFi-AVDF)。
  • 这个训练场里的假视频,是用目前最顶尖的商业 AI 模型(比如 Sora, Kling, Veo 等)生成的。这些假视频逼真到连肉眼都难辨真假,而且涵盖了“文生视频”和“图生视频”等多种造假手段。
  • 用这个训练场练出来的侦探,才能应对未来最狡猾的造假者。

4. 战绩如何?

  • 在普通的测试中,HAVIC 几乎百发百中
  • 在最难的“跨数据集”测试(即没见过的新类型假视频)中,它比现有的最先进方法强了 9% 以上
  • 特别是在面对那些**“高保真”**(High-Fidelity)的超级假视频时,其他方法几乎失效,而 HAVIC 依然能保持较高的识别率。

总结

这篇论文的核心贡献就是:
不要只盯着魔术师手上的小把戏(找破绽),而要培养一种对“真实世界”的深刻直觉(学习内在连贯性)。

通过让 AI 先学会什么是**“完美的真实”,再让它去识别“不完美的虚假”,我们就能在面对未来更强大的 AI 造假技术时,依然拥有一双“火眼金睛”**。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →