← 最新论文
💻 computer science

Attribution-Guided Multimodal Deepfake Detection via Cross-Modal Forensic Fingerprints

本文提出了归因引导的多模态深度伪造检测(AMDD)框架,该框架通过联合学习篡改归因并强制跨模态取证指纹一致性,迫使模型学习真实的生成器特定痕迹而非数据集伪影,从而增强检测鲁棒性。

原作者: Wasim Ahmad, Wei Zhang, Xuerui Mao

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Wasim Ahmad, Wei Zhang, Xuerui Mao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《基于归因引导的跨模态法医指纹多模态深度伪造检测》的通俗解释,包含类比和示例。

核心问题:“完美的谎言”

想象这样一个世界:任何人都可以制作一段视频,让政治家说出他们从未说过的话,或者让名人做出他们从未做过的事。这些“深度伪造”(deepfakes)已经变得如此逼真,以至于我们的眼睛和耳朵再也无法分辨真假。

目前的计算机程序试图通过玩一个简单的游戏来识破这些伪造品:“这是真的还是假的?”它们查看视频和音频,然后猜测“是”或“否”。

缺陷: 作者认为,这些程序实际上是在作弊。它们没有学习是什么让视频真正变得虚假(即生成该视频的计算程序留下的深层技术痕迹),而是学会了寻找简单的捷径。例如,它们可能会学到“这个训练集中所有背景略微模糊的视频都是伪造的”。如果你给它们看一个背景清晰的新视频,程序就会被愚弄,因为它寻找的是错误的线索。

解决方案:“侦探与指纹”

作者提出了一种名为AMDD的新系统。与其仅仅问“这是伪造的吗?”,它们强迫计算机先回答一个更难的问题:“是谁制造了这个伪造品?”

这就像侦探破案:

  • 旧方法(二元检测): 侦探只问:“发生了犯罪吗?”如果看到窗户破了,他们就回答“是”。但如果窗户是自然破碎的,他们可能会出错。
  • 新方法(AMDD): 侦探问:“是谁打破了窗户?是拿棒球棒的人、拿石头的人,还是拿撬棍的人?”

通过强迫计算机识别具体的“罪犯”(即制造伪造品的特定 AI 工具,如 FaceSwap 或 Wav2Lip),系统被迫学习该特定工具留下的独特指纹。一旦它学会了这些指纹,它在识别犯罪本身方面就会变得强大得多。

工作原理:双流管弦乐队

该系统同时查看视频和音频,就像指挥家倾听管弦乐队中两个不同的声部。

  1. 视觉流(眼睛): 它使用强大的“相机”(ResNet50)来查看视频帧。它观察奇怪的运动,比如嘴唇与话语不完全匹配,或者皮肤融合不佳。
  2. 音频流(耳朵): 它使用强大的“听觉器”(ResNet18)来分析声波。
    • 改进之处: 以前的系统使用一只微小、脆弱的“耳朵”与一只巨大的“眼睛”相比。本文通过给“耳朵”配备更强大“的大脑”来修复这一问题,使其不会被忽视。

秘密武器:“跨模态指纹”
该系统有一条特殊规则:如果视频和音频是由同一个“罪犯”制作的,它们的指纹必须匹配。

想象一个伪造者在画作上签名。他们在正面(视频)和背面(音频)都签了名。如果正面的签名是一个颤抖的"A",背面的签名也是一个颤抖的"A",系统就知道它们属于同一组。如果正面是颤抖的"A",但背面是完美的"B",系统就知道出了问题。这有助于计算机理解,真实的人其面部和声音之间存在自然的联系,而伪造品往往以特定且可测量的方式破坏这种联系。

结果:他们发现了什么?

该团队在名为FakeAVCeleb的数据集(真实和伪造名人视频的混合体)上测试了他们的系统。

  • 得分: 准确率达到了99.7%。这几乎是完美的。
  • 归因能力: 它能够正确猜出是哪种特定的 AI 工具制造了伪造品,准确率为95.9%
  • “顿悟”时刻: 当他们关闭训练中的“是谁制造了这个?”部分时,系统在说“真 vs 假”方面仍然很出色(98.3%),但它完全忘记了制造了伪造品(准确率降至 11%)。这证明,如果没有“归因”训练,系统只是在死记硬背捷径,而没有学习伪造的真正原理。

局限性:“新罪犯”问题

该论文非常诚实地指出了一个主要弱点。

该系统就像一名保安,他记住了三个特定窃贼的面孔。如果出现了他从未见过的第四个窃贼,这名保安可能抓不住他们。

  • 真实视频: 该系统非常擅长识别真实视频,即使来自新的来源。
  • 新伪造品: 如果一种新的 AI 工具(系统从未见过的)制造了伪造品,该系统通常无法检测到它。

作者解释说,这不是代码中的漏洞,而是法医鉴定的基本规则。只有当你了解罪犯的具体签名时,你才能抓住他们。如果一名新罪犯发明了一种新的入侵方式,你需要先学会他们的新的签名。

总结

这篇论文介绍了一种更聪明的深度伪造检测方式。与其仅仅问“这是伪造的吗?”,它问“是哪个 AI 制造了它?”通过强迫计算机学习不同伪造工具的独特“指纹”,它建立了对伪造品外观更深层、更可靠的理解。它在已知的伪造品上表现极其出色,但像任何优秀的侦探一样,当出现完全新型罪犯时,它会感到棘手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →