← 最新论文
💬 NLP

Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes

本文介绍了 ConLLM,这是一个结合了预训练模型嵌入、对比学习与大语言模型推理的混合框架,旨在克服模态碎片化和浅层跨模态推理问题,从而显著提高音频、视频及音视频深度伪造检测的准确性。

原作者: Gautam Siddharth Kashyap, Harsh Joshi, Niharika Jain, Ebad Shabbir, Jiechao Gao, Nipun Joshi, Usman Naseem

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Gautam Siddharth Kashyap, Harsh Joshi, Niharika Jain, Ebad Shabbir, Jiechao Gao, Nipun Joshi, Usman Naseem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题所在:“完美谎言”

想象一个这样的世界:有人可以制作一段视频,让政客说出他们从未说过的话,或者一段音频,让首席执行官授权一笔虚假的交易。这些不仅仅是糟糕的照片;它们是深度伪造(Deepfakes)——由计算机制造的超写实谎言。

论文解释说,目前的“测谎仪”有两个主要的盲点:

  1. “孤岛”问题(模态碎片化): 想象一名保安在分别检查一个人的身份证(脸部)和聆听其声音。保安可能会说:“脸部看起来是真的!”而另一名保安则说:“声音听起来是假的!”因为他们之间没有沟通,所以他们错过了其中的矛盾。目前的 AI 模型也经常这样做——它们孤立地观察视频和聆听音频,无法看到全局。
  2. “表面化”问题(浅层推理): 想象一名保安只检查嘴唇的动作是否与声音同步。如果嘴唇与声音匹配,保安就会说:“一切正常!”但如果这个人说的话与其性格或情境完全不符呢?目前的模型往往会错过这些细微的逻辑不一致之处,因为它们没有进行足够的深度“思考”。

解决方案:ConLLM(“超级团队”侦探)

作者提出了一种名为 ConLLM 的新系统。可以将其想象为一个拥有特定两步流程的高科技侦探团队,旨在捕捉这些复杂的骗子。

第一步:专业侦察员(嵌入提取)

首先,系统将视频和音频发送给不同领域的专家“侦察员”。

  • 音频侦察员: 使用名为 XLS-R 的模型来聆听声音。
  • 视频侦察员: 使用 VideoMAE 来观察脸部和身体动作。
  • 双重侦察员: 使用 VATLM 来观察声音和脸部是如何协同工作的。

这些侦察员不仅仅是在猜测;他们会做详细的笔记(称为“嵌入/embeddings”)。这确保了在团队汇合之前,没有任何细节会丢失。

第二步:圆桌讨论(精炼)

这是见证奇迹的时刻。来自侦察员的笔记被带到“圆桌”前,在这里有两个强大的工具协同工作:

  1. “真相对齐器”(对比学习): 想象一场“找不同”的游戏。这个工具强制要求音频笔记和视频笔记如果真实,则必须完美对齐。如果音频表达的是“快乐”,但视频展示的是“悲伤”的面孔,该工具会将它们推开,从而标记为不匹配。这解决了“孤岛问题”。
  2. “超级大脑”(大语言模型 - LLM): 这是团队中最聪明的成员,类似于像 GPT 这样聊天机器背后的 AI。它不仅仅是观察数据;它还会进行推理。它会提问,例如:“这个人的说话模式是否符合其已知行为?”或者“他所讲述的故事在逻辑上是否一致?”通过捕捉简单的模式匹配所忽略的语义谎言,它解决了“表面化问题”。

结果:更快、更精准地抓捕骗子

论文声称,这个新团队比以往的侦探要出色得多:

  • 音频方面: 它将捕捉虚假声音的错误率降低了高达 50%
  • 视频方面: 它将识别虚假视频的准确度提高了高达 8%
  • 结合(视听结合): 在同时检查声音和视频时,它将准确度提升了约 9%

为什么它如此出色?
作者进行了测试以了解是什么让这个团队发挥作用。他们发现:

  • 使用专门的“侦察员”(预训练模型)至关重要。如果没有它们,系统的表现会差得多。
  • “超级大脑”(LLM)的推理是捕捉微妙逻辑谎言的“秘密武器”。
  • 该系统也非常高效。它运行速度更快,占用的计算机内存比其他庞大的 AI 模型更少,使其在实际应用中更具实用性。

核心总结

ConLLM 是一种全新的深度伪造检测方式,它不再将眼睛和耳朵视为分离的个体。相反,它使用一个专家团队来收集证据,利用一个“真相对齐器”来检查矛盾,并依靠一个“超级大脑”来推理谎言的逻辑。其结果是一个更难被欺骗的系统,既能捕捉明显的伪造,也能识破巧妙且细微的骗局。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →