Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes
本文介绍了 ConLLM,这是一个结合了预训练模型嵌入、对比学习与大语言模型推理的混合框架,旨在克服模态碎片化和浅层跨模态推理问题,从而显著提高音频、视频及音视频深度伪造检测的准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
问题所在:“完美谎言”
想象一个这样的世界:有人可以制作一段视频,让政客说出他们从未说过的话,或者一段音频,让首席执行官授权一笔虚假的交易。这些不仅仅是糟糕的照片;它们是深度伪造(Deepfakes)——由计算机制造的超写实谎言。
论文解释说,目前的“测谎仪”有两个主要的盲点:
- “孤岛”问题(模态碎片化): 想象一名保安在分别检查一个人的身份证(脸部)和聆听其声音。保安可能会说:“脸部看起来是真的!”而另一名保安则说:“声音听起来是假的!”因为他们之间没有沟通,所以他们错过了其中的矛盾。目前的 AI 模型也经常这样做——它们孤立地观察视频和聆听音频,无法看到全局。
- “表面化”问题(浅层推理): 想象一名保安只检查嘴唇的动作是否与声音同步。如果嘴唇与声音匹配,保安就会说:“一切正常!”但如果这个人说的话与其性格或情境完全不符呢?目前的模型往往会错过这些细微的逻辑不一致之处,因为它们没有进行足够的深度“思考”。
解决方案:ConLLM(“超级团队”侦探)
作者提出了一种名为 ConLLM 的新系统。可以将其想象为一个拥有特定两步流程的高科技侦探团队,旨在捕捉这些复杂的骗子。
第一步:专业侦察员(嵌入提取)
首先,系统将视频和音频发送给不同领域的专家“侦察员”。
- 音频侦察员: 使用名为 XLS-R 的模型来聆听声音。
- 视频侦察员: 使用 VideoMAE 来观察脸部和身体动作。
- 双重侦察员: 使用 VATLM 来观察声音和脸部是如何协同工作的。
这些侦察员不仅仅是在猜测;他们会做详细的笔记(称为“嵌入/embeddings”)。这确保了在团队汇合之前,没有任何细节会丢失。
第二步:圆桌讨论(精炼)
这是见证奇迹的时刻。来自侦察员的笔记被带到“圆桌”前,在这里有两个强大的工具协同工作:
- “真相对齐器”(对比学习): 想象一场“找不同”的游戏。这个工具强制要求音频笔记和视频笔记如果真实,则必须完美对齐。如果音频表达的是“快乐”,但视频展示的是“悲伤”的面孔,该工具会将它们推开,从而标记为不匹配。这解决了“孤岛问题”。
- “超级大脑”(大语言模型 - LLM): 这是团队中最聪明的成员,类似于像 GPT 这样聊天机器背后的 AI。它不仅仅是观察数据;它还会进行推理。它会提问,例如:“这个人的说话模式是否符合其已知行为?”或者“他所讲述的故事在逻辑上是否一致?”通过捕捉简单的模式匹配所忽略的语义谎言,它解决了“表面化问题”。
结果:更快、更精准地抓捕骗子
论文声称,这个新团队比以往的侦探要出色得多:
- 音频方面: 它将捕捉虚假声音的错误率降低了高达 50%。
- 视频方面: 它将识别虚假视频的准确度提高了高达 8%。
- 结合(视听结合): 在同时检查声音和视频时,它将准确度提升了约 9%。
为什么它如此出色?
作者进行了测试以了解是什么让这个团队发挥作用。他们发现:
- 使用专门的“侦察员”(预训练模型)至关重要。如果没有它们,系统的表现会差得多。
- “超级大脑”(LLM)的推理是捕捉微妙逻辑谎言的“秘密武器”。
- 该系统也非常高效。它运行速度更快,占用的计算机内存比其他庞大的 AI 模型更少,使其在实际应用中更具实用性。
核心总结
ConLLM 是一种全新的深度伪造检测方式,它不再将眼睛和耳朵视为分离的个体。相反,它使用一个专家团队来收集证据,利用一个“真相对齐器”来检查矛盾,并依靠一个“超级大脑”来推理谎言的逻辑。其结果是一个更难被欺骗的系统,既能捕捉明显的伪造,也能识破巧妙且细微的骗局。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。