← 最新论文
🤖 AI

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

本文介绍了 DAV-Det,一种解耦的音视频检测系统,该系统通过多粒度视觉表示和门控时频音频架构,独立地对每种模态中的取证证据进行建模,并通过挑战“跨模态不一致性始终对伪造检测可靠”这一假设,在 IJCAI-ECAI 2026 通用 AIGC 音视频检测挑战赛中荣获第一名。

原作者: Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个你无法信任自己的眼睛或耳朵的世界。由于人工智能的爆发式增长,计算机已经学会了创造看起来和听起来都极其真实的虚假视频和声音。这不仅仅是更换某个名人的脸;它关乎生成从未存在过的完整场景、动物和物体。这项技术被称为 AIGC(人工智能生成内容),它是一把双刃剑:它为创意提供了惊人的助力,但也为虚假信息和欺诈带来了恐怖的威胁。为了反击,科学家们一直在构建“数字测谎仪”。多年来,捕捉这些伪造内容的流行策略依赖于一个简单的理念:在一段真实的视频中,你所看到的和所听到的应该完美匹配。如果一个人正在说话,他们的嘴唇运动应该与声音同步。如果音画不同步,那就是假的。这就像是在检查木偶的嘴部动作是否与背后的声音同步;如果不同步,你就知道这是一个骗局。

然而,哈尔滨工业大学研究人员的一项新研究表明,这种旧有的经验法则在处理通用视频时失效了。他们发现,在许多现实场景中——比如自然纪录片或烹明节目——即使一切都是 100% 真实的,声音和画面也可能并不紧密相关。在这些情况下,寻找不匹配之处就像是通过检查鞋子是否配得上帽子来寻找小偷一样;有时候,真实的人就是不会穿配套的服装。研究人员认为,与其强迫音频和视频进行对话以寻找谎言,我们应该让它们作为独立的侦探来工作。他们提出了一个名为 DAV-Det 的新系统,将音频和视频视为独立的线索。视觉侦探寻找图像中微小的、奇怪的纹理或模式,而音频侦探则倾听声波中不自然的故障。只有在两者都做出各自的判决后,它们才会结合彼此的意见来决定整个内容是否为伪造。这种“少即是多”的方法避免了在不存在关联的地方强行建立联系,事实证明,这是赢得一场关于识别 AI 伪造内容重大国际比赛的关键,并取得了 0.8460 的顶尖分数。

一个巨大的错误:假设一切都是关联的

长期以来,识破深度伪造的最佳方法是寻找那种“连接上的违和感”。如果视频显示一个人正在说话,AI 通常很难让嘴唇运动与单词完美契合。因此,检测器被设计用来衡量音频和视频的匹配程度。如果匹配度差,系统就会大喊“假货!”

本文的作者决定在更广泛的范围内测试这一假设。他们观察了两类视频:

  1. 以人为中心的视频: 比如对着镜头说话的人。在这里,旧规则效果很好。真实视频具有高度的视听相似性,而伪造视频的相似性较低。
  2. 通用视频: 比如狗吠、汽车引擎轰鸣或带有风声的风景视频。

当他们在通用视频上测试“匹配”规则时,该规则彻底崩溃了。事实上,它的表现甚至比随机猜测还要差!他们发现,在许多真实的通用视频中,音频和视频的相似度自然地比某些伪造视频还要低。在这里使用“不匹配”规则实际上会损害检测效果。这就像是通过检查画框是否与画布匹配来寻找一幅假画;在真实的博物馆里,画框可能根本不匹配画布,但画作本身依然是真实的。论文明确排除了“音画对应关系是通用 AIGC 检测可靠线索”的观点。

新策略:两个独立的侦探

由于强迫音频和视频交换笔记失败了,团队提出了一个“解耦”方法。他们没有构建一个试图同时处理两者的单一大脑,而是构建了两个专门工作的独立大脑,并在最后分享结论。

视觉侦探(DAV-Det 的眼睛)
视觉检测器不仅仅看整体图像,它还会像侦探检查犯罪现场一样,在三个不同的细节层面进行缩放观察:

  • 全局层面(Global Level): 它观察大局,查看整个场景是否感觉“不对劲”或在语义上错误。
  • 分块层面(Patch Level): 它将图像分解成微小的方块(patches),以寻找细微的纹理瑕疵,比如某个特定物体上不该有的奇怪模糊。
  • 段落层面(Segment Level): 它将相邻的方块组合成更大的块(segments),以发现区域性的不一致,比如不属于特定区域的奇怪阴影。

该系统使用了一种巧妙的“弱监督”技巧。由于它并不总是知道究竟是哪个微小的方块是伪造的,它假设如果整张图像是假的,那么至少有一些微小的方块应该是可疑的。它学习识别这些可疑方块,并利用它们来建立更强的证据。它还在“退化”图像(添加了噪声或模糊的图像)上进行练习,以确保不会被糟糕的相机质量所迷惑。

音频侦探(DAV-Det 的耳朵)
音频检测器倾听两类线索:

  • 基于时间的线索: 声音的节奏自然吗?声音之间的过渡是平滑的,还是跳跃得很奇怪?
  • 频率线索: 声音是否含有真实麦克风通常不会采集到的奇怪高频伪影?

为了捕捉这些,音频检测器使用了一个“门控”系统。想象一下夜店门口的保安,他决定哪些部分的声音是重要的,哪些应该被忽略。这个保安(门控网络)会突出声波中最可疑的部分,使检测器能够专注于 AI 经常留下的时间(temporal)和频谱(spectral)异常。

最终裁决:决策级融合

一旦两名侦探完成了各自的工作,他们并不会将数据混合成一锅汤。相反,他们保持各自的发现独立,并根据各自的分数做出最终决定。

  • 对于简单的“真 vs 假”检查: 如果音频侦探或视觉侦探中任何一个认为它是假的,系统就会将其标记为假。这是一种“宁错杀勿错过”的方法。
  • 对于详细检查(四分类): 系统会计算四种情景的概率:
    1. 真实视频 + 真实音频 (RR)
    2. 伪造视频 + 伪造音频 (FF)
    3. 伪造视频 + 真实音频 (FR)
    4. 真实视频 + 伪造音频 (RF)

通过假设音频和视频是独立的,系统通过计算它们的概率来确定哪种情景最有可能发生。

结果:赢得比赛

团队在 IJCAI-ECAI 2026 DDL 2.0 工作坊举办的“通用 AIGC 音视频检测挑战赛”中测试了他们的新系统 DAV-Det。这是一场极其艰难的比赛,涵盖了从人类到动物和物体的超过 200,000 个视频音频样本。

结果令人印象深刻:

  • 排名: 他们在所有参赛队伍中排名 第 1 名
  • 得分: 他们取得了 0.8460 的最终得分。
  • 表现: 在二分类(真/假)检测任务中,他们达到了 0.9617;在更困难的四分类任务中,达到了 0.6873

当他们在较旧的、以人为中心的深度伪造数据集(即旧有的“匹配”规则通常奏效的数据集)上测试系统时,DAV-Det 依然碾压了竞争对手,达到了 0.998 的准确率和 0.999 的 AUC。这表明他们的算法足够鲁棒,既能处理棘手的通用视频,也能应对传统的换脸伪造。

未来展望

作者坦诚地说明了其系统目前尚不能做到的事情。他们的视觉侦探擅长捕捉静态图像缺陷,但并未明确追踪物体跨帧运动的动态过程(时间性运动)。此外,他们结合两名侦探的方法依赖于简单的数学规则(如取最大值),而非复杂的基于学习的融合。

然而,核心信息非常明确:在通用 AI 伪造的世界里,有时寻找真相的最佳方式是停止寻找那并不存在的关联。通过让音频和视频各自发声,该系统找到了通往真相更可靠的路径。正如论文所暗示的,“少即是多”——解耦模态使得检测系统更加稳健,不会被现实世界视频中自然的同步缺失所误导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →