← 最新论文
💻 computer science

Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis

本文针对现有研究忽视交互场景中“倾听”状态伪造的问题,提出了倾听深度伪造检测(LDD)新任务,发布了首个基于五种倾听头生成方法构建的 ListenForge 数据集,并设计了利用音频语义引导跨模态融合的运动感知网络 MANet,显著提升了该场景下的检测性能。

原作者: Miao Liu, Fangda Wei, Jing Wang, Xinyuan Qian

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Miao Liu, Fangda Wei, Jing Wang, Xinyuan Qian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的"AI 换脸”技术找一个新的“照妖镜”。

为了让你更容易理解,我们可以把整个故事想象成一场**“真假对话”的侦探游戏**。

1. 以前的侦探只盯着“说话的人”

过去,大家研究怎么识别 AI 造假(Deepfake),主要盯着那个正在说话的人

  • 场景:就像你在看视频,一个人正在滔滔不绝地演讲。
  • 破绽:以前的侦探(检测模型)主要看他的嘴巴声音是不是对得上。如果嘴巴在动,声音却没出来,或者声音和嘴型不匹配,那就肯定是假的。
  • 局限:但这就像警察只抓那个“正在行窃的小偷”,却忽略了旁边那个正在假装认真听、点头、微笑的“同伙”

2. 新的威胁:会“演戏”的听众

这篇论文发现,现在的坏蛋(攻击者)变聪明了。在真实的视频通话或会议中,人不可能一直说话,大部分时间是在

  • 新招数:坏蛋不仅伪造说话的人,还会用 AI 伪造听众的反应。比如,当受害者讲笑话时,AI 生成的听众会恰到好处地微笑、点头、甚至皱眉
  • 为什么危险:这种“会听、会反应”的假人,让整场对话看起来无比真实,极具欺骗性。
  • 现状:以前的侦探(只懂抓说话假人的模型)完全看不懂这种“听众假人”。因为听众不说话,嘴巴不动,所以老方法根本找不到破绽。

3. 这篇论文的三大贡献

为了解决这个问题,作者们做了三件大事:

第一件:造了一个专门的“假听众训练场”(ListenForge 数据集)

以前没有专门用来训练识别“假听众”的数据。作者们就像建了一个**“演技培训班”**,找来了 5 种不同的 AI 技术,生成了成千上万个“假听众”视频。

  • 这些视频里,听众在假装听别人说话,做出各种反应。
  • 有了这个“题库”,新的侦探模型才能学会怎么识别这些假反应。

第二件:发明了一个新侦探(MANet 模型)

作者设计了一个叫 MANet 的新模型,它有两项绝招,就像侦探的“火眼金睛”和“读心术”:

  • 绝招一:微表情捕捉器(动作感知模块)

    • 原理:听众虽然不说话,但会有细微的动作,比如眨眼、微微点头、嘴角抽动。
    • 比喻:就像看一个人假装在听,他的眼神可能飘忽不定,或者点头的时机太机械。AI 生成的听众,这些微小的动作往往不够自然,或者和说话的内容“对不上号”。MANet 专门盯着这些细微的、不自然的动作找破绽。
  • 绝招二:语境读心术(音频引导模块)

    • 原理:这是最关键的。听众的反应必须和说话人的内容有关。
    • 比喻:如果说话人讲了一个很悲伤的故事,听众却在傻笑,这肯定不对劲!
    • MANet 会一边听说话人的声音内容(语义),一边看听众的表情。如果声音说“我很伤心”,而听众在“大笑”,MANet 就会立刻报警:“这是假的!”以前的模型只看画面,根本不懂这种“跨频道”的矛盾。

第三件:实战演练(实验结果)

作者把以前的老模型(只懂抓说话假人的)和新的 MANet 放在一起考试。

  • 结果:老模型在识别“假听众”时,成绩一塌糊涂,几乎像个瞎子。
  • 新模型:MANet 的成绩非常惊人,准确率极高。它证明了:要想抓出高明的骗子,不能只盯着说话的人,还得盯着那个“假装在听”的人。

总结

这就好比以前我们只检查**“谁在说话”是不是在撒谎,现在这篇论文告诉我们,还要检查“谁在听”**是不是在装模作样。

  • 以前:只要嘴巴对得上,就是真的。
  • 现在:如果听众的反应和说话的内容不匹配(比如讲笑话时听众在哭,或者讲悲伤故事时听众在狂笑),那这就是个精心伪装的Deepfake

这篇论文不仅指出了这个新漏洞,还给出了修补方案(新数据集和新模型),让未来的视频通话和社交互动能更安全、更真实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →