← 最新论文
🤖 AI

SONAR: Spectral-Contrastive Audio Residuals for Generalizable Deepfake Detection

SONAR 是一个频率引导的框架,它通过一种谱对比学习方法,显式地隔离并利用高频残差,从而增强了具有泛化能力的深度伪造音频检测,在基准数据集和野外数据集上均实现了最先进的性能和更快的收敛速度。

原作者: Ido Nitzan Hidekel, Gal lifshitz, Khen Cohen, Dan Raviv

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Ido Nitzan Hidekel, Gal lifshitz, Khen Cohen, Dan Raviv

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在收音机里听一首歌。你的大脑非常擅长识别旋律和歌手的声音——即承载主要故事的“低频”部分。但想象一下,如果有人试图用电脑伪造这首歌。电脑可能会把旋律做得完美无缺,但它往往会在人类耳朵通常会忽略的高音、沙哑的部分留下微小的、肉眼不可见的“故障”。这就是音频取证的世界:研究如何捕捉这些数字伪造品(或称“深度伪造/deepfakes”)以防它们欺骗我们的科学。长期以来,试图识别这些伪造品的计算机就像是只看主旋律而忽略背景噪音的侦探。它们非常擅长识别歌曲,但往往会错过那些证明歌曲是由机器人制作的细微高频线索。这篇论文解决了一个被称为“频谱偏差(spectral bias)”的具体问题,这只是一个时髦的说法,指的是计算机大脑天生偏好容易处理的低频内容,而难以关注隐藏着真相的微妙高频细节。

SONAR 登场了,这是研究人员为了修复这一盲点而创造的一种新工具。不要把 SONAR 看作是一个单一的侦探,而要把它看作是一个并肩作战的双专家团队。其中一位专家是“内容专家”,负责倾听主旋律和歌手的词句;另一位是“噪音侦探”,经过专门训练,旨在忽略旋律,完全专注于高频的静电声和故障。在过去,这两位专家各自为政,仅在最后阶段才交换笔记。SONAR 改变了游戏规则,它强迫他们不断地进行交流。它使用一种特殊的数学规则来检查旋律和噪音是否自然契合。如果它们契合,那很可能是一个真实的人声。如果旋律很完美,但噪音却完全不对——就像是在一台破旧收音机上播放的流畅歌曲——系统就会知道它是伪造的。

研究人员发现,通过让计算机关注这些高频“残差”(leftover noise/剩余噪音)并检查它们与主要内容如何匹配,他们能够比以前更有效地识别伪造品。他们在包含真实和伪造音频剪辑的大型集合上测试了 SONAR,其中包括一些在杂乱的现实世界条件下(如电话通话或广播)录制的音频。结果令人印象深刻:即使面对非常复杂的伪造品,SONAR 捕捉到的伪造品也比以往任何方法都多。它还学习得更快,所需的练习时间仅为旧模型的一小部分。

论文指出,旧的检测器之所以失败,并不是因为它们不够聪明,而是因为它们看错了地方。它们过于关注低频“内容”,以至于对真正暴露伪造痕迹的高频“噪音”变得“盲目”。通过使用一个将内容和噪音分离但又强制其对齐的双路径系统,SONAR 将这些微小的故障转化为了它的超能力。研究人员展示了,当他们完全移除音频中的低频部分时,旧的检测器会变得困惑并失效,而 SONAR 却能继续工作,因为它已经学会了信任高频线索。

简而言之,SONAR 是一个频率引导的框架,它不将音频文件中的“噪音”视为需要过滤掉的干扰,而是将其视为一个关键线索。它使用一种巧妙的训练方法,确保对于真实的真人声音,内容和噪音能够完美契合,而对于深度伪造,两者则会产生冲突。这种方法使系统具有更好的泛化能力,这意味着它可以识别出从未见过的各种新型伪造手段,而不仅仅是死记硬背旧的套路。论文结论指出,该方法实现了最先进的性能,在主要基准测试中刷新了准确率记录,同时保持了足以用于实时应用的速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →