← 最新论文
⚡ electrical engineering

Alethia: A Foundational Encoder for Voice Deepfakes

本文介绍了 Alethia,一种新颖的基础音频编码器,它通过采用结合瓶颈掩码嵌入预测与基于流匹配的光谱图重建的预训练方案,在语音深度伪造检测与定位方面超越了现有的语音基础模型,从而在跨多种任务与领域时实现了卓越的鲁棒性与零样本泛化能力。

原作者: Yi Zhu, Brahmi Dwivedi, Jayaram Raghuram, Surya Koppisetti

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yi Zhu, Brahmi Dwivedi, Jayaram Raghuram, Surya Koppisetti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一名保安来识别伪造的声音。长期以来,行业内的最佳策略是聘请一位已经熟记海量真实人类语音库的保安(例如一位著名的语言学家或语音专家),然后仅给他们一本简短、具体的“如何识别伪造声音”的培训手册。

这篇论文的作者,Alethia,认为这种方法已陷入瓶颈。即使拥有最优秀的“通才”保安,他们仍会被新型伪造声音所欺骗,尤其是在音频嘈杂或伪造声音是歌唱而非说话时。

以下是该论文解决方案的简明解释:

问题所在:“通才”保安过于宽泛

当前顶级的语音模型(称为语音基础模型)就像通才侦探。由于在数百万小时的真实语音上进行了训练,它们在理解语法、口音和说话者身份方面表现出色。

然而,在识别深度伪造(AI 生成的语音)方面,这些侦探存在盲点。它们过于专注于词语的“含义”,从而忽略了生成该语音的 AI 留下的微小、细微的“故障”或“伪影”。论文发现,仅仅给这些通才侦探提供更多伪造样本进行学习(微调)效果并不理想。它们仍然无法泛化到新的、未见过的伪造类型。

解决方案:专门的“法医”训练

作者构建了一个名为Alethia的新模型。他们不是聘请一名通才并指望其学会工作,而是从头开始打造了一位专门化的法医专家

他们使用独特的两部分训练配方(预训练)来实现这一点:

  1. “填空”谜题(掩码嵌入预测):
    想象你在听一首歌,但有人静音了 10% 的音符。普通的侦探可能会根据歌词猜测缺失的音符。Alethia 则通过参考一位“听完了整首歌”的“教师”模型,来猜测缺失音符的确切音质

    • 转折之处: 与试图猜测单词(离散令牌)的旧模型不同,Alethia 猜测的是连续声波(嵌入)。这迫使模型关注声音中微小、杂乱的细节,而不仅仅是词语。
  2. “重建”挑战(流匹配):
    想象你拿到一张模糊、破损的人脸照片,并被要求完美地重绘缺失的部分。Alethia 被训练为将一段沉闷的音频片段,在数学上“重建”为原始、晶莹剔透的声谱图(声音的视觉地图)。

    • 为何重要: 为了完美重建声音,模型必须学习 AI 生成声音的隐藏模式。如果它遗漏了微小的故障,重建就会失败。这教会模型对深度伪造技术留下的“指纹”保持极度警觉。

结果:新晋冠军

作者在56 个不同的数据集上,针对5 项不同的任务测试了 Alethia 与当前最佳“通才”模型的表现。这相当于在 56 种不同场景下测试保安:嘈杂的房间、不同的语言、歌唱声音,甚至是口型与声音不匹配的视频。

  • 更擅长识破伪造: Alethia 始终比之前的最佳模型捕获更多的伪造声音,且犯错更少。
  • 零样本超能力: 这是最令人印象深刻的部分。该模型仅在常规语音深度伪造上进行了训练。然而,当在歌唱语音深度伪造(它从未见过)上进行测试时,它的表现仍优于专门针对歌唱进行训练的模型。这就像一名仅接受过识别假钞训练的保安,能够瞬间识别出从未见过的假护照。
  • 鲁棒性: 它处理现实世界噪声(如背景闲聊或劣质麦克风)的能力远超竞争对手。

核心要点

论文得出结论:要捕捉复杂的 AI 伪造,我们不能仅仅依赖擅长理解语言的模型。我们需要专门训练以理解声音生成的物理特性和伪影的模型。

通过将“解谜”任务与“重建”任务相结合,Alethia 学会了发现其他模型所忽略的 AI 生成语音中那些看不见的裂痕。它是首个专门为充当深度伪造侦探而构建的基础编码器,而不仅仅是一个通用的语音聆听者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →