← 最新论文
🤖 AI

A survey of AI-generated voices and their detection

本综述全面概述了人工智能生成语音技术的快速发展、其在有益应用与恶意活动方面的双重用途影响,以及与检测合成语音相关的独特挑战、方法和未来方向。

原作者: Chengzhe Sun, Tianle Yang, Siwei Lyu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengzhe Sun, Tianle Yang, Siwei Lyu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

几十年来,让计算机像人类一样说话一直是人工智能领域的一个核心追求。早期的尝试听起来机械且平淡,只是将录制的音频片段拼接在一起,缺乏人类对话的自然流利感。随着时间的推移,这些系统得到了改进,学会了基于统计模式来预测句子中的下一个声音。然而,最近的技术飞跃彻底改变了这一格局。现代系统现在可以生成如此逼真的声音,以至于往往与真实人物的录音无法区分。这种能力为导航系统和虚拟助手等工具提供了支持,但也为严重的滥用打开了大门。犯罪分子现在可以克隆商业领袖的声音来授权欺诈性转账,或者模仿政治人物在选举期间传播虚假信息。由于人类的耳朵并不总是可靠到能识别出这些伪造品,且创造这些伪造品的技术进步速度快于捕捉它们的工具,科学家们正在竞相研究这些合成语音究竟是如何制造出来的,以及它们可能在哪里失效。

来自布法罗大学的一个研究小组完成了一项综合调查,绘制出了这一快速发展的领域的发展图谱。他们的工作不仅仅是列举新的计算机程序;相反,他们将人类说话的生物学现实与机器模仿这种言语的数学方法联系了起来。作者认为,要抓住伪造的声音,必须首先了解真实声音的复杂生理结构。人类的言语是由涉及肺部、声带以及口腔和舌头形状的复杂系统产生的。我们发出的每一个声音都遵循严格的物理规则。例如,一个人如何形成元音,取决于舌头的精确位置和嘴唇的圆润程度。研究人员发现,虽然人工智能模型在捕捉声音的总体特征方面已经变得非常出色,但它们往往在这些细微的物理细节上表现挣扎。机器倾向于抹平人类说话时产生的那些微小的、自然的波动,从而创造出一种听起来大致像人、但缺乏真实人类特有的微妙缺陷的声音。

该调查将这些声音的产生方式分为三种主要途径。第一种是文本转语音,即计算机朗读文字。第二种是语音转换,它提取一个人的现有录音并将其改变成另一个人的声音。第三种是语音克隆,它仅使用目标人物几秒钟的音频即可从头生成一个新声音。研究人员追溯了这些技术的发展史,指出早期的系统依赖于简单的规则或统计平均值,这通常导致平淡、不自然的语调。较新的模型则使用先进的神经网络,从海量数据中学习。一些最强大的近期系统使用了被称为“扩散”的方法,该方法从随机噪声开始,逐渐将其精炼成清晰的声音,或者将语音视为一种语言模型,去预测序列中的下一个声音。虽然这些方法产生了惊人的效果,但作者指出,它们仍然严重依赖于训练数据。如果一个模型没有听过某种特定的口音或罕见的说话方式,它可能会产生略显违和的声音,或者无法捕捉到句子的情感重量。

该调查最关键的发现是,目前的检测方法正难以跟上步伐。研究人员解释说,早期的检测器寻找的是明显的瑕疵,例如机械化的语调或奇怪的背景噪音。但随着生成器的改进,这些瑕疵已变得难以寻找。作者建议,最有前景的路径在于不仅将语音视为一种声波,而是将其视为一种语言事件。他们提议,检测器应该分析语音的音素细节:辅音和元音如何相互作用、句子的节奏,以及人类说话时自然发生的音高的微妙变化。例如,研究强调了真实的人类言语涉及口腔不同部分之间复杂的相互作用,而这些作用对于机器来说很难完美复制。机器可能会得到正确的元音,但可能会错过人在从辅音过渡到元音时发生的微小的、自动的音高调整。通过关注这些高层级的语言模式而非仅仅是低层级的声音人工痕迹,检测器或许能够识别出那些听起来完美但在人体生理测试中失败的伪造品。

该调查还回顾了研究人员用于测试其系统的数据库和挑战。多年来,业界创建了大量真实和伪造的音频集合,用于训练和评估检测工具。然而,作者指出一个日益严重的问题:许多这些测试过于干净且受控。它们通常使用在安静录音室中制作的高质量录音,这并不反映现实世界的混乱情况——在现实世界中,声音可能是通过手机录制的、在嘈碌的房间里录制的,或者是为了社交媒体进行了压缩处理的。研究人员警告说,在一个干净测试文件上表现完美的检测器,在面对现实世界的录音时可能会完全失效。他们强调,下一代检测工具必须足够强大,以应对这些现实世界的条件。此外,他们指出,仅仅依靠自动化检测是不够的。调查表明,需要结合自动化工具和人类意识,因为人类有时能察觉到机器可能会忽略的语境或行为中的不一致之处。

展望未来,作者预见到一场创造与检测之间的战斗将持续升级。随着语音生成工具变得更加高效,并且能够仅凭几秒钟的音频就能模仿任何说话者,建立可靠保障措施的需求变得更加紧迫。研究人员建议,解决方案不会来自于单一的灵丹妙药,而是来自于一种分层的方法。这包括开发更理解言语生物学的检测方法、创建数字水印以证明录音的来源,以及教育公众对所听到的内容保持怀疑精神。调查总结道,虽然制造伪造声音的技术正在迅速进步,但对自然人类声音的深度理解仍然是我们最好的防御手段。通过将我们的检测策略植根于人类说话的物理和语言现实,我们可以构建出更具韧性的系统,从而更好地抵御欺骗,并保护我们对所听到的声音的信任。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →