← 最新论文
⚡ electrical engineering

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

VoiceDesigner 是一个统一的框架,它利用混合数据流水线和改进的扩散 Transformer 来克服在生成多样化的真实与虚构声音方面的现有局限性,同时实现鲁棒且可控的声音编辑。

原作者: Jiarui Hai, Karan Thakkar, Ke Chen, Yunyun Wang, Jiaqi Su, Rithesh Kumar, Mounya Elhilali, Zeyu Jin

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiarui Hai, Karan Thakkar, Ke Chen, Yunyun Wang, Jiaqi Su, Rithesh Kumar, Mounya Elhilali, Zeyu Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你的声音不再仅仅是一个生物偶然,而是一个可以像吉他一样进行调音的定制化乐器。几十年来,计算机一直擅长朗读文本,但除非你喂给它们一段真实人类的录音进行模仿,否则它们听起来通常都像是一个单一、僵硬的机器人。这个被称为文本转语音(TTV)的领域正试图改变现状。科学家们不再仅仅是复制特定的人,而是正在教计算机理解诸如“一个脾气暴躁的老巫师”或“一个兴奋的外星人”之类的描述,并从零开始创造出一种声音。这就像是给厨师一份用文字写成的食谱,而不是一道菜的照片;目标是通过阅读指令,就变幻出精确的风味、质地和香气。但直到现在,这些数字厨师仍然在努力应对两个大问题:它们大多只知道烹饪“人类”菜肴,而且如果你要求它们微调某种味道(比如让声音听起来更开心),它们往往会毁掉整顿饭。

VoiceDesigner 应运而生,它是一个全新的系统,扮演着声音建筑师的角色。该项目的研究人员意识到,现有的系统陷入了泥潭,主要生成标准的真人声音,并且在被要求创造像龙或恶魔之类的虚构角色,或者在尝试编辑声音情绪而不破坏其原有特征时表现不佳。为了解决这个问题,他们构建了一个统一的框架,将声音创作与声音编辑视为一枚硬币的两面。把它想象成一个单一且超级智能的工作室,在这里你可以通过一段文本描述从头开始构建一个声音,或者拿一个现有的声音,通过一个简单的指令将其重塑,比如“让它听起来更神秘”。

VoiceDesigner 背后的秘诀在于两种巧妙的结合。首先,他们不仅仅依赖于录制真人;他们建立了一个“声音工厂”,利用数字信号处理(就像旋转调音台上的旋钮)和生成式人工智能来创造数以千计虚假但真实的各种声音。这使得他们能够针对从人类的低语到怪物的深沉轰鸣等各种声音进行训练,填补了现实世界录音留下的空白。其次,他们升级了系统的“大脑”——一种被称为扩散 Transformer(Diffusion Transformer)的 AI 类型。他们为系统提供了一种全新的方式,使其能够同时倾听指令、转录文本和音频参考,而不会感到困惑,使用的是一种特殊的 3D 定位系统,能像一位永不会混淆书籍、电影和音乐的图书管理员一样,将不同类型的信息组织得井然有序。

结果表明,这种方法效果显著。在测试中,VoiceDesigner 比其他开源模型更能遵循复杂的指令,成功生成了如海盗和机器人等角色,且听起来完全符合描述。它还证明了自己是一位大师级的编辑,能够在改变说话者情绪或语调的同时,不丢失其原始身份。虽然它与顶尖的商业系统之间仍有微小的差距需要弥补,但论文表明,通过将创意数据模拟与更智能的统一模型相结合,我们正越来越接近这样一个未来:你可以仅通过键盘,就能设计出任何你能想象到的声音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →