UniVoice: A Unified Model for Speech and Singing Voice Generation
UniVoice 是一个基于条件流匹配(conditional flow matching)的统一语音与歌唱生成框架,它将调节因素分解为内容、旋律和音色,并利用学习到的空旋律标记(null melody token)来实现对歌唱的显式旋律控制,同时允许语音具有自然的韵律推断。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人完成两项截然不同的工作:讲故事(说话)和表演歌剧(唱歌)。
通常情况下,你会制造两个不同的机器人。一个被设计成声音自然且具有对话感,它的节奏随文字内容的起伏而变化。另一个则被设计为遵循严格的乐谱,精准地击中每一个音符和节拍。
尝试只用一个机器人来完成这两项工作的难题在于,这两项工作的指令是相互矛盾的。
- 对于唱歌: 你需要强迫机器人遵循特定的旋律(就像火车行驶在轨道上)。
- 对于说话: 如果你强迫它遵循轨道,听起来会显得机械且不自然。它需要根据故事的情感自由地游走。
如果你只是把训练数据混合在一起,机器人就会感到困惑。它会在应该自由发挥时试图遵循轨道,又会在应该遵循轨道时试图自由发挥。结果通常是两项工作都做得糟糕。
解决方案:UniVoice
研究人员创建了 UniVoice,这是一个全新的“机器人”(计算机模型),它通过一种被称为**因子化条件控制(Factorized Conditioning)**的巧妙技巧解决了这个问题。你可以把它想象成给机器人三个独立的控制旋钮,而不是一个又大又乱的开关。
以下是这三个旋钮的工作原理:
- 内容旋钮(正在说什么): 它读取歌词或文本。对于说话和唱歌,这部分是一样的。
- 音色旋钮(谁在说话): 它通过一段简短的人声样本(例如 5 秒钟的片段)来复制某人独特的音色,无论是低声细语还是高亢歌唱。
- 旋律旋钮(曲调): 这是最神奇的部分。
- 当唱歌时: 你输入一份特定的乐谱(MIDI 音符)。机器人必须遵循这条轨道。
- 当说话时: 你不是接入一条轨道,而是接入一个特殊的**“空标记”(Null Token)**。把它想象成一个“请勿打扰”的牌子。它告诉机器人:“忽略音乐轨道,只需倾听文字并自行确定节奏。”
引擎:共享的大脑
在底层,UniVoice 使用了一个强大的引擎,称为扩散 Transformer(Diffusion Transformer, DiT)。想象一下这是一个技艺精湛的艺术家,可以画出任何东西。
- 在过去,你可能需要两个不同的艺术家(一个负责说话,一个负责唱歌)。
- UniVoice 使用的是同一个艺术家,他非常擅长倾听这三个控制旋钮。
- 当“旋律旋钮”设置为“空标记”时,艺术家知道要自然地即兴发挥节奏。当旋律旋钮设置为特定歌曲时,艺术家会完美地遵循乐谱。
为什么这很重要(结果)
研究人员在海量数据(30,000 小时语音和 35,000 小时歌唱)上对他们进行了测试。以下是他们的发现:
- 它是两项工作的专家: UniVoice 的说话水平几乎可以媲美最优秀的纯语音机器人(如 F5-TTS),并且唱歌水平远高于以往的“全能型”机器人。
- 它非常高效: 它能实现这一切,其参数规模相对较小(0.3 十亿参数),而旧的统一模型规模要大得多,性能却更差。
- “空标记”有效: 他们证明了使用这个特殊的“请勿打扰”牌子来让模型忽略旋律,在数学上是让模型在稍后进行唱歌时仍能保持能力的正确方法。
新的测试:UNISINGING-EVAL
为了确保他们的机器人真正出色,团队构建了一个名为 UNISINGING-EVAL 的新测试。想象一场包含 12 种不同音乐流派(从流行到爵士再到嘻哈)的选秀比赛。他们测试了机器人在切换说话与唱歌时,是否能保持相同的声音并处理不同的风格。
核心结论
UniVoice 就像是一个全能的声音演员。它不需要重新训练,也不需要为说话和唱歌准备不同的“大脑”。它只需查看指令:
- “这是文本,这是声音,还有一段歌曲” 完美地歌唱。
- “这是文本,这是声音,而且没有歌曲” 自然地说话。
通过分离指令,他们阻止了机器人产生困惑,使其能够同时在两项工作中都表现卓越。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。