← 最新论文
⚡ electrical engineering

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

OmniVoice 是一款基于扩散语言模型架构、利用预训练大语言模型初始化和全码本随机掩码策略,在开源数据上训练而成的支持超 600 种语言的零样本多语言文本转语音模型,实现了当前最广泛的语种覆盖和领先的性能表现。

原作者: Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

发布于 2026-04-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 OmniVoice 的超级语音合成模型。为了让你轻松理解,我们可以把它想象成一位**“拥有 600 多种方言的超级模仿大师”**。

以前,让电脑说话(Text-to-Speech, TTS)就像让一个只会说普通话的人去模仿广东话或藏语,要么学不会,要么听起来很生硬。而 OmniVoice 的出现,就像给这位大师装上了一个**“万能语言大脑”“超级耳朵”**。

下面我用几个生活中的比喻来拆解它的核心亮点:

1. 核心架构:从“两步走”变成“一步到位”

  • 以前的做法(两步走): 就像让一个人先翻译文字成“意思”(语义),再根据“意思”去唱出声音。这就像先让厨师看菜谱(文字),再让他把菜谱翻译成“怎么做菜”(语义),最后才下锅炒菜(声音)。中间如果翻译错了,菜的味道(声音质量)就会大打折扣,而且容易把细节弄丢。
  • OmniVoice 的做法(一步到位): 它直接把“文字”变成了“声音”。就像一位顶级大厨,看到菜单(文字),直接就能在脑子里构建出完美的菜肴(声音),不需要中间那个容易出错的“翻译员”。
  • 技术术语对应: 论文中提到的“单阶段离散非自回归架构”,就是这种“直接映射”的魔法。

2. 两大独门秘籍

为了让这位“大厨”不仅快,而且好吃,作者用了两个关键技巧:

  • 秘籍一:全码本随机掩码(Full-Codebook Random Masking)——“蒙眼猜词”的升级版

    • 比喻: 想象你在玩“你画我猜”,以前的方法是每次只蒙住画的一小部分(比如只蒙住眼睛),让你猜。这样效率很低,而且容易猜偏。
    • OmniVoice 的做法: 它把整张画(声音的所有细节)随机蒙住一大半,然后让你一次性把缺失的部分都补全。这种“大跨度”的练习方式,让模型学得非常快,而且补全后的画面(声音)非常完整、自然。
    • 效果: 训练效率极高,生成的声音更流畅。
  • 秘籍二:LLM 初始化(LLM Initialization)——“站在巨人的肩膀上”

    • 比喻: 以前教机器说话,就像让一个婴儿从零开始学语言,要很久才能听懂人话。
    • OmniVoice 的做法: 作者直接找来了一个已经读过万卷书、精通人类语言的**“超级大脑”(预训练的大语言模型,LLM)**,把它的知识直接“移植”到语音模型里。
    • 效果: 这个模型一出生就“懂”人类的语言逻辑,所以它说出来的话不仅像人,而且非常清晰、 intelligible(可懂度高),不会像以前那样含糊不清。

3. 数据规模:真正的“全球通”

  • 以前的局限: 大多数语音模型只能支持几十种语言,像是一个只会说几种外语的导游。
  • OmniVoice 的突破: 它吃掉了58.1 万小时的开源语音数据,涵盖了600 多种语言
  • 比喻: 这就像它去遍了世界上的每一个角落,听过了从繁华都市到偏远部落的每一种声音。哪怕是那些只有几千小时录音的“小语种”,它也能模仿得惟妙惟肖。
  • 数据平衡术: 为了防止它只爱说大语种(如英语、中文),作者用了一种“加权”方法,强迫它多听那些“小语种”的录音,确保它不会偏科。

4. 强大的控制力:想怎么变就怎么变

OmniVoice 不仅仅会说话,它还是个**“百变声优”**:

  • 降噪能力: 如果你给它一段嘈杂的录音(比如在菜市场录的),它能自动过滤掉背景噪音,还原出干净的声音。就像给照片去噪一样。
  • 人设定制: 即使没有录音,你告诉它“我要一个 30 岁、声音低沉的北京大爷”,它就能凭空捏造出这个声音。
  • 情感与发音控制: 它可以控制笑声、语气,甚至能纠正那些容易读错的字(比如中文的多音字),确保发音绝对准确。

5. 总结:它意味着什么?

OmniVoice 就像是为全球语言平等打开了一扇大门。

  • 以前: 只有英语、中文等“大语种”才有高质量的语音助手。
  • 现在: 无论你说的是哪种语言,哪怕是只有几千人的小语种,你都能拥有一个清晰、自然、能完美模仿你声音的 AI 助手。

一句话总结:
OmniVoice 是一个直接由文字生成声音的“超级模仿秀”,它利用大语言模型的知识独特的训练方法,打破了语言壁垒,让世界上 600 多种语言都能拥有高质量、可定制的“声音克隆”能力。

(注:论文中提到的代码和模型已经开源,任何人都可以去 GitHub 上尝试使用。)

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →