← 最新论文
⚡ electrical engineering

Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens

本文通过系统研究数据混合、令牌组合等设计选择,并基于 64 个模型的首次离散音频模型缩放定律分析,提出了 SODA 系列原生音频基础模型,实现了语义、声学及文本令牌的联合建模,从而支持通用音频生成与跨模态任务。

原作者: Potsawee Manakul, Woody Haosheng Gan, Martijn Bartelds, Guangzhi Sun, William Held, Diyi Yang

发布于 2026-02-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Potsawee Manakul, Woody Haosheng Gan, Martijn Bartelds, Guangzhi Sun, William Held, Diyi Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在教我们如何**“从零开始造一个全能型的音频大脑”**。

以前的 AI 做音频任务,要么像个“只会读稿子的播音员”(只懂文字,不懂声音细节),要么像个“只会模仿声音的鹦鹉”(只懂声音,不懂语言逻辑)。这篇论文提出了一种新方法,让 AI 能像人类一样,同时理解**“说了什么”(语义)“怎么说的”(声音细节)以及“文字本身”**,并且把它们混在一起学习。

作者把这个新系列模型叫做 SODA(Scaling Open Discrete Audio,意为“扩展开放离散音频”)。

下面我用几个生活中的比喻来拆解这篇论文的核心发现:

1. 以前的做法 vs. 现在的做法

  • 以前的做法(拼凑法): 就像你想让一个只会写文章的人去唱歌。你给他装个麦克风(音频模块),但他本质上还是那个写文章的,所以唱出来的歌虽然歌词对,但没有感情,声音也很机械。或者,你给他一个录音机,让他只模仿声音,但他听不懂歌词的意思
  • SODA 的做法(混合法): 作者把文字声音的语义(意思)和声音的细节(语调、音色、背景音)全部打碎成一个个小积木(Token),然后像串珠子一样,把文字和声音交替串在一起喂给 AI。
    • 比喻: 就像教小孩学说话,不是先让他背字典再学发音,而是直接让他听故事(声音 + 文字混合),一边听一边学,自然就能既懂意思,又学会怎么模仿语气。

2. 核心发现一:怎么“喂”数据最重要?(食谱实验)

在训练这个大脑之前,作者像厨师一样试了很多“食谱”:

  • 选什么食材? 他们试了三种不同的语音数据(像不同的录音库)。结果发现,有些数据虽然音质好,但像“朗读课文”一样死板,AI 学了之后听不懂人话(跨模态能力差)。他们最终选用了YouTube 上的自然对话(Yodas)和自发演讲(Emilia)混合,因为这里面的声音最像真人说话。
  • 要不要加“纯文字”? 以前大家觉得学声音就要只学声音。但作者发现,加一点点纯文字数据(5%),就像给学说话的小孩看几本绘本,能极大地提升他的常识和逻辑能力,而且不会让他变笨(声音能力没下降)。
  • 积木怎么搭? 他们发现,如果只教“意思”(语义),AI 说话没感情;如果只教“声音细节”,AI 听不懂人话。必须把“意思”和“声音细节”混在一起教,AI 才能既懂内容,又能模仿出逼真的声音。

3. 核心发现二:算力和数据怎么分配?(缩放定律)

这是论文最硬核的部分。以前训练大语言模型(LLM),大家认为模型越大越好,数据也要跟着涨,比例大概是 1:1。

  • 新发现: 对于音频模型,数据的重要性比模型大小更重要!
  • 比喻: 想象你在教一个学生(模型)。以前大家觉得,只要给他买个大书包(大模型),他就能学更多。但作者发现,音频信息太稀疏了(就像一本全是图片的画册,信息密度低),所以必须给他看更多的书(更多数据),哪怕书包小一点也没关系。
  • 结论: 如果你想把模型做大,数据的数量应该比模型参数增长得更快(大约快 1.6 倍)。这打破了以前“模型越大越强”的固有认知。

4. 核心发现三:是从零开始教,还是找个“学霸”来教?

  • 冷启动(Cold-Start): 像一张白纸,从头开始学声音和文字。
  • 热启动(Warm-Start): 先让一个已经精通文字的 AI(比如 LLM)来学声音。
  • 结果: surprisingly,从零开始教(冷启动)效果更好!
  • 比喻: 如果你让一个已经习惯了“书面语”的学霸去学“方言”,他可能会因为太习惯书面语而学不会方言的韵味,甚至把原本会说的方言给忘了。而一张白纸(冷启动)能更纯粹地学会声音和语言的结合,虽然它一开始不懂世界知识,但学声音的能力更强、更稳定

5. 这个模型有多强?(SODA 的表现)

作者训练了一系列从 1 亿参数到 40 亿参数的模型(SODA)。

  • 全能选手: 它不仅能听写(语音转文字),还能朗读(文字转语音),甚至能同声传译(把一种语言的声音直接翻译成另一种语言的声音,还保留原说话人的音色)。
  • 举一反三: 最厉害的是,它不需要为了每个任务重新设计架构。就像同一个大脑,换个指令就能做翻译、做听写、做朗读。
  • 保声翻译: 作者演示了一个很酷的功能:把一段中文语音翻译成英文,但保留中文说话人的声音特征(比如那个人的嗓音、语气)。这就像你让一个人用英语说中文内容,但听起来还是他本人的声音。

总结

这篇论文就像是一份**“音频 AI 的烹饪指南”**:

  1. 食材要新鲜: 用自然对话数据,别只用朗读课文。
  2. 加点佐料: 混入少量纯文字数据,提升逻辑。
  3. 火候要足: 数据量要比模型大小增长得更快。
  4. 从零开始: 别依赖现有的文字大模型,从头训练声音能力更强。

最终,他们造出了一个SODA,它证明了只要方法对,用“下一个词预测”这种简单的方法,就能训练出既能听懂、又能说话、还能翻译的通用音频大脑。这对未来的语音助手、无障碍设备、实时翻译工具都是巨大的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →