Unified Audio Intelligence Without Regressing on Text Intelligence
本文介绍了 Audex,这是一个基于强大的纯文本混合专家(MoE)骨干网络构建的统一 30B 音频-文本大语言模型,它在实现多种音频和语音任务的最先进性能的同时,能够在不产生显著退化的前提下,保留了原模型的先进推理与智能体能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:一个不会忘记如何思考的“瑞士军刀”大脑
想象你有一位才华横溢的教授,他精通撰写论文、解决复杂的数学难题以及编写软件代码。这位教授就是你的纯文本 AI。现在,想象你想教这位教授同时也理解音乐、识别鸟鸣,并用人类的声音与你对话。
通常情况下,当你教一位天才学习一项新技能(比如杂耍)时,他们可能会在原本擅长的专业工作(比如写作)上变得有些笨拙。因为大脑正忙于学习新把戏,他们可能会开始出现语法错误或遗忘事实。
这篇论文介绍了 “Audex”,一种全新的 AI 模型,它在学习处理音频和语音的同时,并不会丧失清晰思考的能力。
研究人员在名为 Nemotron-Cascade-2 的非常聪明的纯文本大脑之上构建了 Audex。他们的目标很简单:打造一个能够听、说、理解声音,但绝不会丧失推理、解题或遵循指令能力的 AI。
工作原理:“通用翻译器”妙招
大多数处理声音的 AI 模型就像是两个手拉手的人:一个人负责听,另一个人负责说。如果他们之间的沟通不够完美,结果就会变得混乱。
Audex 则不同。它是一个统一的、单一的大脑。它是如何同时处理这一切的呢?
- 耳朵(音频编码器): 当 Audex 听到一种声音(如狗吠或某人说话)时,它不会立即尝试理解原始声波。相反,它使用一个专门的“翻译器”(音频编码器),将声音转化为一组数字,这些数字看起来就像 AI 已经掌握的文字一样。
- 大脑(大语言模型/LLM): 这些数字被输入到主大脑中。因为大脑将它们视为“Token”(类似于单词),所以它对待一段音频片段的方式,与对待一段文本句子完全相同。
- 嘴巴(音频编解码器): 当 Audex 想要说话或发出声音时,它不仅仅是在“思考”词汇;它是在预测序列中的下一个“声音 Token”,就像它预测句子中的下一个单词一样。
类比: 想象一位通常只用文字食谱烹饪的厨师。Audex 就像是教会这位厨师使用“声音食材”进行烹饪。它不需要为声音准备一个独立的厨房,而是直接将声音食材翻译成厨师已经掌握的语言。这样,厨师就可以在不忘记如何烘焙“文字蛋糕”的情况下,烹饪出一锅“声音汤”。
秘诀:在不破坏大脑的前提下进行训练
研究人员面临着一个巨大的挑战:如果你对一个聪明的文本 AI 进行过度的音频训练,它可能会变得不再聪明。为了防止这种情况,他们使用了一套严谨的、循序渐进的训练方案:
- 热身阶段: 首先,他们教 AI 如何处理“声音食材”(音频 Token),而不改变其核心知识。
- 分层学习: 他们没有一次性把所有东西都塞给 AI。他们先教它生成声音,然后教它理解声音,最后将两者结合起来。这就像是在尝试骑单轮车之前,先学习骑带辅助轮的自行车。
- “无退化”承诺: 在完成所有训练后,他们测试了 AI 的旧技能(数学、逻辑、编程)。结果令人震惊:Audex 在这些任务上的表现与原始的纯文本版本一样出色。 它在获得听觉和说话能力的同时,完全没有损失原有的“天才”智力。
Audex 究竟能做什么?
根据论文所述,Audex 是音频领域的“瑞士军刀”。它可以:
- 倾听与理解: 它可以回答关于它所听到内容的问题(例如:“那是狗叫还是狼嚎?”或者“这段音乐的情绪如何?”)。
- 转录与翻译: 它可以将口语转化为文本,并将其翻译成其他语言,即使是在嘈杂的房间里。
- 说话与歌唱: 它可以根据文本提示生成类人语音,甚至可以创作音乐和音效(如“下雨声”或“鸟鸣声”)。
- 语音对语音: 它可以接收语音输入并生成不同的语音输出(语音转语音)。
结果:两全其美
论文将 Audex 与其他顶尖 AI 模型进行了对比。
- 在文本方面: 它的表现与最聪明的纯文本模型一样出色,能够解决复杂的数学和逻辑谜题,性能没有任何下降。
- 在音频方面: 它在识别语音和理解通用声音方面超越了许多其他模型。
- “思考”模式: 不同于某些在试图思考和说话时会变“笨”的模型,Audex 可以针对声音问题进行“思考”(推理),然后一次性生成音频答案。
总结
这篇论文展示了 Audex,它证明了你无需在成为“聪明的思考者”和“优秀的听者/说者”之间做选择。通过将声音视为另一种类型的语言,研究人员构建了一个单一的 AI,它能以同等的卓越水平进行听、说和推理,在掌握声音世界的过程中,完整保留了其原有的智能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。