← 最新论文
⚡ electrical engineering

Unified Audio Intelligence Without Regressing on Text Intelligence

本文介绍了 Audex,这是一个基于强大的纯文本混合专家(MoE)骨干网络构建的统一 30B 音频-文本大语言模型,它在实现多种音频和语音任务的最先进性能的同时,能够在不产生显著退化的前提下,保留了原模型的先进推理与智能体能力。

原作者: Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamak
发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:一个不会忘记如何思考的“瑞士军刀”大脑

想象你有一位才华横溢的教授,他精通撰写论文、解决复杂的数学难题以及编写软件代码。这位教授就是你的纯文本 AI。现在,想象你想教这位教授同时也理解音乐、识别鸟鸣,并用人类的声音与你对话。

通常情况下,当你教一位天才学习一项新技能(比如杂耍)时,他们可能会在原本擅长的专业工作(比如写作)上变得有些笨拙。因为大脑正忙于学习新把戏,他们可能会开始出现语法错误或遗忘事实。

这篇论文介绍了 “Audex”,一种全新的 AI 模型,它在学习处理音频和语音的同时,并不会丧失清晰思考的能力。

研究人员在名为 Nemotron-Cascade-2 的非常聪明的纯文本大脑之上构建了 Audex。他们的目标很简单:打造一个能够听、说、理解声音,但绝不会丧失推理、解题或遵循指令能力的 AI。

工作原理:“通用翻译器”妙招

大多数处理声音的 AI 模型就像是两个手拉手的人:一个人负责听,另一个人负责说。如果他们之间的沟通不够完美,结果就会变得混乱。

Audex 则不同。它是一个统一的、单一的大脑。它是如何同时处理这一切的呢?

  1. 耳朵(音频编码器): 当 Audex 听到一种声音(如狗吠或某人说话)时,它不会立即尝试理解原始声波。相反,它使用一个专门的“翻译器”(音频编码器),将声音转化为一组数字,这些数字看起来就像 AI 已经掌握的文字一样。
  2. 大脑(大语言模型/LLM): 这些数字被输入到主大脑中。因为大脑将它们视为“Token”(类似于单词),所以它对待一段音频片段的方式,与对待一段文本句子完全相同。
  3. 嘴巴(音频编解码器): 当 Audex 想要说话或发出声音时,它不仅仅是在“思考”词汇;它是在预测序列中的下一个“声音 Token”,就像它预测句子中的下一个单词一样。

类比: 想象一位通常只用文字食谱烹饪的厨师。Audex 就像是教会这位厨师使用“声音食材”进行烹饪。它不需要为声音准备一个独立的厨房,而是直接将声音食材翻译成厨师已经掌握的语言。这样,厨师就可以在不忘记如何烘焙“文字蛋糕”的情况下,烹饪出一锅“声音汤”。

秘诀:在不破坏大脑的前提下进行训练

研究人员面临着一个巨大的挑战:如果你对一个聪明的文本 AI 进行过度的音频训练,它可能会变得不再聪明。为了防止这种情况,他们使用了一套严谨的、循序渐进的训练方案:

  • 热身阶段: 首先,他们教 AI 如何处理“声音食材”(音频 Token),而不改变其核心知识。
  • 分层学习: 他们没有一次性把所有东西都塞给 AI。他们先教它生成声音,然后教它理解声音,最后将两者结合起来。这就像是在尝试骑单轮车之前,先学习骑带辅助轮的自行车。
  • “无退化”承诺: 在完成所有训练后,他们测试了 AI 的旧技能(数学、逻辑、编程)。结果令人震惊:Audex 在这些任务上的表现与原始的纯文本版本一样出色。 它在获得听觉和说话能力的同时,完全没有损失原有的“天才”智力。

Audex 究竟能做什么?

根据论文所述,Audex 是音频领域的“瑞士军刀”。它可以:

  • 倾听与理解: 它可以回答关于它所听到内容的问题(例如:“那是狗叫还是狼嚎?”或者“这段音乐的情绪如何?”)。
  • 转录与翻译: 它可以将口语转化为文本,并将其翻译成其他语言,即使是在嘈杂的房间里。
  • 说话与歌唱: 它可以根据文本提示生成类人语音,甚至可以创作音乐和音效(如“下雨声”或“鸟鸣声”)。
  • 语音对语音: 它可以接收语音输入并生成不同的语音输出(语音转语音)。

结果:两全其美

论文将 Audex 与其他顶尖 AI 模型进行了对比。

  • 在文本方面: 它的表现与最聪明的纯文本模型一样出色,能够解决复杂的数学和逻辑谜题,性能没有任何下降。
  • 在音频方面: 它在识别语音和理解通用声音方面超越了许多其他模型。
  • “思考”模式: 不同于某些在试图思考和说话时会变“笨”的模型,Audex 可以针对声音问题进行“思考”(推理),然后一次性生成音频答案。

总结

这篇论文展示了 Audex,它证明了你无需在成为“聪明的思考者”和“优秀的听者/说者”之间做选择。通过将声音视为另一种类型的语言,研究人员构建了一个单一的 AI,它能以同等的卓越水平进行听、说和推理,在掌握声音世界的过程中,完整保留了其原有的智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →