← 最新论文
⚡ electrical engineering

Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

该论文介绍了 SpeechCombine,这是一种通过将语音适配模型与指令微调文本大语言模型的权重差异直接结合,从而构建出遵循指令的语音语言模型的创新方法,以此在无需大规模语音指令微调数据集的情况下实现强大的组合能力。

原作者: Congrui Du, Yang Zhang, Kaizhi Qian, Shiyu Chang

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Congrui Du, Yang Zhang, Kaizhi Qian, Shiyu Chang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢的图书管理员(一个文本大语言模型),他通晓书籍的一切知识,能回答复杂的问题,也能创作故事。然而,这位管理员从未开口说过话,他们只能通过书写来进行交流。

现在,你想教会这位管理员说话。但问题在于,说话比写作要难得多。像“How are you?”这样的一句话,写出来只需五个单词,但说出来却会持续一秒钟,并包含数百个微小的声音单元(token)。如果你试图通过让管理员阅读数百万小时的有声读物,然后让他们重新学习如何回答问题来教他们说话,他们可能会在这个过程中忘掉原本关于书籍的一切知识。这就是当前 AI 模型面临的“灾难性遗忘”问题。

这篇论文的作者们发现了名为 SPEECHCOMBINE 的巧妙捷径。他们并没有让管理员从头开始重新学习,而是使用了一种名为 “模型合并”(Model Merging) 的技术,这就像是把两种不同的“人格”混合在一起的科学配方。

以下是他们是如何实现的,我用一个简单的类比来说明:

三种原料

想象你有三个不同版本的角色:

  1. 基础管理员(The Base Librarian): 原始的、聪明的纯文本模型。
  2. 健谈的管理员(The Chatty Librarian): 同一个模型,但在经过指令遵循训练后(例如执行“写一首诗”或“解决一道数学题”)。这个版本与基础管理员的区别在于,他们的脑中存在一个代表指令遵循能力的“方向”。
  3. 爱说话的管理员(The Talkative Librarian): 基础管理员,但在仅经过 3 万小时语音数据训练后(没有经过指令训练)。这个版本与基础管理员的区别在于,他们的脑中存在一个代表语音知识的“方向”。

魔法混合

他们并没有从头训练一个新的模型,而是将**“爱说话的管理员”(知道如何说话但不知道如何遵循复杂指令)中的“指令遵循”方向,直接“缝合”到了“健谈的管理员”**身上。

可以这样理解:

  • 你有一辆可以在公路上行驶的汽车(文本模型),但需要更换引擎才能在水上行驶(语音模型)。
  • 你还有另一辆车,它拥有特殊的“GPS 导航系统”(指令遵循)。
  • 与其从头制造一辆全新的两栖载具,不如直接把水上行驶的汽车上的“GPS 导航系统”安装到那辆路面行驶的汽车上。

结果是,这个模型既能进行水上驾驶(说话),又能进行复杂的路线导航(遵循指令),而无需重新学习如何驾驶。

他们声称实现的成就

论文声称这种简单的“缝合”方法效果惊人,尽管他们只使用了极少量的语音数据(3 万小时),而其他模型通常使用数百万小时。

  1. 保留了大脑: 模型没有忘记如何推理、回答问题或解决数学问题。它保留了文本管理员那部分“聪明”的部分。
  2. 学会了说话: 它学会了理解语音问题并生成语音回答。
  3. 可以“边想边说”: 就像它的文本版本可以“在回答前先思考”(这个过程被称为“长思考”)一样,这个语音版本也可以在说话前进行“思考”。论文展示了模型在生成最终语音响应之前,先在“脑海”(文本)中进行推理的过程。
  4. 处理情感: 模型可以根据语调判断说话者是愤怒还是快乐,它甚至可以生成带有特定情感的语音(例如以“惊讶”的语调朗读句子)。

缺陷(局限性)

论文承认该模型尚不完美:

  • 格式错误: 有时模型会对何时在文本和语音之间切换感到困惑,因此研究人员不得不使用一种“强制手段”来使其保持轨道。
  • 音质问题: 模型理解语音的节奏音高,但尚未捕捉到语音的特定音色(即一个人声音的独特特征)或口音。这就像是一个可以带情感说话但听起来像通用机器人的机器人。
  • 外部依赖: 为了理解用户说了什么,它仍然依赖于一个外部工具(语音转文本系统)先将声音转换为文字,然后它才能对其进行“思考”。

总结

简而言之,SPEECHCOMBINE 证明了你不需要用海洋般的语音数据来淹没一个聪明的文本模型,从而教会它说话。你只需要将其说话的能力与其现有的指令遵循能力进行精心的“合并”。这是构建一个既能说话、又像其文本亲戚一样聪明的 AI 的一种更高效的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →