← 最新论文
💬 NLP

Liberating LLM Capabilities in Full-Duplex Speech Models

本文介绍了听、写、说(Listen-Write-Speak, LWS),这是一种新颖的文本优先三通道范式,它使全双工语音模型能够在无需架构变更的情况下,通过共享的自回归大语言模型同时进行实时倾听、编写可见的结构化文本以及进行语音表达,从而在保持对话响应性的同时,解锁代码生成和结构化推理等文本原生能力。

原作者: Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在与一位才华横溢且也是打字高手的高级同事开会。目前,大多数 AI 语音助手就像那些只会说话的同事。如果你要求它们编写一段复杂的计算机程序或绘制一张详细的图表,它们必须通过口头描述来完成:“好的,先从一个函数开始,然后定义一个变量……”这既缓慢又难以跟进,而且如果你想保留这些内容,还得自己动手记录下来。

这篇论文介绍了一种全新的 AI 对话方式,称为**“听、写、说”(Listen-Write-Speak, LWS)**。把这种新的 AI 想象成一位同时完美同步完成三件事的同事:

  1. 听(Listen): 它们能实时倾听你的谈话,甚至在它们说话的同时也在倾听。
  2. 写(Write): 在倾听和思考的同时,它们会同步将想法、代码或结构化笔记打在面前的屏幕上。
  3. 说(Speak): 与此同时,它们会用自然、对话式的语言对正在输入的内容进行简要总结,让你能听懂答案。

“三车道高速公路”类比

作者将其描述为一种**“三通道范式”**。想象一条三车道的高速公路,车流朝着一个方向流动(即对话的时间线):

  • 第一车道(倾听): 这条车道始终开启。即使在说话时,AI 也从未停止倾听。这实现了“全双工”交互,意味着你可以随时打断 AI,它不会感到困惑或停止处理。
  • 第二车道(可见书写): 这是“思考”车道。与其将想法隐藏在黑盒子里,AI 会在屏幕上将其打出来。如果你要求一段 Python 脚本,代码会立即出现在屏幕上;如果你要求一份会议摘要,一个整齐的表格就会出现。这是“一等输出”,意味着它是 AI 展示其工作的主要方式。
  • 第三车道(说话): 这条车道承载声音。AI 会朗读其输入内容的简化版,这样你在阅读细节的同时也能听到答案。

它是如何运作的(魔术技巧)

论文声称,这并不需要构建一个全新的、复杂的机器人大脑。相反,他们使用了一种巧妙的**“标记模式”(Token Schema)**。

把 AI 的内部语言想象成一套乐高积木。通常,这些积木只能构建语音。研究人员发明了特殊的“指令积木”(例如 <unit><ls_cogn><speak>),用来告诉 AI:“现在,你处于一个 1 秒钟的时间块内。在这个块中,你必须倾听这段音频,输入这段文本,并说出这句话。”

通过将对话组织成这些微小的 1 秒钟“时间块”(Unit),AI 可以同时处理所有三项任务而不会发生混乱。这就像一位指挥家在告诉管弦乐队:“在接下来的这一秒钟里,小提琴演奏、长笛吹奏,同时打击乐手敲击鼓点,这一切都在同一时刻发生。”

他们的发现

研究人员将这种新型 AI 与其他语音模型进行了对比测试,发现:

  • 它是更好的多任务处理者: 在衡量 AI 在说话时理解和推理能力的测试中,LWS 的得分高于那些仅能说话或在说话前先进行思考的模型。
  • 它具有一致性: AI 不会出现所说与所写不符的情况。在 92.6% 的案例中,它所说的内容与其书写的内容完全匹配。
  • 它能很好地处理中断: 由于它在说话时仍保持倾听,如果你打断它,它可以平滑地处理这种变化,而不会崩溃或停下来等待你讲完。

核心结论

论文指出,通过让 AI 在说话的同时书写其想法,我们得到了两者的最佳结合:语音对话的速度和自然感,以及书面文本(如代码或数据表)的精确性和结构性。它将 AI 从一个“会说话的脑袋”转变为一个“协作伙伴”,能够边做边展示其工作过程。

注:关于局限性: 作者承认,由于 AI 必须实时完成所有这些操作(每秒钟都要进行),它可能并不擅长处理那些需要长时间深度思考才能开口的极其复杂、漫长的规划任务。此外,目前它仅接受语音输入,暂不支持图像或文件。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →