← 最新论文
⚡ electrical engineering

Audio Interaction Model

本文介绍了音频交互模型及其实现方案 Audio-Interaction,这是一个统一的流式框架,通过 SoundFlow 系统和 StreamAudio-2M 语料库,将离线任务执行与在线通用音频指令遵循相统一,从而实现了实时的、主动的音频理解与响应。

原作者: Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao Yang, Mingbao Lin, Deheng Ye, Shuicheng Yan, Chunyan Miao

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao Yang, Mingbao Lin, Deheng Ye, Shuicheng Yan, Chunyan Miao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:从“录音机”到“实时聆听者”

想象你有一个录音机。你按下录音键,等待某人讲完整个故事,停止录音,然后问录音机:“他们说了什么?”接着,录音机播放出文本。这就是目前的“大型音频语言模型”(LALMs)的工作方式。它们是离线的:它们会等待整个音频片段结束后才开始行动。

但现实生活并非如此。现实生活是一场现场广播。你在朋友说话的同时,就能听到汽车碰撞声、婴儿哭泣声或朋友的咳嗽声。你不需要等到一天结束了才做出反应;你是即时做出反应的。

这篇论文介绍了一种名为 Audio-Interaction(音频交互) 的新模型。你可以把它想象成将那个录音机升级成了一个超级聪明、始终在线的聆听者,它从不停止关注。它不会等待音频结束;它在聆听、理解的同时,会立即决定现在是该保持沉默还是开口说话。

旧模型的缺陷

作者指出了当前技术的两个主要问题:

  1. 工具过于专业化: 目前,如果你想要一个翻译语音的模型,你需要一个工具;如果你想要一个聊天的模型,你需要另一个;如果你想让它监听玻璃破碎声,你需要第三个。这就像是一个瑞士军刀,但你必须为每一种工作分别携带一把单独的螺丝刀、一把单独的刀和一把单独的剪刀。
  2. “等待”问题: 现在的模型就像一个服务员,站在厨房里等待整个订单被完整写下来后,才开始走向餐桌。在真实的对话中,如果你等那么久,对话早就结束了。

解决方案:“感知-决策-响应”循环

作者创建了一个名为 Audio-Interaction 的新系统,它运行在一个名为 SoundFlow 的框架之上。

把这个模型想象成一个既是保安又是导游的人

  • 循环: 每隔一小段时间(约 0.4 秒),“保安”就会倾听声音。
  • 决策: “保安”会问自己:“这重要吗?”
    • 如果只是背景噪音(如风声或打字声),“保安”保持沉默并继续聆听。
    • 如果是特定的指令(如“翻译这段话”),“保安”会开口进行翻译。
    • 如果是紧急情况(如玻璃破碎或咳嗽),“保安”会立即介入并说:“小心!”或“喝点水吧。”
  • 神奇之处: 它用一个单一的大脑完成了这一切。它不需要不同的工具来处理不同的任务。它只是聆听音频流,并根据听到的内容决定该做什么。

他们是如何构建它的(“SoundFlow”工厂)

为了教会计算机如何做到这一点,作者必须建立一种新型的训练工厂,称为 SoundFlow

  1. 数据 (StreamAudio-2M): 他们不能直接使用旧的录音,因为那些录音太短且太破碎。他们构建了一个庞大的库,包含 260 万个 长时间、连续的音频故事。想象一下,将成千上万个短视频片段缝合成一部无缝衔接的 30 小时长篇电影,其中角色在说话、电话在响、狗在叫,这一切都在一个过程中发生。这教会了模型如何处理真实、杂乱且连续的声音流。
  2. 训练 (理解感知型): 他们教会了模型两项难课:
    • 不要话太多: 如果你听到门关上了,不要说“门关上了”。只有在真正必要时才说话。
    • 记住过去: 如果有人在 10 分钟前提到了一个名字,即使中间穿插了其他声音,模型在稍后被问及时仍需要记得它。
  3. 速度 (FIFO 推理): 为了实现快速响应,他们使用了“先进先出”(First-In-First-Out)系统。想象一条传送带,音频从一端滑入,模型立即对其进行处理,而不会停下来等待下一段。这使得反应时间极快(比之前的方法快了约 4.5 倍)。

它能做什么?

论文展示了该模型可以完成旧模型无法完成的任务:

  • 实时翻译: 它可以在有人说英语的同时将其翻译成中文,而无需等待对方说完整个句子。
  • 主动帮助: 如果它听到玻璃破碎声,它不会等到人类问“那是什么声音?”之后才回答。它会立即说:“我听到玻璃破碎的声音,请小心!”
  • 语境化聊天: 它可以进行一场对话,理解停顿、咳嗽和背景音乐,并决定何时介入以及何时让真人说话。

结果

作者在 8 个不同的挑战上测试了这个模型。

  • 它没有失去聪明才智: 尽管它学会了以“实时模式”工作,但它在标准任务(如识别语音或回答问题)上的表现与旧的“离线”模型一样出色。
  • 它解锁了新的能力: 它现在可以处理以前不可能完成的任务,比如在声音发生的瞬间做出反应,而不是事后反应。

总结

这篇论文呈现了从记录音频到交互音频的转变。Audio-Interaction 不再是一个等待文件传输完毕后再给出答案的模型,而是一个生活在音频流中的模型,它逐秒聆听,时刻决定何时保持沉默、何时开口说话,就像人类在真实对话中那样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →