← 最新论文
💬 NLP

ProactiveLLM: Learning Active Interaction for Streaming Large Language Models

ProactiveLLM 引入了一种用于大语言模型流式传输的新型框架,该框架通过利用通过基于掩码的流式建模和同步特权自蒸馏所学习到的内生语义充分性线索,实现了主动交互决策,从而在不依赖外部对齐信号的情况下降低了延迟和计算量。

原作者: Junlong Tong, Yao Zhang, Anhao Zhao, Yingqi Fan, Yunpu Ma, Xiaoyu Shen

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Junlong Tong, Yao Zhang, Anhao Zhao, Yingqi Fan, Yunpu Ma, Xiaoyu Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图与一位非常聪明但有点刻板的朋友聊天。

旧的方式:那个“非要等我说完”的朋友
标准的语言大模型(LLM)就像那样一个朋友,坚持要听完你讲述的整个故事后才肯说一句话。你跟他们讲了一天的经历,他们就坐在那里默默吸收每一个细节,直到你终于说出“讲完了”。只有在那时,他们才会开口说话。

  • 问题所在: 这太慢了。如果你正在观看流媒体视频或进行实时聊天,等待整个过程结束的感觉就像是在对着一堵墙说话。这也浪费了脑力,因为他们可能在听到第一句话时就已经掌握了答案,但却强迫自己听完那长达一小时的故事。

目前的“流式传输”尝试:那个“固定计时器”的朋友
一些更新的模型试图变得更快。他们会在你说话的同时开始回应。但他们有点笨拙。他们通常遵循严格的规则,比如:“我要听完整整 5 个词,然后说点什么。然后再听 5 个词,再说点什么。”

  • 问题所在: 这就像一个带着节拍器的机器人。有时 5 个词足以知道答案,但机器人却非要再等 5 个词;有时你需要 50 个词才能理解这个笑话,但机器人却过早地开口说话,说了些傻话。为了解决这个问题,工程师通常需要手动编写这些规则,或者使用昂贵的“老师”来告诉模型何时该说话。

新的解决方案:ProactiveLLM(那位“直觉敏锐”的朋友)
这篇论文介绍了 ProactiveLLM,它通过学习倾听自己的“直觉”(内部状态)来决定何时说话。它不再遵循计时器或人工规则,而是学会了自问:“我现在掌握的信息是否足以给出一个好的回答?”

它是如何变得如此直觉敏锐的呢?它使用了两个聪明的训练技巧:

1. “蒙眼游戏”(掩码流式建模)

想象你在玩一个猜故事结局的游戏,但你每次只能看到随机出现的几个句子。

  • 运作方式: 在训练期间,模型会被展示一个故事,但其中的部分内容被隐藏了(被掩码处理)。它必须学会仅根据它能看到的这些碎片来理解情节并预测接下来的内容。
  • 结果: 这迫使模型成为一名识别“线索”的专家。它学会了识别出这样一个时刻:即它所看到的线索已经足以做出一个自信的猜测,而无需看到整本书。

2. “自我反思”技巧(同步特权自我蒸馏)

通常,要教一个学生变聪明,你需要一个了解整个故事的老师。但在这里,模型是在“自我教学”。

  • 运作方式: 模型同时运行两个版本的自己:
    • 学生: 只看部分故事(流式数据)。
    • 老师: 看见整个故事(全上下文)。
    • “老师”(实际上是同一个模型,只是观察的数据更多)向“学生”低声诉说正确答案。“学生”试图仅利用有限的线索,来匹配“老师”的置信度。
  • 结果: 模型学会了信任自己的内部信号。它意识到:“啊,当我看到这些特定的词时,我的内部置信度就和我已知全部信息时的表现一致了。”这给了它一个内置的“充分性检测器”。

“即插即用”的决策头

一旦模型拥有了这种内部“直觉”,论文中加入了一个简单的开关(决策头),它就像一个红绿灯。

  • 绿灯(写): 模型的内部置信度很高。它开始说话!
  • 红灯(读): 模型仍然感到困惑。它继续倾听。
  • 为什么很酷: 你可以为这个决策头更换不同的类型(例如,一个关注模型有多“惊讶”,或者一个关注模型投入了多少注意力的决策头)。模型本身不需要重新训练;它只需要一个新的“红绿灯”。

结果:更快、更聪明

论文在文本(如语言翻译或问答)和语音(如音频转录)上进行了测试。

  • 优势: ProactiveLLM 比旧有的“等待结束”模型说话速度更快。
  • 质量: 它并没有牺牲质量。事实上,对于那些答案并不完全按照单词出现顺序排列的难题(非单调任务),它的表现几乎与那些缓慢的全上下文模型一样出色,但仅使用了大约 78% 的输入量
  • 类比: 这就像一名侦探,在找到关键证据后就能破案,而不是非要等到整份警察报告写完才做出结论。

简而言之: ProactiveLLM 教会了 AI 停止等待许可,开始信任自己何时已经听够了可以开口说话。它让流式对话变得自然、响应迅速且高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →