← 最新论文
💬 NLP

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

本文提出了“成对输入、成对输出”(PIPO)框架,该统一框架将潜在输入压缩与多令牌输出预测相结合,并引入轻量级的基于置信度的接受机制,从而在不增加独立验证器通道的开销的情况下,显著提升大语言模型的推理速度并改善其推理性能。

原作者: Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)是一位非常聪明但极其缓慢的抄写员,他一次只写一个单词来创作故事。要解决一道高难度的数学题或编写复杂的代码,这位抄写员需要大声思考,在写下最终答案之前生成一条长长的“思维链”。问题在于,写一个单词、停下来思考、再写下一个单词的过程极其缓慢且昂贵。

这篇论文介绍了一种名为PIPO(Pair-In, Pair-Out,成对输入、成对输出)的新方法,旨在让这位抄写员变得快得多,同时不增加错误率。以下是其工作原理,使用了简单的类比:

1. 问题:“一步一个脚印”的瓶颈

目前,这位抄写员的工作方式就像一个人使用打字机:打一个字母,按“回车”,等待机器处理,再打下一个字母,如此循环。即使抄写员很聪明,机器也很慢,因为它每个周期只能处理一个字母。

2. 解决方案:“双层”巴士(PIPO)

PIPO 改变了交通规则。PIPO 不再让抄写员一次处理一个单词,而是让他们一次处理两个单词

  • 成对输入(压缩): 想象抄写员收到了一叠两个字母(例如"T"和"h")。特殊“压缩机”不是将它们分别送入机器,而是将它们折叠成一个紧凑的包裹(潜在表示)。这就像将一张大地图折叠成一个小方巾,以便它能穿过一扇窄门。
  • 旅程: 机器处理这个单一的“折叠”包裹。
  • 成对输出(展开): 一旦机器处理完毕,它不会只吐出一个字母。它拥有一个特殊的“展开”头部,接收结果并立即生成两个字母:预期的下一个单词和一个预测的草稿单词(例如"e"和" ")。

结果: 现在,抄写员在每个机器周期内能写出两个字母。这实际上使书写速度提高了一倍。

3. 风险:“猜谜游戏”

这里有一个陷阱。预测第二个单词是一种猜测。如果猜错了,整个句子可能会变得毫无意义。

  • 旧方法(推测解码): 以前,为了检查猜测是否正确,抄写员必须停下来,运行一个庞大的“验证”测试(就像高级编辑重新阅读整个草稿),然后决定猜测是否有效。这个验证步骤太慢了,以至于抵消了速度提升。
  • PIPO 的方法(置信度头部): PIPO 在抄写员旁边安装了一个微小、超快的“置信度计”。这个仪表经过训练,可以查看这两个单词并立即说出:“我有 95% 的把握第二个单词是正确的”,或者“我不确定,跳过它”。
    • 如果仪表说"通过",抄写员就保留这两个单词。
    • 如果仪表说"不行",抄写员保留第一个单词,并用“空白”(填充)替换第二个单词,以保持节奏继续。

4. 秘诀:从错误中学习(在线策略蒸馏)

“置信度计”是如何在没有缓慢编辑的情况下学会如此准确的呢?

论文使用了一种巧妙的训练技巧,称为在线策略蒸馏

  • 想象抄写员(学生)尝试写一个故事。
  • 一位超级聪明的老师(一个更大的预训练模型)也写这个故事。
  • 系统将学生的猜测与老师的答案进行比较。
  • 魔法: 系统意识到,“老师”正在做与旧方法中“编辑”完全相同的工作。因此,系统不是每次运行缓慢的编辑检查,而是利用老师的答案在学习阶段训练微小的“置信度计”。
  • 一旦训练完成,置信度计就知道何时该信任猜测,何时该谨慎,而无需在实际写作过程中依赖缓慢的编辑。

5. 结果:更快且更聪明

论文在困难的数学和编码任务(如 AIME 数学竞赛和编码基准测试)上测试了这种方法。

  • 速度: 因为它一次处理两个单词并跳过了缓慢的编辑检查,PIPO 比标准方法快 2 到 2.6 倍。它能更快地输出第一个单词,并保持流程顺畅。
  • 准确性: 令人惊讶的是,它不仅变得更快,而且变得更好。通过将更多的“思考”压缩到相同的空间内(因为它压缩了输入),该模型能够生成更长、更完整的推理链。在某些测试中,与正常方法相比,成功率提高了 7 个百分点以上。

总结

PIPO 就像将一辆送货卡车从单车道道路升级到双车道高速公路。

  1. 压缩货物(输入),将两个包裹塞进一个槽位。
  2. 一次性交付两个包裹(输出)。
  3. 使用智能传感器(置信度头部)来决定第二个包裹是否安全保留,该传感器由一位已经知道答案的老师进行训练。

这使得 AI 能够思考得更久,回答得更快,在解决复杂问题时避免了通常的减速。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →