← 最新论文
💬 NLP

K-Forcing: Joint Next-K-Token Decoding via Push-Forward Language Modeling

K-Forcing 是一种新颖的推前(push-forward)语言建模范式,通过将教师模型蒸馏为能够通过单次前向传递联合解码多个未来标记的条件映射,从而加速自回归文本生成,在仅有轻微质量下降的情况下,实现了高负载批处理服务下的显著推理加速。

原作者: Zhiwei Tang, Yuanyu He, Yizheng Han, Wangbo Zhao, Jiasheng Tang, Fan Wang, Bohan Zhuang

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiwei Tang, Yuanyu He, Yizheng Han, Wangbo Zhao, Jiasheng Tang, Fan Wang, Bohan Zhuang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图写一个故事,但你有一位非常严格且才华横溢的编辑(AI 模型),她只允许你一次只能写一个词

每当你写下一个词,你都必须停下来,把纸递给编辑,等待她读完整个句子,思考下一个词,然后再把纸递回来。然后你写下下一个词,停下,重复这个过程。

这就是目前的 AI(被称为自回归或“AR”模型)的工作方式。它非常聪明,但因为陷入了这种“走走停停”的节奏而变得很慢。如果你想写一个长篇故事,你必须进行成千上上的次往返编辑的桌前。

问题所在:“一次一个词”的瓶颈

论文指出,这种“一次一个词”的方法就像是用小勺子去填满一个游泳池。即使这把勺子很快,整个过程也会受到你往返次数的限制。用计算机术语来说,AI 在进行下一次计算(勺子)之前,必须等待内存(池子)准备就绪。这导致了效率低下,尤其是在许多人同时尝试生成文本时。

旧的解决方案:为什么它们并不完全奏效

科学家们尝试通过两种主要思路来解决这个问题,但两者都有缺陷:

  1. “草拟与检查”法(投机采样/Speculative Decoding): 想象一个学生试图猜测接下来的几个词,然后由老师进行检查。如果老师同意,那就太好了!如果不同意,学生就必须从头开始。
    • 缺陷: 有时学生猜对了 5 个词,有时只猜对了 1 个。这打乱了进度表。当你有一群人在做这件事时,每个人都会失去同步,系统再次变慢。
  2. “扩散”法(Diffusion Method): 想象你正在通过从空白画布开始并逐渐揭示部分内容的方式来画一幅画,但试图同时猜测多个部分。
    • 缺陷: 论文声称,独立地猜测多个部分(比如分别猜测天空和草地)往往会导致一幅混乱的画作,其中天空和草地无法匹配。为了得到完美的画作,你通常仍需一次揭示极小的一部分,这反而抵消了提速的初衷。

新的解决方案:K-Forcing(“神奇蓝图”)

作者引入了 K-Forcing。与其向编辑索要一个词,不如教 AI 查看一张神奇蓝图,并在单次运行中同时写出多个词(例如 4 个词)。

以下是他们实现这一目标的方法,使用了一个简单的类比:

1. “前推”地图(蓝图)
想象你有一个机器,它可以将一个随机数(比如掷骰子)瞬间转化为一个特定的句子。

  • 旧方法: 你掷一次骰子,得到“3”,机器说“那个(The)”。然后你再掷一次,得到“5”,机器说“猫(cat)”。
  • K-Forcing 方法: 你同时掷四个骰子。机器查看蓝图并说:“好吧,这四个数字对应短语‘那只猫坐下了(The cat sat down)’。”它能瞬间输出所有四个词。

2. 如何获得蓝图?(渐进式自我强迫/Progressive Self-Forcing)
你不能只是瞎猜蓝图;它必须是完美的。因此,他们使用了一种“教师-学生”游戏:

  • 步骤 1: 他们采用缓慢但完美的“教师”AI。他们给它一个随机数,并让它写一个词。他们记录下这对组合:“随机数 0.45” = “那个(The)”。
  • 步骤 2: 他们训练一个“学生”AI 来学习这种联系。
  • 步骤 3(神奇技巧): 一旦学生学会了写 1 个词,他们就利用这个学生来教自己如何写 2 个词。接着,他们利用 2 个词的学习成果去教自己如何写 4 个词。
  • 为什么这很重要: 与其试图一次性学习整个复杂的规则,不如循序渐进地构建它,就像在脱掉辅助轮之前先学习骑自行车一样。

3. 结果:“批处理”超能力
因为 K-Forcing 每次运行时总是产生固定数量的词(例如,每次恰好是 4 个),所以计算机不会感到困惑。它可以安排 100 个人排队,每个人都能在同一时刻获得他们的 4 个词。

  • 速度: 论文显示,在处理大量请求时,这使得 AI 的速度提升了 2.4 到 3.5 倍
  • 质量: 生成的文本比缓慢的“教师”稍逊一筹(可能只有 5% 的质量下降),但仍然非常出色,而且速度增益巨大。

总结

可以将 K-Forcing 理解为将快递员从“一次只送一个包裹”升级为“一次性卸下一整托盘包裹的货运卡车”。它并没有改变交付的内容(单词),但它改变了交付的方式,使得整个系统在繁忙时期更加快速高效。

论文证明了,通过改变 AI 对未来进行“思考”的方式(预测一组词而不是单个词),我们可以在不需要新硬件的情况下获得巨大的速度提升。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →