← 最新论文
💬 NLP

SpecTr-GBV: Multi-Draft Block Verification Accelerating Speculative Decoding

本文介绍了 SpecTr-GBV,这是一种新颖的推测解码框架,通过将令牌验证构建为最优传输问题,统一了多草稿生成与贪婪块验证,从而在保持输出质量的同时实现了理论上的最优接受长度和卓越的实证加速。

原作者: Yijun Lin, Jinhao Sheng, Qingyue Cai, Feng Zhou

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijun Lin, Jinhao Sheng, Qingyue Cai, Feng Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试撰写一个长篇故事,但你有一位非常严格的编辑(目标模型),他极其聪明,但行动非常缓慢。每次你想添加一个新词时,都必须等待这位编辑重新阅读整句话,并决定这个词是否合适。这导致故事的写作过程变得无比漫长。

推测解码是一种巧妙的技巧,旨在加速这一过程。你雇佣了一位快速且精力充沛的实习生(草稿模型)来为你猜测接下来的词语。随后,编辑会快速检查这些猜测。如果猜测正确,编辑会说“好!”,然后你们继续前进。如果猜测错误,编辑会进行修正。这种方法节省了时间,因为实习生可以一次性猜测多个词,而编辑只需偶尔承担大部分工作。

现有方法的问题

文章强调,目前用于这种“实习生”系统的现有方法存在两个主要缺陷:

  1. “逐个”问题:某些方法要求实习生做一个猜测,进行验证,然后再做下一个猜测。这非常缓慢。
  2. “单一实习生”问题:其他方法要求实习生撰写整个段落,但他们只有一个实习生。如果这位实习生在段落开头犯了一个错误,整个段落都会被丢弃,你必须重新开始。

一些研究人员试图通过雇佣多个实习生(多草稿)来撰写接下来词语的不同版本,希望至少有一个是正确的,从而解决这个问题。另一些人则尝试一次性验证整个段落(块验证),而不是逐个词验证。但到目前为止,还没有人成功将多个实习生整段验证结合起来。

解决方案:SpecTr-GBV

作者提出了一种名为SpecTr-GBV的新系统。你可以将其想象为一个拥有全新工作流程的超高效编辑团队:

  1. 实习生“小队”:他们不再雇佣单个实习生,而是雇佣一支由KK名实习生组成的小队。每位实习生都撰写自己版本的接下来词语(即一份“草稿”)。
  2. “块”验证:编辑不再逐个检查第 1 个词、第 2 个词、第 3 个词,而是同时检查所有实习生提供的整个“词块”。
  3. “最佳适配”选择:编辑使用一种数学策略(称为最优传输,类似于一种智能匹配游戏),找出任何一位实习生正确生成的最长词序列。

类比
想象你正试图通过跳石过河。

  • 旧方法:你让一个人猜测石头的位置。你一次跳一块石头。如果你跳错了,就会掉进水里,必须重新开始。
  • 新方法(SpecTr-GBV):你让五个人猜测石头的位置。你一起审视这五个猜测。你找出任何人正确猜测的最长石头路径。你沿着这条路径尽可能远地跳跃。如果你仍然无法一次性渡过整条河,你只需跳到下一个安全位置,并请求新的猜测。

为什么这更好

文章声称,这种新方法是“最优”的行事方式。以下是用通俗法语解释的含义:

  • 最大成功:理论上,该方法被证明能获得最长的可接受词“序列”。如果不改变实习生们的工作方式,你无法做得更好。
  • 更多实习生 = 更快:你雇佣的实习生越多(生成的草稿越多),正确词的序列就越长。这就像在问题上有更多的眼睛;有人猜对下一个正确词的几率就会增加。
  • 无质量损失:即使速度更快,最终的故事也是以与那位缓慢编辑独自完成时完全相同的方式写成的。质量不会下降。

结果

作者在五种不同类型的任务上(如编写代码、解决数学问题和撰写故事)使用不同的 AI 模型测试了这种方法。

  • 更快:他们的方法比标准做法显著更快。在某些情况下,它比之前的最佳方法快了近30%
  • 更高效:它成功地在每秒内接受了更多正确的词,这意味着缓慢编辑的工作量减少了。
  • 稳健:即使他们修改了参数(例如允许实习生使用的“创造力”水平),该方法依然表现良好。

总之,SpecTr-GBV是一种更智能的方式,利用快速助手来协助缓慢的专家,确保你充分利用助手所做的每一次猜测,从而在不损失任何质量的情况下实现更快的写作过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →