← 最新论文
💬 NLP

FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration

FlexDraft 是一种无损推测解码框架,它通过结合用于高质量块扩散草稿的注意力微调、用于解决草稿验证不匹配的奖励引导校准,以及在并行与顺序执行模式之间进行优化的动态切换机制,从而加速不同批量大小下的大语言模型推理。

原作者: Yaojie Zhang, Jianuo Huang, Junlong Ke, Yuhang Han, Yongji Long, Tianchen Zhao, Biqing Qi, Linfeng Zhang

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaojie Zhang, Jianuo Huang, Junlong Ke, Yuhang Han, Yongji Long, Tianchen Zhao, Biqing Qi, Linfeng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试撰写一个长篇故事,但你有一位非常严格的编辑(即目标模型),他极其聪明,但行动非常缓慢,因为他必须在写下每一个字之前检查前一个字。这使得撰写故事的过程变得无比漫长。

为了加快速度,你雇佣了一位快速、精力充沛的助手(即起草模型)来为你猜测接下来的几个词。助手会提前写好一整段,然后这位缓慢的编辑会快速检查这些猜测是否正确。如果猜测正确,你就可以跳过编辑对这些字词的缓慢思考时间。这被称为推测解码

然而,旧有的实现方式存在两个大问题:

  1. 等待游戏:助手写下一个猜测,然后等待编辑完成检查后,才写下一个猜测。他们轮流进行,浪费了时间。
  2. “如果”的困惑:在更新、更快的方法中,助手试图同时写出多个不同的未来段落,希望能覆盖所有可能性。但助手并不知道编辑最终会批准哪一段。这导致助手浪费精力去写那些被丢弃的段落,而编辑则不得不检查过多的选项,当你要同时撰写许多故事(即大批量处理)时,这又会再次拖慢整体速度。

引入 FlexDraft:智能、灵活的助手

这篇论文介绍了FlexDraft,这是一个新系统,旨在解决这些问题,让你在不降低质量的前提下写得更快。以下是其工作原理,使用简单的类比来说明:

1. “特制眼镜”(注意力微调)

通常,为了让助手更擅长猜测,你必须重新训练他们的大脑,这既昂贵又有风险(可能会导致他们忘记如何正确表达)。

FlexDraft 则不同。它只在助手思考的最后几步中,为其眼睛戴上一副“特制眼镜”。

  • 工作原理:助手保留其所有原始知识(冻结的大脑),但学会利用这些新眼镜来观察“空白处”(掩码令牌)并一次性填充它们。
  • 好处:助手变成了一个快速、并行的猜测者,而无需进行完整的大脑移植。它保持与编辑风格一致,因此猜测质量高且安全。

2. “魔法便签”(奖励引导校准)

这里是棘手之处:当编辑检查助手的猜测时,有时编辑会说:“不,那个词错了,但这里是正确的起始词。”这个正确的词被称为奖励令牌

在旧的“快速”方法中,助手必须在看到这张“魔法便签”之前就猜出下一个段落。因此,助手可能会猜一个关于海盗的故事,而编辑想要的却是一个关于厨师的故事。由于没有便签,助手的猜测就错了。

FlexDraft 增加了一个魔法便签系统:

  • 工作原理:一旦编辑揭示了奖励令牌,FlexDraft 就会使用一个微小、快速的计算器,立即调整助手之前的猜测,以匹配这个新方向。
  • 好处:即使助手最初是盲目猜测,系统也能迅速“引导”猜测以符合编辑的修正。这意味着更少的猜测会被拒绝。

3. “交通警察”(灵活解码)

旧有“快速”方法的最大问题在于,它们试图同时写出所有可能的未来故事。如果你只写一个故事(小批量),这没问题。但如果你要同时写 16 个故事(大批量),助手就会因试图为每个故事写出 16 种不同的未来而应接不暇,编辑也会因检查所有选项而陷入停滞。

FlexDraft 就像一位聪明的交通警察

  • 小流量(小批量):当故事很少时,交警会说:“出发!同时写出所有可能的未来!”这将写作和检查重叠起来以节省时间。
  • 大流量(大批量):当故事很多时,交警会说:“停下!不要写出所有可能性。只写出最有可能被批准的那一个。”
  • 好处:它自动切换策略。当系统繁忙时,它避免了因写出过多选项而造成的“精力浪费”,防止速度崩溃。

结果

通过结合这三种技巧,FlexDraft 让缓慢的编辑能够更快地处理文本。

  • 无质量损失:最终的故事与缓慢编辑逐字撰写出来的完全一样。
  • 巨大加速:在针对流行 AI 模型(Qwen3-8B)的测试中,FlexDraft 使系统的速度比标准的缓慢方法快 4.59 倍
  • 可扩展性:无论你是在写一个故事还是管理一大群故事,它都能良好运作,而之前的方法在人群变大时会变得缓慢且笨拙。

简而言之,FlexDraft 是一种灵活且无损的方式,让快速助手协助缓慢编辑,确保他们顺畅协作,既不浪费时间也不犯错。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →