← 最新论文
💻 computer science

JetFlow: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting

JetFlow 是一种新颖的投机解码框架,它通过训练一个因果并行草稿头来生成分支一致的标记树,从而克服了现有方法的扩展限制,在不降低接受率的情况下,在多种大语言模型工作负载上实现了显著的加速(高达 9.64 倍)。

原作者: Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao, Yu-Yang Qian, Bojun Wang, Daxin Jiang, Yibo Zhu, Tajana Rosing, Hao Zhang

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao, Yu-Yang Qian, Bojun Wang, Daxin Jiang, Yibo Zhu, Tajana Rosing, Hao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图写一个长篇故事,但你有一个非常严格的编辑(AI 模型),他只允许你一次写一个词。在你写第二个词之前,编辑必须阅读并检查第一个词,然后给你绿灯。在写第三个词之前,他要检查第二个,以此类推。这种“一次一个词”的规则使得写作变得非常缓慢,即使编辑极其聪明。

**投机采样(Speculative Decoding)**是一种加速这种过程的技巧。与其等待编辑检查每一个词,不如雇佣一个快速、廉价的助手(“草拟者”)来猜测接下来的几个词。然后你将这些猜测一次性展示给编辑。如果编辑同意这些猜测,你就能在写一个词的时间内写下好几个词。如果编辑不同意,你就丢弃错误的猜测并重新开始。

问题:“速度 vs. 准确度”陷阱

论文解释说,以往的方法遇到了瓶颈。它们面临着一个两难困境:

  1. “谨慎型”助手: 有些助手非常小心。他们猜下一个词,然后根据他们的第一个猜测来猜下一个词,以此类推。这使得他们的猜测非常准确(编辑经常接受它们),但速度很慢,因为他们必须循序渐进地思考。
  2. “快速型”助手: 另一些助手速度极快。他们不考虑词与词之间的联系,直接大声喊出一整串单词列表。这很快,但列表往往逻辑不通(例如,“猫……飞了……到……月球……昨天”)。由于这些词无法符合故事的流畅度,编辑不得不拒绝大部分内容,从而浪费了助手的速度。

论文称之为**“因果性-效率困境”(Causality-Efficiency Dilemma)**。你通常必须在“快速但不准确”和“准确但缓慢”之间做出选择。

解决方案:JETFLOW

作者创建了一个名为 JETFLOW 的新系统,它打破了这个陷阱。把 JETFLOW 想象成一个能够并行思考,但仍能遵循故事逻辑的超级助手

它是如何工作的,使用一个简单的类比:

  • 树的比喻: 想象故事是一棵树。树干是你已经写好的文本。你想长出新的分枝(未来的词)。
    • 旧的“快速型”助手会随机生长分枝。一个分枝可能说“那只猫”,另一个说“那只狗”,第三个说“月球”。它们不知道哪条路径是真实的,所以浪费时间生长死掉的分枝。
    • 旧的“谨慎型”助手会长出一个分枝,检查一下,然后再长下一个。这很安全,但很慢。
    • JETFLOW 会观察树干,并瞬间勾勒出许多不同的可能分枝。但神奇之处在于:它确保每一条分枝都遵循故事的规则。如果一个分枝以“那只猫”开始,那么该特定分枝上的下一个词必须是猫会做的事情。它不会把不同的分枝混淆。

JETFLOW 如何实现

  1. 一次通过,多条路径: JETFLOW 使用一个特殊的“头”(AI 的一部分)来观察主编辑的隐藏想法。只需一眼,它就能预测出一整棵由可能的下一个词组成的树。
  2. 尊重流向: 它使用一种特殊的“掩码”(就像一套交通规则),强制要求助手只能观察其特定路径上之前的词。这防止了助手窥探未来或混淆不同的故事线。
  3. 结果: 因为助手的猜测在逻辑上与故事流保持一致,主编辑(目标模型)可以一次性接受更长的字符串。

结果:有多快?

论文在强大的计算芯片(H100 GPU)上,针对数学问题、编程任务和聊天对话进行了测试。

  • 数学问题: 在困难的数学测试中,JETFLOW 比标准的缓慢方法快了 9.6 倍
  • 聊天: 对于开放式对话,它快了 4.5 倍
  • 可扩展性: 允许助手进行更多“猜测”(预算)时,速度就越快。不像旧方法在被要求猜测太多词时会变得混乱或变慢,JETFLOW 能够保持高效且越来越快。

总结

JETFLOW 就像雇佣了一支助手团队,他们可以同时喊出不同的故事结局,但他们足够聪明,知道每个结局本身必须是合理的。这使得主编辑能够瞬间批准大块的文本,在不损失故事质量的前提下,打破了“一次一个词”的速度限制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →