← 最新论文
💬 NLP

HiSpec: Hierarchical Speculative Decoding for LLMs

HiSpec 是一种高通量推测解码框架,它利用早退模型进行低开销的中间验证,并在草稿模型、验证模型和目标模型之间复用计算状态,从而在确保不牺牲准确性的前提下显著加速大语言模型的推理。

原作者: Avinash Kumar, Sujay Sanghavi, Poulami Das

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Avinash Kumar, Sujay Sanghavi, Poulami Das

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家规模宏大、关乎重大利益报纸的编辑。你拥有一位才华横溢但思考缓慢的高级编辑(即目标模型),他能产出完美的文章,但撰写和核实每一个字都需要耗费很长时间。同时,你还有一位反应迅速、充满干劲的初级实习生(即草稿模型),他能瞬间吐出句子,但经常出错或编造事实。

旧方法:“停—查”瓶颈

在传统方法(称为推测解码)中,流程如下:

  1. 实习生写出一整段话(推测 5 个词)。
  2. 高级编辑停下所有工作,通读整段,并根据自身知识核对每一个字。
  3. 如果实习生出错,编辑就丢弃整段并重写;如果正确,编辑则予以接受。

问题所在: 高级编辑的核对速度太慢,导致实习生大部分时间都在空等。“核对”环节成了瓶颈。事实上,该论文指出,对于大型模型而言,核对所花费的时间可能是实习生实际撰写时间的2 倍到近 7 倍

新构想:HiSpec(分层推测解码)

这篇论文的作者 HiSpec 意识到,等待高级编辑检查所有内容是一种浪费。他们提出了一种更智能的工作流,在单个模型内部使用三层系统

  1. 实习生(草稿层): 模型中非常浅显的部分,能以超快速度写出词语。
  2. 团队主管(中间验证器): 一个“中层管理”层。它并非完整的高级编辑,但足够聪明,能快速识别明显的错误。
  3. 高级编辑(目标层): 完整、深层的模型,负责给出最终、完美的批准。

HiSpec 的工作原理(类比)

HiSpec 改变了游戏规则,不再让实习生写完一整段后再等待高级编辑全盘检查:

  • 步骤 1: 实习生写出几个词。
  • 步骤 2: 团队主管(中间验证器)立即扫视这些词。
    • 如果团队主管发现 glaring 错误: 他们立即驳回。实习生无需等待高级编辑浪费时间在此,而是立即开始撰写下一批词。
    • 如果团队主管认为看起来没问题: 他们给出一个“暂定通过”的肯定。
  • 步骤 3: 高级编辑仅介入,对团队主管批准的那些词进行完整、深入的检查。
  • 步骤 4(安全网): 为确保团队主管没有遗漏任何细微之处,高级编辑每隔几个词就会进行一次完整检查,以确保最终输出 100% 完美。

秘诀:“复用笔记”

该论文强调了一个节省更多时间的巧妙技巧。通常,当你检查一个句子时,必须从头重新阅读整个上下文。HiSpec 则像一位复用笔记的聪明助手。

当实习生写下一个词时,他们在桌上留下一张“便利贴”(键值缓存)。当团队主管检查时,他们直接拿起那张相同的便签,而不是重新写一张。当高级编辑检查时,他们再次使用同一张便签。这意味着计算机无需为每一步都重新计算上下文,从而避免了繁重的计算工作。

结果

该论文声称这种方法是一个巨大的胜利:

  • 速度: 与旧方法相比,它使整个过程平均快 1.28 倍,在某些情况下甚至快 2 倍
  • 准确性: 与某些可能让错误溜走的“快速”方法不同,HiSpec 保证最终输出与由缓慢的高级编辑单独撰写的内容完全一致
  • 效率: 它无需从头训练一个全新的“团队主管”模型;它只需利用现有模型内部已经擅长此工作的特定层。

总结

将 HiSpec 想象成机场的快速安检通道

  • 旧方式: 无论包多小,每个人都必须等待首席安检官检查每一个包。
  • HiSpec: 一个快速扫描仪(团队主管)首先检查明显的威胁。如果没问题,你就快速通过;如果看起来可疑,则被标记。首席安检官(高级编辑)仅对通过快速检查的包进行深层、缓慢的扫描,并定期执行以确保安全。

结果如何?你通过机场(生成文本)的速度快得多,但并未牺牲安全性(准确性)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →