← 最新论文
💬 NLP

LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation

LogitSpec 是一种无需训练、即插即用的基于检索的推测解码方法,它通过利用最后一个 token 的 logits 来推测“下下个” token,从而扩展检索范围,实现高达 2.61 倍的加速和更高的 token 接受率。

原作者: Tianyu Liu, Qitan Lv, Hao Li, Xing Gao, Xiao Sun, Xiaoyan Sun

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyu Liu, Qitan Lv, Hao Li, Xing Gao, Xiao Sun, Xiaoyan Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位主厨(即大型语言模型,或 LLM),正试图撰写一份复杂的食谱。旧有的方法非常缓慢:你想出一个词,写下来,等待计算机检查它是否正确,然后想下一个词,如此循环。这就像一次只写一个字母地写信,每写一个字母都要等待一个批准印章。

推测解码(Speculative Decoding)是一种加速此过程的新方法。你不再一次只写一个词,而是雇佣一名副厨(一个草稿模型)来为你猜测接下来的几个词。然后你快速检查副厨是否猜对了。如果猜对了,你就一次性接受所有这些词。如果猜错了,你就直接扔掉错误的猜测并重新尝试。这节省了大量时间。

然而,雇佣副厨存在一些问题:

  1. 你必须专门为你的厨房培训他们(昂贵且困难)。
  2. 他们会在你的厨房中占用额外空间(内存)。
  3. 如果你更改了主食谱,你就必须重新培训副厨。

“检索”(图书馆方法)的问题

一些研究人员试图通过解雇副厨并改用图书馆来解决这个问题。计算机不再由人来猜测,而是查看你已经写下的内容,并在一个庞大的过往食谱数据库中搜索匹配的短语。

缺陷:这就像试图通过查看紧邻的前一个词来寻找句子中的下一个词。

  • 你的句子:“圆的面积是多少……"(原文:"What is the area of the...")
  • 图书馆的猜测:它看到“的”(the),心想:“哦,‘的’通常和‘三角形’(triangle)搭配!”(因为它找到了一句过去的句子:“三角形的面积是多少?”)。
  • 现实:你实际上想说“圆的面积是多少?”("What is the area of the circle?")或者“田地的面积是多少?”("What is the area of the field?")。
  • 结果:图书馆因为只关注直接上下文而非整体构思,而卡在了错误的词上。

解决方案:LogitSpec(“水晶球”主厨)

这篇论文的作者 LogitSpec 意识到,主厨(LLM)实际上拥有一个它不够经常使用的隐藏超能力。

当主厨预测下一个词时,它对于紧随其后的那个词也有某种“感觉”(在数学上称为logits)。尽管主厨本应只说出下一个词,但它的大脑已经在低语:“在那之后,很可能是‘圆’(circle)。”

LogitSpec 利用这种低语来修正图书馆的搜索

以下是它的工作原理,分步说明,并使用了生动的类比:

1. “水晶球”步骤

LogitSpec 不再仅仅查看最后一个词(“的”),而是问主厨:“如果你必须猜测两步之后的词,那会是什么?”

  • 主厨查看其内部的“感觉”并说:“我敢打赌‘的’之后的词是''。”
  • 这就是下一个下一个词推测(Next-Next Token Speculation)。

2. “超级搜索”步骤

现在,LogitSpec 不再仅仅搜索“的”,而是搜索短语""。

  • 旧方法(普通检索):搜索“的”。找到“三角形”、“天空”、“狗”。(错误!)
  • LogitSpec 方法:搜索“圆”。找到“朋友圈”、“生命之圆”、“田地之圆”。(准确得多!)

3. 验证

计算机将这些更准确的猜测与主厨进行核对。由于这些猜测现在准确得多,主厨会更频繁地接受它们。

为什么这很重要?

  • 无需额外训练:你不需要雇佣或培训新的副厨。你只需利用主厨已有的“感觉”(logits),它们原本就在那里。
  • 即插即用:它适用于任何现有的语言模型,无需更改其代码或权重。
  • 速度:在他们的测试中,这种方法使计算机撰写文本的速度提高了 2.6 倍。这也意味着计算机平均每次可以接受 3.28 个词,而不仅仅是一个。

核心结论

将 LogitSpec 想象成一名侦探,他不仅仅通过查看犯罪现场(最后一个词)来猜测接下来发生了什么。相反,侦探利用一种心理直觉(logit)来猜测下一个犯罪现场,然后利用这种直觉在图书馆中找到完美的证据。

通过向前看两步,该系统不再被外观相似的词所迷惑,而是能更快地找到正确的词,从而使 AI 在无需任何额外训练或昂贵硬件的情况下显著加快文本生成速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →