← 最新论文
💬 NLP

When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?

本文介绍了 KVShot,这是一个诊断框架,它展示了通过使草稿模型能够重用目标 KV 缓存来缓解推测解码中的长程精度衰减,同时指出了当前训练流程中的结构性瓶颈,这些瓶颈要求转向分块训练范式。

原作者: Tianyu Liu, Yuhao Shen, Xinyi Hu, Baolin Zhang, Hengxin Zhang, Jun Dai, Jun Zhang, Shuang Ge, Lei Chen, Yue Li, MingCheng Wan

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyu Liu, Yuhao Shen, Xinyi Hu, Baolin Zhang, Hengxin Zhang, Jun Dai, Jun Zhang, Shuang Ge, Lei Chen, Yue Li, MingCheng Wan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试预测故事中的下一句话。你有一位超级智能作者(目标模型),他能完美地撰写故事,但速度非常慢,因为他一次只写一个词。为了加快速度,你雇佣了一位敏捷助手(草稿模型)来猜测接下来的几个词,供作者核对。如果助手猜对了,作者只需确认,从而节省时间;如果助手猜错了,作者就必须重新开始。

这篇论文提出了一个简单的问题:我们如何帮助敏捷助手更好地猜测,尤其是针对更靠后的词?

问题所在:“模糊照片”效应

目前,最出色的助手是从作者的“思想”(称为隐藏状态)中获取提示的。

  • 类比:想象作者正在查看一份长长的线索列表以撰写下一个词。为了做出决定,他眯起眼睛,将整份列表总结成一张单一的、模糊的照片。这张照片对于决定紧接着的下一个词来说是完美的。
  • 问题:如果助手试图猜测第五个第六个靠前的词,他们看到的仍然是那张模糊的照片。但这张照片是为了求解第一个词而眯眼总结出来的。那些在第一个词时被认为“尚未相关”而被忽略的重要细节,对于第五个词来说可能至关重要。当助手尝试猜测更靠后的词时,他们所需的线索已经被“压缩”出照片之外了。他们试图猜测得越远,照片就越模糊,准确性也越低。这被称为**“长程衰减”**。

提出的解决方案:“完整文件柜”

作者们建议采用一种不同的方法:与其给助手提供作者的“眯眼照片”(隐藏状态),不如给他们提供包含所有线索的完整文件柜(即KV 缓存)。

  • 类比:文件柜里包含了每一个线索,完好无损,没有任何眯眼或总结。
  • 新任务:现在,助手不必猜测线索曾经是什么。所有的线索都摆在眼前。他们唯一的工作是弄清楚对于未来的词,应该查看哪些线索。这就像被给予一座图书馆,并被要求为未来的章节找到正确的书。你拥有所有信息;你只需要知道如何搜索它。

实验:"KVShot"

研究人员建立了一个名为KVShot的测试平台,用于比较三种帮助助手的方法:

  1. 旧方法(仅隐藏状态):给助手提供模糊照片。(这是当前系统所做的)。
  2. 新方法(仅 KV 缓存):给助手提供完整的文件柜,但不提供照片。
  3. 混合方法:给助手提供模糊照片加上文件柜,让他们利用文件柜来修正照片中的错误。

他们的发现

  1. 文件柜有帮助(最终):当助手尝试猜测靠后的词(第 3、4、5 步及以后)时,“完整文件柜”方法比模糊照片要好得多。它不会那么快地丢失信息。
  2. 但学习起来很困难:“文件柜”方法有一个陷阱。助手是一个非常小且简单的模型。它难以学习如何有效地搜索文件柜。这就像给一个孩子一座巨大的图书馆,并让他们为一本尚未写成的故事寻找特定的书;他们会感到不知所措。
    • 当他们让助手稍微聪明一点(加深模型)时,它在使用文件柜方面有所进步,但它仍然无法在第一个词上击败“模糊照片”方法。
  3. 混合方法获胜(略微):最好的结果来自混合方法。助手对紧接着的下一个词使用模糊照片(在这方面它很出色),并利用文件柜来修正后续的词。
  4. 速度陷阱:尽管混合助手在实验室中猜对了更多的词,但在现实世界中,整体速度并没有显著提高
    • 为什么? “文件柜”方法需要助手进行额外的数学运算来搜索线索。这些额外的工作使助手的速度减慢,刚好抵消了因猜对更多词而节省的时间。

根本原因:训练不匹配

论文得出结论,问题不在于“文件柜”本身,而在于助手的训练方式

  • 目前,助手被训练为一次一次地猜测一个词(像是一个缓慢的、顺序的过程)。
  • 但要有效地使用“文件柜”,助手需要同时看到许多词,以学习如何搜索。
  • 由于训练方法过于缓慢且是顺序进行的,助手从未学会如何利用线索的全部潜力。这就像只让某人在停车场以 5 英里/小时的速度驾驶,却试图教他们驾驶赛车。

结论

这篇论文证明,对于长距离猜测,保留“完整线索”(KV 缓存)比使用“总结性思想”(隐藏状态)是更好的信息保留方式。然而,我们目前的训练方法过于笨拙,无法教会助手如何高效地利用这些线索。为了让这在现实世界中发挥作用,我们需要改变训练这些模型的方式,从“一次一个词”转向“一次一批词”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →