Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
该论文介绍了混合验证解码(Hybrid Verified Decoding),这是一种通过预测缓存草案(cache drafts)的接受长度,从而在缓存验证与基于模型的草案生成之间进行动态选择的方法,通过优化投机解码效率,实现了显著的加速——尤其是在智能体工作流(agentic workflows)中。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图写一个长篇故事,但你有一个严格的规则:在写下一个词之前,你必须向一位非常昂贵且缓慢的“主编”请求批准每一个单词。这就是当前大语言模型(LLM)的工作方式。它们逐个单词地生成文本,并且对于每一个单词,它们都必须进行一次沉重的计算。这使得生成长文本变得既慢又贵。
为了提高速度,研究人员使用了一种被称为**投机采样(Speculative Decoding)**的小技巧。你可以把它想象成有一个快速且廉价的“学徒作家”,为你猜测接下来的几个词。然后,你再询问主编这些猜测是否正确。如果猜测是正确的,主编会一次性批准所有这些单词,从而节省时间。如果猜测是错误的,主编只会批准第一个词(或一个都不批准),然后你必须重新尝试。
问题在于:你如何知道学徒的猜测是否值得去检查?
两种类型的学徒
这篇论文介绍了一个系统,它使用两种不同类型的“学徒”和一个聪明的“经理”来决定使用哪一个。
“记忆型”学徒(基于缓存): 这个学徒不会学习新知识。相反,它会观察你已经写下的内容或给出的提示词,然后说:“嘿,我以前见过这个模式!让我们直接复制粘贴剩下的故事吧。”
- 优点: 它极其快速且免费,因为它只是在进行复制操作。
- 缺点: 仅仅因为你以前见过某种模式,并不意味着它现在适用。例如,如果你正在写一个关于侦探的故事,而模式显示“侦探掏出了他的枪”,这在某个场景下可能是正确的,但在另一个场景下可能就是错的。如果主编拒绝了这个猜测,你就浪费了检查一个错误猜测的时间。
“学习型”学徒(基于模型): 这是一个经过训练的 AI(如 EAGLE3),它会真正思考上下文并尝试智能地编写接下来的词。
- 优点: 它通常非常准确。
- 缺点: 它比单纯从记忆中复制要慢,也更昂贵。
问题所在:“虚假希望”陷阱
在过去,系统会先尝试使用“记忆型”学徒,因为它很便宜。但如果记忆中的猜测是错误的,系统就会浪费时间去验证它。这就像是请一位朋友根据多年前看过的类似电影来猜一部电影的结局。如果他们猜错了,你就浪费了听他们说话的时间。
这篇论文将此称为**“收益”(Payoff)问题**。你需要知道一个猜测是属于“高收益”(被接受的单词很多)还是“低收益”(被接受的单词很少),而且要在询问主编进行检查之前就知道这一点。
解决方案:混合验证解码
作者创建了一个智能经理(一个小型、轻量级的 AI 预测器),它位于两个学徒与主编之间。它的工作原理如下:
- 设置: “记忆型”学徒根据过去的模式提出了一个猜测。
- 经理的检查: 在询问主编验证猜测之前,智能经理会观察当前的情况。它会问:“基于当前的上下文,你认为主编实际上会接受多少个这些复制过来的单词?”
- 决策:
- 高收益预测: 如果经理认为:“是的,这看起来是一个完美的匹配!主编可能会接受 5 或 6 个单词,”它就会将“记忆型”猜测发送给主编。
- 低收益预测: 如果经理认为:“不,这看起来很有风险。主编可能只会接受 1 个单词或一个都不接受,”它就会忽略记忆型猜测。相反,它会切换到“学习型”学徒,后者会花一点时间思考并写出一个更好的猜测。
为什么这很重要
研究人员在 16 种不同类型的任务上测试了这个系统,涵盖了从编写代码、编辑文档到回答复杂问题等各种任务。
- 结果: 在模式经常重复的任务中(如编写代码或编辑文档),该系统的平均速度比之前的最佳方法快了 2.73 倍。
- 类比: 想象你在为旅行打包行李。
- 旧方法: 你从一堆类似的行李箱中抓起一个(记忆),并祈祷它能装下你的衣服。如果它不合适,你必须拆开它,然后再尝试另一个。
- 新方法: 你快速瞥一眼行李箱(经理)。如果它看起来适合你的特定着装,你就打包它。如果它看起来尺寸不对,你会立即跳过它,转而寻找一个定制尺寸的盒子(学习型学徒)代替。通过避免在错误的行李箱上浪费精力,你节省了时间。
论文的核心要点
- 关键在于时机: 该系统不仅仅是在猜测;它是在做出昂贵的动作之前,先预测成功率。
- 它在结构化任务中表现出色: 它在“智能体”(agentic)工作流中表现尤为出色(如编码或工具使用),因为这些流程遵循严格的规则和模式,使得“记忆型”猜测通常非常出色,但前提是上下文完全匹配。
- 它节省了昂贵的部分: 通过过滤掉那些“糟糕”的记忆型猜测,该系统确保昂贵的主编只把时间花在那些很可能成功的猜测验证上。
简而言之,这篇论文教计算机如何更好地判断自己的捷径,确保它只在几乎确定有效时才走快速路径,并在捷径看起来有风险时切换到谨慎路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。