Variational Speculative Decoding: Rethinking Draft Training from Token Likelihood to Sequence Acceptance
本文引入了变分投机解码(Variational Speculative Decoding, VSD),这是一种将草稿训练重新表述为变分推理的新颖框架,旨在通过最大化目标模型的序列接受率,并利用带有自适应权重和正则化的期望最大化程序来解决训练与解码之间的差异,从而在现有方法的基础上实现显著的推理加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个超级聪明的机器人如何写故事。这个机器人被称为大语言模型(LLM),它才华横溢,但速度极慢。它的工作方式就像一个人一次写一个词,每写完一个词都要停下来思考下一个词是什么。这种“停下来思考”的过程既安全又准确,但却让机器人感觉像是在泥淖中跋涉。
为了提高速度,科学家们发明了一个聪明的技巧,叫做“投机采样解码”(speculative decoding)。你可以把它想象成一个由两人组成的团队:一个动作敏捷、充满活力的初级助手(“草稿模型”)和一个睿智且缓慢的监督者(“目标模型”)。初级助手会非常快速地尝试猜测故事接下来的几个词。随后,监督者会对这些猜测进行检查。如果猜测正确,他们就会一次性接受所有单词,从而跳过缓慢的“思考”时间。如果某个猜测错了,监督者就会进行修正,然后他们再试一次。目标是让初级助手能够一次猜出长串且正确的单词链,以便监督者能以大批量的方式进行审批,让整个过程飞速运转。
然而,这里有一个陷阱:初级助手通常是通过展示“完美”答案并要求它记忆那条单一路径来进行训练的。但在真实的比赛中,监督者并不只是观察一条完美的路径,它在观察一整棵由各种可能性构成的“树”,并从中挑选出最好的路径。事实证明,这种让助手仅遵循一条直线路径的训练方式,使得它在面对监督者实际观察的整个“森林”时表现得很糟糕。这种助手训练方式与实际游戏规则之间的不匹配,一直以来都在阻碍着这些 AI 机器人的速度。
论文的核心思想:一种训练助手的新方法
在这篇论文中,研究人员提出了一种新的训练方法,称为变分投机解码(Variational Speculative Decoding, VSD)。他们意识到,用旧的方法训练草稿模型,就像是在教一名赛车手只能在单条直道上驾驶,而实际的比赛则涉及在复杂的、多弯的赛道上导航。
旧方法的缺陷
作者解释说,现有的方法训练出的草稿模型是“贪婪”的。这意味着模型被教导要始终选择概率最高的下一个词,从而创造出一条单一的文本直线。但在实际的游戏过程中,系统并不只是检查一条线,它会生成一个包含许多不同单词组合可能的“树”,然后从中挑选出最好的。论文指出,这产生了一种不匹配:模型被训练成完美适配一条特定的路径,但游戏却要求它能够胜任许多不同的路径。事实上,他们的实验表明,大约有 30% 的时间,模型在训练时学习的那条“完美”路径在游戏中会被丢弃,因为它实际上并不是众多选项中的最佳选择。
新解决方案:向整个森林学习
VSD 改变了训练规则。它不再仅仅是记忆一条直线,而是将草稿模型的训练视为一个“变分推理”(variational inference)问题。用通俗的话说,这意味着模型被教导去理解整个“森林”的可能性,而不仅仅是其中的一棵树。它学习的是去猜测一组可能被监督者接受的路径,而不是仅仅猜测单个“最佳”词汇。
为了实现这一点,研究人员使用了一个巧妙的两步走过程(称为期望最大化程序,Expectation-Maximization procedure):
- 猜测阶段(E步): 模型生成许多不同的故事路径。一个特殊的“先知”(oracle,即智能过滤器)会检查这些路径,保留那些看起来能通过监督者测试的路径,同时剔除糟糕的路径。
- 学习阶段(M步): 模型从这些“保留下来”的路径中学习。但这里有个转折:研究人员加入了两个特殊的工具来使学习过程更加稳定和智能。
- 自适应拒绝加权(Adaptive Rejection Weighting, ARW): 这就像一位知道学生何时遇到困难的教练。如果模型产生了大量错误的猜测,教练会忽略噪声,专注于少数正确的猜测;如果模型表现良好,教练则会关注错误,以帮助它更快进步。
- 置信度感知正则化(Confidence-Aware Regularization, CAR): 这可以防止模型变得“过度自信”。如果模型对一个错误的猜测有 99% 的把握,这个工具就会给予严厉的惩罚。它教会模型保持谦逊并探索其他选项,而不是固执地坚持错误的念头。
研究发现
研究人员在多种不同的 AI 模型上测试了这种新方法,包括纯文本模型(如 LLaMA)和具备视觉能力的模型(如 LLaVA)。他们发现 VSD 能在不降低模型智力水平的前提下,持续提升 AI 的速度。
- 速度: 在文本模型上,VSD 比之前的最优方法(EAGLE-3)快了高达 9.6%。
- 接受度: “助手”能够一次获得更多单词的批准。平均而言,它一次可以获得 6 到 7 个标记(tokens,即文本块) 的批准,而旧方法仅为 5 到 6 个。
- 多模态魔力: 它在图像和文本结合的模型上也同样出色,相比于这类模型现有的最优方法(ViSpec),速度提升了 7.9%。
为什么这很重要
这篇论文证明了,通过改变训练“助手”的方式——让它去思考整个游戏而非仅仅是单次移动——我们可以显著提高 AI 的速度。作者通过数学证明,他们的方法能够保证提高“预期接受长度”(即一次能获得多少单词的批准)。他们并非仅仅凭直觉猜测,而是在编写代码、解决数学问题以及回答图片相关问题等许多不同任务中,都通过测量验证了这一点。
简而言之,VSD 通过教导草稿模型成为一个更好的“可能性探索者”,解决了训练中的不匹配问题,确保当它做出猜测时,这个猜测是监督者极有可能接受的。这使得 AI 看起来不再像是正在泥淖中跋涉,而是在全速冲刺。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。