Draft-OPD: On-Policy Distillation for Speculative Draft Models
本文介绍了 Draft-OPD,这是一种基于策略的蒸馏框架,它通过利用目标辅助的 rollout 以及从错误位置重放草稿,克服了监督微调在推测解码中的局限性,从而为思维模型实现了超过 5 倍的无损加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图与一位非常著名且才华横溢的作家(即目标模型)共同创作一篇长篇、复杂的故事。这位作家极其聪明,能写出完美的句子,但他们的速度非常慢。在写下每一个字之前,他们都要花费很长时间进行思考。
为了加快速度,你雇佣了一位快速且精力充沛的实习生(即草稿模型)来猜测接下来的几个词。实习生迅速写出几个词,然后由这位著名作家进行检查。如果实习生猜对了,作家会说:“太棒了,继续!”然后继续推进。如果实习生猜错了,作家就会划掉错误,写出正确的词,然后重新开始。
这个过程被称为推测解码(Speculative Decoding)。其目标是让实习生猜得足够好,以至于作家很少需要停下来纠正他们,从而使整篇故事的创作速度大大提升。
问题所在:“教科书”与“实战”
长期以来,训练这些实习生的方法就像给他们一本教科书。你向他们展示著名作家已经写过的故事,并说:“记住这些模式。”这被称为监督微调(SFT)。
起初,这种方法效果很好。实习生在模仿教科书方面变得越来越擅长。但 eventually,他们遇到了瓶颈。无论他们如何更多地研读教科书,他们在实时猜测方面的速度都不再提升。
为什么?
因为教科书是静态的。它只展示了著名作家走过的路径。但在实战中,实习生才是率先行动的人。有时,实习生会猜出一个奇怪的词,而著名作家在教科书中从未写过这个词。当实习生犯错时,作家会进行纠正。但实习生从未从这些错误中吸取教训,因为教科书中根本没有包含这种特定的“错误猜测”场景。实习生正在研究一张他们从未真正走过的城市的地图。
解决方案:"Draft-OPD"(在实践中学)
这篇论文的提出了一种名为Draft-OPD的新训练方法。与其仅仅阅读教科书,不如让实习生在一个模拟游戏中进行练习,著名作家就在现场实时指导他们。
以下是其工作原理,使用一个简单的类比:
安全练习(Target-Assisted Rollout,目标辅助展开):
想象实习生尝试写一段文字。如果他们卡住了或偏离了轨道,著名作家会立即介入进行修正,并保持故事继续推进。这确保了练习环节不会变成一堆胡言乱语(如果实习生试图独自写完整个故事,这种情况就会发生)。“错误回放”(秘密武器):
这是最重要的一部分。当实习生做出猜测而作家不得不进行纠正时,系统不会直接跳过。它会按下“倒带”键。- 它回到实习生做出错误猜测的确切时刻。
- 它要求实习生再次尝试那个特定的猜测。
- 它要求作家解释为什么那个猜测是错误的。
这就像教练说:“停!你试图把球踢向左边,但守门员就在那里。让我们倒带并重试,这样你就能学会踢向右边。”这教会实习生专门针对他们自己犯下的错误,而不仅仅是作家走过的完美路径。
智能评分(Acceptance-Aware Distillation,接受感知的蒸馏):
系统根据结果对实习生的猜测采取不同的处理方式:- 如果实习生猜对了: 系统会说:“干得好,继续保持你刚才的做法。”(强化良好的习惯)。
- 如果实习生猜错了: 系统会说:“你对这个错误答案很有信心,但它确实是错的。让我们重点攻克这类特定的错误。”(惩罚那些自信的失误)。
结果
这篇论文在一些非常先进的 AI 模型(被称为“思考模型”,因为它们在数学和编程方面表现出色)上测试了这种新方法。
- 旧方法(教科书学习): 实习生能将写作过程提速约4.5 倍。
- 新方法(Draft-OPD): 实习生将速度提升了5 倍以上。
简单来说,新的训练方法使实习生在猜测方面变得如此出色,以至于著名作家需要停下来纠正他们的次数大大减少。这意味着故事能以快得多的速度完成,而不会损失任何质量。
总结
该论文认为,为了让 AI 更快,我们不能仅仅教它们复制完美的示例。我们必须让它们进行练习,让它们犯错,然后专门教导它们如何修正那些错误。通过回放 AI 猜错的时刻,我们可以训练出一个在预测未来方面更出色的“草稿”AI,从而使整个系统的速度显著提升。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。