💬 NLP
Beyond the Target: From Imitation to Collaboration in Speculative Decoding
本文介绍了协同推测解码(CoSpec),这是一种新颖的框架,它用强化学习驱动的仲裁策略取代了传统的基于模仿的方法,使得较小的草稿模型即使在生成的令牌与较大的目标模型不匹配时也能选择性地贡献令牌,从而在显著提升推理速度的同时实现更优的最终准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试解决一个非常棘手的谜题,比如一道复杂的数学题或一个棘手的编程挑战。你有两个人在帮助你:
- 专家(目标模型):一位博学多才、训练有素的教授,几乎无所不知,但速度非常慢。他们在写下每一个步骤之前,都会花时间去思考。
- 实习生(草稿模型):一位速度快、精力充沛但经验较少的助手。他们思考和书写都非常迅速,但犯错频率更高。
旧方法:“严格的监督者”
在传统方法(称为推测解码)中,实习生会尝试猜测解决方案的后续几步,并迅速将其写下来。然后,专家进行检查。
- 规则:如果实习生的猜测与专家的想法完全一致,专家就会说:“太好了,继续前进!”然后他们一起向前推进。
- 问题:如果实习生哪怕猜错了一个词,专家会立即说:“不,那是错的”,将其划掉,并写下自己的版本。即使实习生在某个特定部分实际上是对的,他们的工作也会被丢弃!
这篇论文认为这是浪费。有时,实习生可能拥有一个专家因思维定势而错过的绝妙想法。通过盲目地拒绝实习生的不同想法,系统错失了解决方案。
新方法:“协作团队”(CoSpec)
作者引入了一种名为协作推测解码(CoSpec)的新系统。专家不再是唯一的老板,而是增加了一位智能调解员(仲裁策略)。
其工作原理如下:
- 设置:实习生仍然快速写下一系列想法。专家仍然并行(同时)进行检查。
- 一致:如果他们达成一致,那就太好了!他们快速向前推进。
- 分歧:如果实习生和专家在某一步上意见不一致,调解员就会介入。
- 调解员会审视上下文、实习生的想法以及专家的想法。
- 它会问:“这两条路径中,哪一条更有可能导向正确的最终答案?”
- 如果调解员认为实习生的不同想法实际上是更好的选择,它就会说:"保留实习生的想法!"
- 如果实习生明显错了,它就说:“听从专家的。”
为什么这很重要
这就像一支运动队。在旧系统中,一旦球员(实习生)尝试了与教练(专家)战术手册不同的战术,教练就会将其换下,即使那个不同的战术可能是制胜的一击。
在新系统中,教练会听取助理教练的意见。如果助理建议了一个可能赢得比赛的不同战术,球队就会尝试它。
结果:
- 更快:因为团队接受了更多实习生的正确猜测,他们不必频繁停下来重写。他们能更快地完成谜题。
- 更聪明:因为他们有时会保留实习生的“不同”想法,他们实际上解决谜题的正确率比专家单独解决时要高。
核心结论
这篇论文表明,通过将快速、较小的模型视为合作伙伴而不仅仅是模仿者,我们可以让 AI 既更快又更准确。两个模型之间的“错误”或差异并不总是错误;有时,它们是发现大模型独自会错过的更好解决方案的机会。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。