Decoupled Contrastive Decoding via Expert-Aligned Drafting
本文介绍了解耦对比解码(Decoupled Contrastive Decoding, DCD),该方法通过采用专家对齐的草拟模型生成提议,同时保留业余模型进行验证,从而加速了对比解码,并避免了因将草拟模型与对比信号对齐而导致的性能下降。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图写出一个完美的故事,但你有一个非常聪明但说话很慢的严厉编辑。每当你想要写下一个新词时,你都必须等待这位编辑思考、检查,然后大声说出来。这就是目前被称为“大语言模型”的强大计算机大脑的工作方式:它们非常擅长写作,但因为必须逐个检查每一个词,所以速度很慢。
为了提高速度,科学家们发明了一个名为“投机采样”(Speculative Decoding)的小技巧。你可以把它想象成有一个动作敏捷、充满活力的助手,在缓慢的编辑有机会查看之前,就先猜测故事的下几个词。助手快速地写出一个完整的句子,然后由缓慢的编辑来检查这些猜测是否正确。如果正确,太棒了!你节省了时间。如果不对,编辑就会纠正错误。这在常规写作中效果显著。
但问题在于,有时计算机大脑会编造事实或产生“幻觉”。为了解决这个问题,研究人员使用了名为“对比解码”(Contrastive Decoding)的技术。这就像是拥有第二个不太聪明的助手(一个“业余选手”),这个选手容易犯错。系统会将聪明编辑的猜测与业余选手的猜测进行比较。如果聪明编辑说“是”而业余选手说“不是”,系统就知道应该更加信任聪明编辑。这是一个确保写作更准确的安全网。然而,这个安全网代价高昂,因为它需要为每一个词同时运行“聪明编辑”和“笨拙业余选手”,这又让速度慢了下来。大问题在于:我们能否既保留这个安全网,又让它变快?
这篇题为《通过专家对齐草拟实现的解耦对比解码》(Decoupled Contrastive Decoding via Expert-Aligned Drafting)的论文正是深入探讨了这个问题。作者们——来自上海交通大学和上海人工智能实验室的研究人员——想要看看他们是否可以通过教导“快速助手”在进行猜测时使用“业余选手”这一安全网,从而让这个快速助手变得更聪明。他们问道:快速助手应该尝试在写作时模仿复杂的安全规则,还是应该只管尽可能快地书写,然后让安全检查在稍后进行?
研究人员通过一系列巧妙的实验测试了这个想法。他们尝试训练快速助手直接理解“业余选手”的信号,希望它能成为一个能够自主避免错误的“超级猜测者”。但他们发现了一个令人惊讶的结果:试图教导快速助手学习安全规则反而让它的表现变差了。这就像是试图教一名赛车手在驾驶的同时还要解数学题;赛车手会感到困惑并犯下更多错误。由于“业余选手”的信号往往太弱,无法修复助手的自然错误,试图将两者结合只会让错误变得更大。
因此,作者提出了一个新方案,称为解耦对比解码(DCD)。他们没有强迫快速助手去学习安全规则,而是让它做自己最擅长的事:仅使用聪明编辑的风格来猜测下一个词。他们完全移除了快速猜测阶段中的笨拙业余选手。安全检查(即对比解码)仅在助手完成猜测后的验证步骤中进行。
结果令人印象深刻。通过保持快速助手的简单与专注,并仅在最后阶段才使用复杂的安全检查,他们成功地显著提升了速度。在测试中,这种新方法比那些试图在猜测阶段加入笨拙业余选手的旧方法快了 1.65 到 1.95 倍。此外,与那些尝试在猜测阶段包含业余选手的法相比,它将“猜测”环节所花费的时间缩短了 5 到 12 倍。
论文得出结论,想要兼顾速度与准确性,最好的办法是保持角色分离:让快速助手成为一个纯粹的、与专家对齐的猜测者,并让安全检查仅在需要验证时发生。这种“解耦”的方法确保了计算机大脑在保持高速运行的同时,不会失去辨别真伪的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。