LiLiCorr: Lightweight Likelihood Correlation of Parallel Drafts for Speculative Decoding
LiLiCorr 是一种轻量级方法,它通过高效地关联草拟者(drafter)的逐位置边缘分布以捕捉联合标记相干性,从而在保持极低延迟开销的同时,显著增加接受长度并提升整体吞吐量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:阅读一本书是瞬间完成的,并非因为文字出现得更快,而是因为你的大脑能在你翻页之前就预判出整个段落。这就是一种被称为“投机采样”(speculative decoding)的技术所承诺的前景,这种方法旨在让人工智能以空前的速度进行表达和写作。其核心过程依赖于一种简单的分工:一个小巧、快速的模型充当“草拟员”,负责猜测接下来的内容;而一个更大、更强大的模型则充当“法官”,负责验证这些猜测。如果法官认可草拟员的预测,系统就会接受该猜测并继续推进,从而跳过了从头开始逐字生成的缓慢步骤。草拟员被信任能正确写出长串单词的速度越快,整个对话的流动就越顺畅。然而,一个持久的问题一直阻碍着这项技术的发展:草拟员往往能把单个词写对,却无法让它们组合成连贯的句子。这就像一位音乐家,虽然每个音符单独演奏时都完美无瑕,但当音符连贯起来时,却创造出了一种刺耳且毫无意义的旋律。
英伟达(NVIDIA)的研究人员推出了一种名为 LiLiCorr 的新方法,旨在解决这个特定的连贯性问题,且不牺牲速度。该系统基于一种名为 DFlash 的草拟模型,它能够通过一次快速的爆发式输出,预测出一整块未来的词组。虽然 DFlash 速度极快,但它将每个词的位置视为独立事件,这意味着它可能会在第一个位置建议“The dog”(那只狗),而在第二个位置建议“meows”(喵喵叫),却未能意识到在整个句子的语境下,“The cat”(那只猫)会是更好的选择。这种新方法并不试图重新训练草拟员使其变得完美,而是增加了一个轻量级的逻辑层,充当快速编辑的角色。这个编辑器会查看草拟员为每个位置提出的前几个候选词,并检查它们之间的衔接程度。它为每个候选词分配一对方向信号:一个指示该词与前一个词的契合度,另一个指示它与后一个词的衔接度。通过比较这些信号,系统可以瞬间识别出哪种词序构成了一条平滑且逻辑通顺的路径,从而剔除那些会导致大模型拒绝的突兀组合。
这一设计的精妙之处在于其高效性。系统并非通过缓慢的顺序链条逐一检查每个词,而是利用一次大规模的并行计算,同时评估候选词之间所有可能的连接。这使得系统几乎可以在瞬间找到最连贯的序列,仅留下一个简单的最后步骤来锁定选择。研究人员发现,通过训练这个编辑器与草拟员协同工作,两个模型学会了相互配合,草拟员最终提出的候选词也更容易被编辑器链接成长且被接受的链条。在涵盖从解决数学问题到编写代码及进行对话的九项不同基准测试中,这种新方法表现始终优于以往的方法。与未经编辑的草拟员相比,它将接受词的数量提高了 9% 到 19%,并在 72 个测试场景中的 70 个场景中实现了最高的整体速度。即使当系统处理的输入长度是其训练数据的十倍时,它依然保持领先地位,证明了这种链接候选词的方法具有鲁棒性和可扩展性。
结果表明,加速 AI 的瓶颈不仅在于让草拟员更快,还在于让草拟员的猜测更容易被验证。通过在将猜测发送给法官之前修复其连贯性,系统避免了拒绝和重新生成的浪费时间。这种方法不需要主模型投入巨大的计算能力来进行关联处理;相反,它使用了一个微小的专门网络,仅增加了极少的时间——仅占每块文本总时间的约 2.8%。研究人员证明,这一小部分的增加带来了巨大的回报,使系统处理信息的速度显著提升。虽然其他方法试图通过对每个单词进行复杂的检查或要求主模型做额外工作来解决此问题,但 LiLiCorr 通过将草拟员已提供的信息组织成易于导航的结构,从而实现了其目标。研究结果表明,对于未来高速 AI 而言,关键可能不在于构建更大的模型,而在于构建更聪明、更高效的方式,在它们生成的词汇之间建立起有效的联系。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。