xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding
该论文提出了 xPress,一种轻量级的因果细化器(causal refiner),它通过并行细化来恢复块扩散草拟器(block-diffusion drafters)中缺失的依赖关系,与 dFlash 等现有方法相比,显著提升了投机采样中的接受长度和端到端吞吐量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
竞逐语速:为什么 AI 需要更好的草拟系统
想象一下,你正在尝试写一个故事,但你必须遵守一个严格的规则:你一次只能写一个词,而且在写下一个词之前,必须等待一位超级聪明的编辑检查你当前的词。这就是目前大多数强大的 AI 语言模型的工作方式。它们极其准确,但也极其缓慢,因为它们必须一个接一个地检查每一个词。为了提高速度,科学家们发明了一个叫做“投机采样”(speculative decoding)的小技巧。把它想象成一个快速但稍微不太细心的助手,他会为你预猜接下来的几个词。如果这位超级聪明的编辑同意助手的猜测,你就可以一次性写下所有这些词,从而跳过等待时间。
问题在于,这个助手通常过于急躁了。他猜出的词听起来单独很有道理,但放在句子中却无法很好地衔接,就像一位厨师挑选了美味的食材,却忘了检查它们组合在一起是否味道相投。最近,一种被称为“扩散草拟器”(diffusion drafter)的新型助手被创造了出来。它不再是一个接一个地猜测单词,而是尝试一次性猜出一整块单词,就像把一把拼图碎片同时撒在桌子上一样。这非常快,但因为它是同时撒下的,碎片往往无法正确连接。超级聪明的编辑不得不拒绝其中的大部分,导致速度再次变慢。研究人员提出的核心问题是:我们能否保留这种“一次性猜测”者的速度,同时修复错误,让编辑能够真正接受这些词?
xPress 登场:修复拼图的“并行精炼器”
本文介绍了一种被称为 xPress 的巧妙解决方案。作者在研究像 Qwen3-8B 这样的模型时发现,虽然快速的“扩散草拟器”擅长猜测一整块单词,但它忽略了一个至关重要的规则——即单词之间存在相互依赖关系(因果律)。例如,如果第一个词是“she”,那么即使“are”本身是一个常见的词,下一个词也不应该是“are”。扩散草拟器并不知道这一点,因为它是在同时猜测所有内容。
为了解决这个问题,xPress 充当了一个轻量级的因果精炼器。想象一下,扩散草拟器把一把拼图碎片撒在了桌子上,xPress 就是一只快速且聪明的双手,它一眼看去整个堆叠,并在不拆解碎片的情况下,将碎片微调到正确的顺序。它通过一种叫做 Jacobi 解码的技术来实现这一点。x-Press 不是一个接一个地修复拼图碎片(这很慢),而是观察整体画面,同时对每个碎片进行快速调整,然后再次观察。它重复这种“观察并微调”的循环仅几次(通常为 4 到 6 次),直到碎片完美地锁定在一起。
结果令人印象深刻。通过使用 xPress,该系统比原始的快速草拟器平均能多接受约 30% 的猜测词。在某些特定测试(如解决数学问题)中,加速效果高达 56%。在衡量 AI 说话的总速度时,与原始方法相比,xPress 使过程平均快了 1.3 倍,在最佳情况下甚至快了 1.7 倍。
论文明确反对了另外两种试图解决此问题的方法。一种方法涉及构建一个巨大的猜测“树”,这既复杂又昂贵;另一种方法使用“马尔可夫头”(Markov head)按严格的线性顺序逐一修复单词,虽然准确但很慢,因为它失去了同时猜测带来的速度优势。作者证明 xPress 优于两者:它比那种缓慢的、步进式的修复器更快,也比复杂的树状方法更简单。
这项研究证实,xPress 的工作原理是将“因果信息”(即单词依赖于前序单词的规则)重新注入到快速系统中,且不会降低其速度。他们在数学、编程和对话基准测试中进行了测试,发现 xPress 始终优于竞争对手。论文指出,这种方法是一种稳健且适度的改进,它让 AI 能够兼顾速度与准确性,证明了只要有正确的精炼方式,你就无需为了速度而牺牲质量。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。