Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models
本文介绍了 Ripple-Pivot Search (RPS),一种用于扩散大语言模型(Diffusion Large Language Models)的无需训练的并行解码方法,该方法通过主动提交中熵枢轴位置以触发“涟漪效应”来降低不确定性,从而加速推理,在保持或提升生成质量的同时实现了高达 18 倍的加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机不再像人类那样一次只能读一个词、缓慢地翻页,而是能够看向一整张空白页面,并在一瞬间完成整个故事的预测。这就是一种被称为“扩散语言模型”(diffusion language model)的新型人工智能所承诺的前景。不同于那些像“一块块垒砖”一样逐字构建句子的传统模型,这些新模型从充满“神秘盒子”(掩码标记/masked tokens)的页面开始,并尝试一次性推断出所有盒子里的内容。它们通过进行一次带有噪声的猜测,然后一点点将其清理干净,并重复这个过程,直到文本变得通顺为止。科学家们面临的核心问题是:我们如何让这个清理过程变得超级快,同时又不让计算机因为产生混乱而写出毫无意义的内容?如果我们试图过快地填满太多盒子,计算机可能会在早期犯错,而这个错误可能会毁掉整个故事。但如果我们走得太慢,又会失去速度优势。这是一种在竞速与谨慎之间进行的微妙平衡。
本文介绍了一种名为“涟漪-枢轴搜索”(Ripple-Pivot Search,简称 RPS)的巧妙新策略,用以解决这种平衡难题。研究人员发现了这些模型思考方式中一种迷人的“涟漪效应”。他们发现,如果你在神秘页面的中间选择一个特定的“枢轴”(pivot)位置——即一个模型虽有些不确定但并非完全无从下手的位置——并正确填入它,就会向页面的其余部分发送一股清晰度的冲击波。这就像解开填字游戏中的一个难点线索:一旦你解开了那个词,突然间另外三个词也变得显而易见了,你可以立即填好它们。旧方法像是试图先填入那些最简单的词(模型百分之百确定的词),但这对解决难题几乎没有帮助。然而,RPS 却像是一位侦探,知道应该先解决哪一个“中等难度”的线索,从而解锁整个谜题。
团队发现,通过主动致力于这些“中熵”(mid-entropy)枢轴位置(即模型有一定的信心但仍有多种选择的位置),并仔细挑选出该位置的“最佳”单词(而不只是最显而易见的那个),他们可以触发一种连锁反应。这使得模型可以在下一步中揭开更多的掩码,从而加速整个过程。在针对数学问题求解和代码编写等不同模型及任务的测试中,RPS 使计算机比标准方法快了 4 到 10 倍,同时仍能写出高质量的文本。事实上,在某些情况下,它编写的代码甚至比之前的快速方法更好,准确率提升了高达 5.49%。当他们将这种新方法与一种名为“KV 缓存”(KV caching)的节省内存技巧相结合时,速度提升更是达到了惊人的 18 倍。
研究人员还证明了这不仅仅是运气好,而是一个特定的、可重复的模式。他们通过证明,只要向前看一步,观察哪种单词选择能引发最大的“清晰度涟漪”,模型就能做出更明智的决策。他们排除了“仅仅挑选最自信的词就是最佳路径”的观点,转而表明“甜点位”(sweet spot)通常处于不确定性的中间地带。结果表明,通过在“在哪里投入”和“投入什么”这两个方面采取策略,我们可以释放这些下一代人工智能模型的真实速度潜力,而不牺牲它们所讲述的故事的质量。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。