← 最新论文
🤖 machine learning

LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection

本文介绍了 LEAP,这是一种无需训练的方法,通过未来上下文过滤和多序列叠加来检测早期收敛的令牌,从而加速扩散语言模型的推理,在保持准确率不变的情况下将去噪步数减少约 30%。

原作者: Haohui Zhang, Zhiye Wang, Xiaoying Gan, Xinbing Wang, Bo Jiang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Haohui Zhang, Zhiye Wang, Xiaoying Gan, Xinbing Wang, Bo Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个复杂的拼图,但采用的是非常特定的方式:你从一张完全被雾气(掩码)覆盖的图片开始,每走一步,就尝试清除一点点雾气,以显露出底下的图像。

这就是扩散语言模型(dLLMs)的工作原理。它们不像人类打字那样逐字逐句地写句子(那样很慢),而是试图一次性猜测许多单词,同时清除整个句子上的雾气。这对速度来说很棒,但有一个陷阱:模型非常谨慎。只有当它100%确定(高置信度)某个单词是正确的时,它才会揭示该单词。如果它哪怕有一点点不确定,就会继续在该单词上保留雾气,并等待下一轮。

问题在于?模型往往早期就得到了正确答案,但其“置信度计”尚未跳转到"100% 确定”区域。因此,它继续浪费时间重新检查它已经想出来的单词,只是为了求稳。

解决方案:LEAP(前瞻早期收敛)

这篇来自上海交通大学的论文作者提出了一种名为LEAP的方法。将 LEAP 想象成一位“智能侦察兵”,帮助模型不再如此过度谨慎。

LEAP 的工作原理如下,使用一个简单的类比:

1. 问题:“过度思考者”

想象一名正在参加考试的学生。他知道第 5 题的答案是“苹果”。他有 90% 的把握。但老师(当前的 AI 规则)说:“只有当你有 99% 的把握时,你才能写下答案。”于是,学生一直盯着“苹果”思考:“这肯定是个苹果吗?也许是个梨?”他们浪费时间反复重新评估同一个答案,尽管他们其实已经知道了。

在 AI 世界里,这意味着模型需要太多步骤来完成一个句子,因为它拒绝在答案完美之前“锁定”答案。

2. LEAP 技巧:“未来一瞥”

LEAP 改变了游戏规则。LEAP 不再仅仅问:“你有 99% 的把握吗?”,而是问:“如果我们现在加入一点点未来信息,你的答案会改变吗?”

  • 设置:AI 正在查看一个带有缺失单词(雾气)的句子。
  • 技巧:LEAP 创建一个“假设”场景。它暂时用可能的未来猜测(即使它们目前还不完美)填充缺失的位置,并让模型再次查看该句子。
  • 测试
    • 如果模型看着带有“未来猜测”的句子,仍然说:“是的,答案肯定是‘苹果’",那么 LEAP 就知道该答案是稳定的。无论接下来发生什么,模型已经收敛到了正确答案。
    • 如果模型改变了主意(“哦,有了那个新信息,也许它是‘梨’"),那么 LEAP 就知道答案尚未准备好,它将继续在该单词上保留雾气。

3. 结果:更快、更智能的解码

通过使用这种“未来一瞥”技巧,LEAP 可以识别早期收敛的单词。这些是模型实际上已经解决的单词,即使其置信度分数尚未达到极高的阈值。

  • 没有 LEAP:模型需要 256 步来完成一个数学问题,反复检查相同的单词。
  • 有了 LEAP:模型意识到:“嘿,我已经搞定了这些单词”,并立即锁定它们。它在大约 175 步内完成了同样的问题(时间减少了30%)。

为什么这很重要

该论文声称 LEAP 是一个“即插即用”的工具。你不需要重新训练 AI 或教它新东西。你只需将此“侦察兵”添加到过程中即可。

  • 速度:它使 AI 显著更快(在某些任务上快达 5.5 倍)。
  • 准确性:它不会牺牲质量。事实上,在某些测试中,它的准确性略高,因为它阻止了模型因过度思考而陷入困惑。
  • 效率:它打破了“你必须达到 99% 的置信度才能继续前进”的规则。它证明了“稳定”与“完全自信”同样有效。

简而言之

LEAP 就像 AI 的交通管制员。LEAP 不再等待每辆车(单词)都拥有完美的绿灯(100% 置信度)才允许其通行,而是向前看,发现道路畅通。它让那些已经平稳行驶的车辆立即通过,从而在不造成任何碰撞的情况下更快地清空十字路口。

该论文在数学问题、代码生成和一般问题上展示了这一点,表明 AI 可以在思考更少的情况下思考得更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →