← 最新论文
💬 NLP

Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models

本文介绍了 LATCH,这是一个针对扩散语言模型(Diffusion Language Models)的无需训练的框架,它通过结合置信度验证提交(Confidence-Verified Commit)与块状早期提交(Block-Wise Early Commit),在不依赖后缀提示或固定超参数的情况下,通过动态验证输出稳定性并加速非最终标记块,实现了显著的推理加速(高达 17.8 倍),同时保持了接近全解码的准确度。

原作者: Chia-Ming Lee, Ming-Ching Chang, Xin Li, Yu-Lun Liu, Chih-Chung Hsu

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Chia-Ming Lee, Ming-Ching Chang, Xin Li, Yu-Lun Liu, Chih-Chung Hsu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个复杂的谜题,但你不是从左到右一个接一个地放置碎片,而是从一个完全被浓雾笼罩的棋盘开始。每隔几秒钟,雾气就会消散一点点,同时为棋盘上的每一个位置揭示出一个模糊的猜测。这就是一种新型人工智能——**扩散语言模型(Diffusion Language Model)**的思考方式。不同于以往像人类打字那样一个词接一个词生成句子的 AI,这种 AI 能同时看到整个画面的演变过程。

科学家们面临的一个大问题是:什么时候该停止? 由于 AI 在不断优化它的猜测,它不需要等到最后一秒才看到最终答案。通常情况下,答案在过程“完成”之前很久就已经趋于稳定并停止变化了。如果你能准确判断出答案何时已经定型,你就可以提前停止计算,从而节省大量的计算时间和能源。然而,过早停止是有风险的;如果你在 AI 还在两个不同的答案之间反复摇摆时就冻结了棋盘,你可能会锁定一个错误的结论。挑战在于构建一个“智能停止按钮”,它能够分辨出什么是暂时的停顿,什么是最终的决定。


论文的故事: “LATCH” 系统

这篇论文介绍了一个名为 LATCH(局部加速与追踪候选者停机,Localized Acceleration with Tracked-Candidate Halting)的巧妙新系统,它充当了这些模糊谜题 AI 模型的超级智能停止按钮。来自阳明交通大学和纽约州立大学奥尔巴尼分校的研究团队意识到,以往试图加速这些模型的方法就像是在使用钝器:它们要么停止得太早导致出错,要么等待得太久导致浪费时间。

把 AI 的解码过程想象成一段长长的火车旅程,由若干节车厢(块/blocks)组成。火车向前行驶,在每一节车厢里,乘客(AI 的猜测)都在努力决定最终的目的地。

  • 问题所在: 旧的方法观察整列火车并说:“嘿,第一节车厢的乘客看起来很满意,所以让我们停止整列火车吧!”但在长期的、复杂的推理任务(如复杂的数学题)中,第一节车厢的乘客可能对一个错误的答案感到满意,而真正的答案仍在最后一节车厢中被逐步推导出来。
  • LATCH 的解决方案: 作者将这项工作分成了两个截然不同的角色,就像一名列车长和一名当地站长。

1. 当地站长 (BWEC):“在哪里加速”
LATCH 的第一部分被称为 块级早期提交 (BWEC),它扮演着当地站长的角色。它观察火车的早期车厢(非最终块)。如果某一节车厢里的乘客看起来很有信心并且已经确定了方向,站长就会说:“太好了,这节车厢完成了!让我们跳过这节车厢剩余的停靠点,进入下一节。”这显著加快了答案中那些仅仅是中间步骤部分的旅程,比如在写出最终句子之前先进行数学运算的过程。

2. 列车长 (CVC):“何时停止火车”
第二部分是 置信度验证提交 (CVC),它是那位严格的列车长,负责决定整列火车何时可以停止。这是最关键的部分。列车长不仅仅观察乘客看起来有多“开心”;他们实际上会检查答案本身

  • 他们会不断地重新阅读 AI 正在生成的最终答案。
  • 他们会询问:“这个答案是否已经连续好几步都没有变化了?”
  • 他们会询问:“AI 对这个答案真的有把握吗?”
  • 只有当答案在特定的步数内保持稳定且具有置信度时,列车长才会拉下紧急制动闸并说:“好了,我们得到答案了。停止火车。”

他们的发现

研究团队在 11 个不同的任务上测试了 LATCH,涵盖了从简单的选择题到需要长链推理的困难数学题。他们使用了两种不同的 AI 模型——LLaDADream,并发现 LATCH 是一个游戏规则改变者。

  • 速度: 对于短小、简单的答案,LATCH 比标准方法快 9.3 到 17.8 倍。对于长篇、复杂的推理任务,速度提升了 2.0 到 3.3 倍
  • 准确性: 尽管如此早地停止,LATCH 并没有出错。它的准确率与完整的、缓慢的方法相比,误差保持在 2.0 个百分点以内。在许多情况下,它获得了与慢速方法完全相同的得分。
  • 无需训练: 最棒的一点是,LATCH 不需要针对每个新任务进行重新训练或学习新技巧。团队设定好规则后,这些规则在所有 11 个任务和两种模型上都能完美运行,无需任何更改。

他们排除了哪些可能性

论文明确反对了这样一种观点,即你可以仅仅通过观察“置信度分数”或“进度条”来决定何时停止。

  • 旧方法失败的原因在于它们观察整个序列并看到高置信度分数,便认为工作已完成。但作者证明了,在长篇推理任务中,AI 可能会对一个错误的答案表现出很长时间的高置信度,然后在最后一秒突然转向正确的答案。
  • 他们证明了仅根据“经过了多少时间”或“填充了多少 Token”来停止是危险的。如果你在数学题的过程中过早停止,你可能会在计算真正完成之前就冻结了答案。
  • 他们还表明,你不能用同样的“停止规则”来应对短问答和长文章。停止的规则必须针对答案本身,而不是仅仅针对过程。

核心结论

作者认为 LATCH 是一种非常高效的、“无需训练”的方法,可以在不损失智能的前提下,让这些强大的 AI 模型变得更快。通过将“加速中间步骤”的任务与“验证最终答案”的任务分离,他们创建了一个知道在哪里加速以及何时停止的系统。这就像拥有一位导游,他知道什么时候可以跳过博物馆中无聊的部分,但又坚持要留下来直到欣赏完杰作,确保你不会为了节省几分钟而错过最精彩的部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →