← 最新论文
💬 NLP

Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens

本文介绍了 ASRD,这是一个无需训练的框架,它通过将解码上下文解耦为可信锚点标记和不确定候选标记,来增强扩散大语言模型,从而同时抑制误差传播和局部误差强化,进而显著提升准确率和推理吞吐量。

原作者: Yizhen Yao, Qinglin Zhu, Runcong Zhao, Xiangxiang Dai, Yanzheng Xiang, Yulan He, Lin Gui

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizhen Yao, Qinglin Zhu, Runcong Zhao, Xiangxiang Dai, Yanzheng Xiang, Yulan He, Lin Gui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个复杂的谜题,比如一道数学题或编写一段代码,但你必须一次性猜出所有的碎片,而不是一个接一个地放置。这就是**扩散大语言模型(Diffusion Large Language Models, dLLMs)**的工作方式。它们从一张白纸(所有碎片都被覆盖)开始,并试图同时揭示整个画面。

问题在于?它们有时会在早期猜错一些碎片。因为它们是同时揭示所有内容的,这些错误的猜测会与正确的猜测混杂在一起。当模型试图猜测下一个碎片时,它会被自己刚刚做出的错误猜测所迷惑。这就像是在讲故事时,有人一直在你耳边低声说着错误的剧情转折。

这篇论文介绍了一种名为 ASRD(锚点监督可撤回解码,Anchor Supervised Revocable Decoding)的新方法来解决这个混乱。你可以把它想象成模型的脑中的“质量控制经理”。

以下是 ASRD 的工作原理,我们使用简单的类比:

1. 问题所在:“糟糕邻里”效应

在之前的方法中,模型会猜一个词,检查它看起来是否还可以,如果通过了一个基本测试,它就会保留它。但问题在于:模型是在一群尚未经过验证的、潜在错误的词语包围下检查这些新词的。

  • 类比: 想象你身处一个充满人都在试图解开谜题的房间里。有些人正在大声喊出错误的答案。如果你试图在听着所有人喊叫的同时去猜谜题的下一部分,你可能会不小心模仿他们的错误。这被称为误差传播(Error Propagation)
  • 陷阱: 有时,一群人可能会仅仅因为他们在互相模仿对方,就对一个错误的答案达成共识。他们看起来很有信心,但其实是错的。这就是局部误差强化(Local Error Reinforcement)

2. 解决方案:“锚点”系统

ASRD 改变了规则。它不再盲目信任所有人,而是识别出一小组“锚点”——即那些因为在好几个步骤中都保持不变,从而让模型感到绝对确定的碎片。

  • 锚点 Token 缓存(Anchor Tokens Cache, ATC): 把这看作是一个“信任团队”或“坚实的基石”。只有当一个词在几轮猜测中保持一致且稳定时,模型才会将其提升为“锚点”。一旦一个词成为了“锚点”,它就被视为事实。

3. 两个神奇的动作

ASRD 利用这个“信任团队”通过两种方式修正模型的思维:

A. 引导猜测(锚点引导生成)

当模型需要猜测一个新词(被遮盖的位置)时,它通常只是观察那群未经验证的嘈杂词语。ASRD 告诉模型:“暂时忽略嘈杂的人群。看着你的‘信任团队’(锚点),并将它们作为指南针。”

  • 类比: 这就像是在大雾弥漫的海面上航行的船只。与其通过观察附近其他困惑的船只来导航,船长通过观察灯塔(锚点)来导航。这防止了船只因为雾气而偏离航向。
  • 结果: 模型生成的词更有可能正确,因为它们正被拉向可靠的事实。

B. 压力测试猜测(锚点扰动验证)

在模型锁定一个新猜测之前,ASRD 会给它一个轻微的“摇晃”。它会问:“你确定你对了,还是你只是在附和那些嘈杂的邻居?”

  • 类比: 想象一群朋友都在对一部电影的情节达成共识。如果你轻轻地将对话方向稍微推向不同的方向(以“信任团队”作为参考),那些仅仅是在互相模仿的朋友会踉跄一下并承认自己错了。但那些真正了解真相的朋友会保持稳固。
  • 结果: 如果一个猜测在被“摇晃”时崩溃了,ASRD 会抹除它并重新尝试。这打破了坏词互相强化的循环。

为什么这很重要

论文表明,这种方法取得了巨大的成功:

  1. 更聪明: 通过将“信任的事实”与“不确定的猜测”分离,模型犯错更少了。在数学和编程测试中,它的正确率显著提高(提升了高达 6.4%)。
  2. 更快: 因为模型犯的错误更少,它不需要回头去修复那么多东西。它可以用更少的步骤完成拼图,这使得它的速度比以前快了多达 7.2 倍

总结

简而言之,ASRD 教会了 AI 停止倾听混乱的人群,转而信任自己稳定、可靠的记忆。它扮演着一位睿智的编辑,说道:“让我们锁定那些我们已知为真的部分,利用它们来引导剩余的部分,并剔除那些仅仅是在互相模仿的部分。” 结果是一个更快、更准确、不会迷失在自身错误中的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →