← 最新论文
💬 NLP

Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space

本文介绍了顺序标记搜索(Order-Token Search),这是一种针对扩散语言模型的创新解码方法,通过共同探索生成顺序与标记空间,在数学推理和编程基准测试上超越了现有基准模型。

原作者: Yangyi Shen, Tianjian Feng, Jiaqi Han, Wen Wang, Tianlang Chen, Chunhua Shen, Jure Leskovec, Stefano Ermon

发布于 2026-02-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yangyi Shen, Tianjian Feng, Jiaqi Han, Wen Wang, Tianlang Chen, Chunhua Shen, Jure Leskovec, Stefano Ermon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个复杂的谜题,比如一道数学题或一个编程挑战,但你有一个神奇的助手(扩散语言模型)。这个助手并不像人类打字那样从左到右依次书写,而是从一张布满了“MASK”占位符的空白页开始,试图同时填满所有空格,猜测哪些词应该出现在什么位置。

问题在于,这个助手有点混乱。它可以按任何顺序填充空格。有时它猜对了第一个词,但接着因为第二个词猜错了而陷入困境。还有时候,它猜对了词却排错了顺序,导致走入了死胡同。

旧方法:猜测与剪枝

此前,人们尝试用两种主要方式来修复这个问题,但这两种方式都有缺陷:

  1. “自信”法(The "Confident" Approach): 助手会优先填充它最有把握的空格。这就像一个徒步旅行者,只走那些看起来最稳固的路径。
    • 优点: 它通常能很快得到一个不错的答案。
    • 缺点: 如果这条“稳固的路径”通向悬崖(错误的答案),徒步旅行者就会被困在那里。它永远不会去探索其他可能更好的路径。
  2. “随机”法(The "Random" Approach): 助手完全随机地选择要填充的空格。
    • 优点: 它探索了极其多样化的路径,因此最终很有可能撞见正确的解决方案。
    • 缺点: 它的行为过于散乱,很少能在第一次尝试时就选出最佳路径。这就像一个在原地转圈圈的徒步旅行者;他们可能会找到宝藏,但在此之前也会挖掉许多空洞。

新方案:顺序-标记搜索(Order-Token Search)

这篇论文的作者引入了一种名为顺序-标记搜索的新方法。你可以把它想象成一支协同作战的探险队

它不再只派出一名徒步旅行者或一群混乱的人群,而是派出了一支小型的团队(一个“束搜索/beam”)。以下是他们的运作方式:

  1. 分歧路径(搜索): 在定期的时间间隔内,团队会进行分化。每位探险家尝试不同的策略:

    • 探险家 A 决定填充第一个缺失的词。
    • 探险家 B 决定填充最后一个缺失的词。
    • 探险家 C 尝试在中间位置填入不同的词。
    • 类比: 他们同时在探索在哪里书写(顺序)以及写什么(标记)。
  2. 计分卡(似然估计器): 这是神奇之处。团队有一个特殊的裁判(似然估计器),他不仅仅看最终答案,而是观察探险家们采取的每一步。

    • 这个动作符合逻辑吗?
    • 这个不完整的句子结合之前写的内容来看是否合理?
    • 类比: 想象一位教练在观察接力赛。如果一名选手在早期就绊倒了,教练不会等到比赛结束才将其淘汰;教练会在那一刻立即叫停,因为他迈出的那一步本身就是错误的。
  3. 切断死路(剪枝): 裁判会对每位探险家的进度进行评分。如果一名探险家正在走一条看起来不太可能成功的路径(即使他们还没有完成任务),团队就会切断这条路径,并将资源集中在那些处于最佳轨道上的探险家身上。

为什么这很重要

论文在困难的数学问题(如 GSM8KMATH500 数据集)以及编程任务(HumanEval)上测试了这一方法。

  • 结果: “探险队”(顺序-标记搜索)比旧有的“自信”法或“随机”法更频繁地找到正确答案。
  • 对比: 它的表现非常出色,甚至达到了或超过了那些需要进行数月昂贵重训练的方法(如 diffu-GRPO)。这意味着,通过改变 AI 在测试期间的“思考方式”,我们就能让 AI 变得更聪明,而无需重新训练其大脑。

关于数独的特别说明

论文还尝试将此方法应用于数独谜题。有趣的是,它在数独上的表现并不理想。作者解释说,数独需要严格的全局规则(例如“每一行不能重复数字”),而 AI 内部的“计分卡”似乎无法理解这些规则。这就像给徒步旅行者一张没有标出悬崖的地图;无论他们如何探索,如果地图本身有误,他们都无法避免坠入深渊。这表明对于某些任务,AI 本身需要进行不同的训练,而不仅仅是改进搜索方法。

总结

论文表明,通过让 AI 同时探索多种不同的书写方式(顺序)和多种不同的词汇(标记),并使用智能评分系统及早切断糟糕的想法,我们可以让扩散语言模型在无需重新训练的情况下获得更好的结果。它将一场混乱的猜测游戏变成了一场结构化的、高效的真理搜索。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →