← 最新论文
🤖 machine learning

Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models

本文介绍了自我感知调度(Self-Aware Scheduling, SAS),这是一个通过推导解码失配的可解上界来训练轻量级策略,从而优化掩码扩散语言模型中标记去掩码顺序的原则性框架,与启发式调度相比,该框架显著提升了在数独和数学推理等任务上的生成质量。

原作者: Jiawei Xu, Minghui Liu, Aakriti Agrawal, Yifan Chen, Furong Huang

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiawei Xu, Minghui Liu, Aakriti Agrawal, Yifan Chen, Furong Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:机器如何“思考”至关重要

想象一下,你正在尝试拼凑一个巨大的拼图,但你看不见包装盒上的图案。你必须猜测每一块碎片应该放在哪里。

大多数 AI 模型(比如那些写文章或写代码的模型)的工作方式就像一个人在读书:它们一个词、一个词、一个词地按顺序写出来,严格遵循从左到右的直线顺序。这被称为**自回归(Autoregressive)**生成。

然而,一种新型的 AI——扩散模型(Diffusion Model),其工作方式则完全不同。想象一下,你有一个拼图,每一块碎片都被一个黑方块(“掩码/Mask”)盖住了。AI 的任务就是逐一揭开这些碎片,直到整幅图像显现出来。

问题在于: AI 有多种选择。它可以按任何顺序揭开碎片。

  • 它可以先从角落的碎片开始(容易)。
  • 它可以先从中间的碎片开始(难)。
  • 它也可以随机挑选碎片。

过去,科学家们告诉 AI 根据简单的规则来挑选,比如“总是先选出现在看起来最确定的那个碎片”。论文将这些称为启发式调度(Heuristic Schedules)。作者认为这些规则是“近视”的(短视的)。它们先挑容易的碎片,但这可能会让剩下的拼图变得更难解决。

解决方案:“自我感知调度”(SAS)

作者创造了一种名为**自我感知调度(Self-Aware Scheduling, SAS)**的新方法。AI 不再遵循僵化的规则,而是学习它自己的“思考顺序”。

这就像一个学生在参加考试:

  • 旧方法(启发式): 学生看着试卷,立即回答所有他百分之百确定的问题,把难的问题留到最后。如果这些简单的问题无法提供足够的线索来解决难题,学生就会陷入困境。
  • SAS 方法: 学生看着整张试卷并问道:“如果我先做第 5 题,它能否为我解决第 10 题提供必要的线索?”学生学会了挑选那个能让剩余部分更容易完成的问题,即使这个题目本身现在并不容易回答。

它是如何工作的(“秘诀”)

论文使用了一些复杂的数学公式,但概念很简单:

  1. “自我感知”奖励: AI 有一个“大脑”(模型),它已经训练好了。新的部分是一个“管理者”(策略),负责决定顺序。
  2. 测试: 管理者尝试不同的揭开拼图碎片的顺序。
  3. 评分: 与其等到最后看拼图是否完成(这很慢且很难成功),管理者会检查:“给定我刚刚选定的顺序,我的‘大脑’现在能多好地解释这个答案?”
    • 如果这个顺序让“大脑”感到自信且逻辑通顺,管理者的得分就高。
    • 如果这个顺序让“大脑”感到困惑,得分就低。
  4. 学习: 管理者利用这个分数来学习哪些顺序效果最好。这就像教练告诉球员:“不要只是跑得快;要朝着能帮助整个团队获胜的方向跑。”

研究发现(结果)

研究人员在三种不同类型的“拼图”上测试了该方法:

  1. 数独(逻辑谜题):

    • 他们使用了一个 10 亿参数的 AI。
    • 旧方法: 最好的“基于规则”的方法解决了约 82% 的谜题。
    • SAS 方法: AI 学会了自己的顺序,解决了 91.8% 的谜题。
    • 惊喜: 甚至人类专家的“逻辑”顺序(先解最简单的数字)也比不上 AI 学到的顺序!AI 找到了一条更适合其特定“大脑”的路径。
  2. 数学问题 (GSM8K):

    • 他们使用了一个更大的 80 亿参数 AI。
    • 旧方法: 正确解决了 64% 的问题。
    • SAS 方法: 正确解决了 76% 的问题。
  3. 编程 (MBPP):

    • 旧方法: 解决了 39.5% 的问题。
    • SAS 方法: 解决了 41% 的问题。

“第二阶段”加成

论文还发现,一旦 AI 学会了最佳思考顺序,你可以针对这条路径给 AI 进行额外的专门训练。

  • 这就像音乐家学习了一首曲子的最佳练习方式,然后只通过这种方式练习直到精通。
  • 在数独任务中,这一额外步骤将准确率从 91.8% 提升到了 97.5%

为什么这很重要

论文声称,AI 如何思考(它揭示信息的顺序)与它知道什么同样重要。通过教 AI 规划自己的思考路径,而不是强迫它遵循僵化的规则,我们可以让它在解决数学、逻辑和编程等复杂问题时变得更加聪明。

简而言之:这篇论文教 AI 不仅仅是“猜下一个词”,而是开始“规划通往答案的最佳路径”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →