← 最新论文
🤖 machine learning

From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models

本文通过提出基于插入和潜空间的方法来解决位置不确定性,从而弥补了掩码扩散模型在任意顺序训练接口与推理能力之间的差距,进而实现了原生的任意顺序推理,并提升了在代码生成和数学问题等离散推理任务上的性能。

原作者: Seunggeun Kim, Jaeyeon Kim, Taekyun Lee, Yuyuan Chen, Yilun Du, Sham Kakade, Sitan Chen

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Seunggeun Kim, Jaeyeon Kim, Taekyun Lee, Yuyuan Chen, Yilun Du, Sham Kakade, Sitan Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人如何写故事或解数学题。长期以来,教机器人的最佳方式是让它一次只说一个词,严格地从左到右,就像人类阅读书籍一样。这被称为“自回归”(autoregressive)生成。这种方式效果很好,但有点僵化。如果机器人在第一句话时犯了错,它就必须基于这个错误继续写完整个故事,或者必须从头开始。它无法像人类编辑那样,在写中间部分时轻松地跳回并修正开头。

最近,科学家们发现了一种新型 AI,叫做“掩码扩散模型”(Masked Diffusion Model)。你可以把它想象成一个“填空游戏”。与其一个词一个词地写作,不如让 AI 查看一些被隐藏(掩码)了单词的句子,并尝试猜出它们是什么。因为它可以随时查看任何被隐藏的单词,所以它应该能够跳来跳去,先修补开头,再修补结尾,然后是中间,以任何它想要的顺序进行。对于像编程这样复杂的任务,这似乎是一个完美的工具,因为程序员经常在宏观全局和微观细节之间来回切换。但问题在于:仅仅因为 AI “可以”跳来跳去,并不代表它“会”这样做。

这篇论文研究了为什么这些强大的“填空式”机器人经常陷入一种窠臼,尽管拥有自由度,却表现得就像旧式的“从左到右”机器人一样。来自德克萨斯大学奥斯汀分校和哈佛大学的研究团队发现了其中隐藏的陷阱——“位置不确定性”(positional uncertainty)。他们发现,虽然 AI 可能知道需要什么词(比如程序中的某个特定函数),但它却会对这个词在最终句子中的位置感到困惑。由于它对位置不确定,它会选择保守的做法,以一种枯燥、可预测的顺序来填充空格,从而失去了它本应擅长的非线性思维能力。

为了解决这个问题,研究人员不仅调整了机器人的信心,还给了它两个新的“超能力”。第一个超能力就像是给了机器人一把剪刀和一瓶胶水。与其受限于固定数量的空白空间,机器人现在可以在任何需要的地方插入新的空白空间,从而移动整个句子来为新想法腾出空间。第二个超能力则像是教会机器人以“块”或“段落”而不是单个单词来思考。它不再是一个词一个词地猜测,而是同时猜测整块的含义,从而在不迷失于细节的情况下,决定下一步要构建哪个大想法。

团队在计算机编程和数学问题上测试了这些想法。他们发现,通过使用这些新方法,机器人实际上开始像人类程序员一样思考,在代码的不同部分之间来回跳转以完善工作。这带来了更好的结果,即机器人比以前能更正确地解决更多问题。论文指出,要让 AI 真正像人类一样推理,我们需要设计出不仅具备“跳跃”能力,而且其内部机制能让“跳跃”成为自然且容易选择的模型。

问题所在:“固定画布”陷阱

研究人员首先观察了为什么这些“填空式”模型(掩码扩散模型,简称 MDM)未能达到其宣传的高度。理论上,一个 MDM 应该能够在序列中的任何时间揭示任何被掩码的标记(token)。如果你要求它写一段 Python 程序,它应该能先写出函数名,然后跳到循环部分,再回到变量定义处,呈现出一种混乱且类似人类的顺序。

然而,当他们在实际操作中观察这些模型时,却看到了令人失望的结果。尽管模型拥有选择任何顺序的自由,但它们几乎总是选择从左到右填充空格,就像那些老式的机器人一样。作者称之为“因果坍缩”(causal collapse)。这就像是一个机器人明明拥有一张完整的城市地图,却决定依然按部就班地一街区一街区地行走,忽略了所有的捷径。

论文认为这不仅仅是一个坏习惯,更是模型构建方式中的一个根本性缺陷。问题在于位置不确定性。想象一下你在搭一个乐高城堡。你知道你需要一个“塔楼”零件,但由于你还没围绕它建好墙壁,你还不确定塔楼具体该放在哪里。如果你现在尝试放置塔楼,可能会放错位置。

在标准的 MDM 中,“画布”(标记序列)是固定的。模型必须决定:“我是把‘return’语句放在这里,还是那里,或者那里?”如果模型知道它需要一个 ‘return’ 语句,但不确定它属于循环内部还是循环之后,它的信心就会分散在所有可能的地点。因为信心被分散了,模型对于放置那个 ‘return’ 语句的把握,会比放置一个明显紧跟在前一个词之后的简单词要“低”。因此,为了保险起见,它只会先填充那些容易的、局部的词,从而有效地将自己锁定在从左到右的顺序中。论文表明,即使模型非常聪明,这种固定的网格也会迫使它做出过早的承诺。

解决方案 1:FlexMDM(剪刀与胶水)

为了解决“我该把这个放在哪儿?”的问题,第一个解决方案被称为 FlexMDM。这种方法通过取消固定画布改变了游戏规则。

想象你在纸上写故事,但你不再受限于最初的行间距,而是拥有一把神奇的橡皮擦和一瓶胶水。如果你写了一句话,突然意识到需要在中间插入一个新段落,你可以神奇地在那里插入一行新的空间。你之前写的词可以向后滑动,为新内容腾出位置。

FlexMDM 正是如此。它允许模型在生成过程中插入新的标记(或掩码)。当模型决定揭示一个标记时,它不必承诺其在最终序列中的永久位置。稍后,如果模型觉得需要更多空间或不同的结构,它可以插入新的间隙,之前揭示的标记也会随之移动到它们正确的新位置。

这个简单的改变打破了“位置不确定性”的陷阱。模型不再需要担心“这是不是正确的地点”,因为地点是可以移动的。研究人员发现,这使得模型能够以更像人类的方式生成代码。它不再是在完成一行后再开始下一行,而是可以先起草一个函数名,然后跳到编写循环,然后再回到填充函数的细节。他们通过观察代码的“树状”结构来衡量这一点,发现 FlexMDM 更容易在代码的不同分支之间跳转,而标准模型只是沿着一条路径直行。

在测试中,他们使用了一个 70 亿参数的模型(Dream-Coder)来微调这种方法。在 HumanEval 和 MBPP 等编程基准测试中,这个新的“灵活”模型表现得比原始模型更好,尤其是在允许它进行多次尝试(Pass@16)时。这表明,通过让模型重新排列画布,它可以探索更多具有创造性的解决方案。

解决方案 2:LatentMDM(以“块”进行思考)

第二个解决方案 LatentMDM 采取了不同的路径。它不再纠结于单个单词的位置,而是改变了模型思考的层级。

想象你在向朋友描述一部电影。如果你试图逐字描述(“那个人走了,然后他停了下来,然后他看向……”),很难描述出宏观全貌。但如果你用“场景”或“块”来描述(“首先,英雄进入房间。然后,他看到了反派。最后,他们开战。”),那就容易多了。你可以说,“让我们先聊聊打斗场面,”而不必担心进入场面时使用的确切词汇。

LatentMDM 通过将标记组合成语义段(如代码行或逻辑块),并将每个段视为“潜空间”(一种压缩的、抽象的意义表示)中的一个单一单元来实现这一点。模型不再是一个接一个地猜测标记,而是决定下一个要揭示哪个段落

这把“位置不确定性”从单个单词的层面转移到了整个想法的层面。模型不需要担心某个特定的词是放在第 5 个位置还是第 6 个位置,它只需要决定:“接下来我要写‘循环’这一段。”因为段落的粒度更粗,即使内部的具体词汇仍在摸索中,模型也能对想法的顺序更有信心。

研究人员使用这种方法在一个名为 TinyGSM 的数学数据集上,从头训练了一个较小的 1.25 亿参数模型。他们发现,这个模型实际上可以选择以非从左到右的顺序揭示段落,而标准模型无法有效做到这一点。事实上,LatentMDM 在处理数学问题时,表现优于标准模型,甚至优于一些更大的自回归模型,且运行速度更快。这表明,通过“分块”思考,模型可以更高效地导航解空间,在不被细节困扰的情况下找到正确的路径。

这意味着什么

论文得出结论:仅仅拥有“任何顺序推理”的接口(即可以选择任何空格的能力)是不够的。模型的内部机制也必须支持它。如果模型被困在固定的词语网格中,它会自然而然地坍缩成从左到右的顺序,因为它太害怕在“位置”上出错。

通过要么让网格变得灵活(FlexMDM),要么通过更大的块进行思考(LatentMDM),研究人员证明了 AI 确实可以摆脱“从左到右”的习惯。这些模型不仅仅是在生成文本,它们还在以一种模仿人类思考和构建复杂事物的结构进行生成——跳回、完善想法,并在最终定稿前探索不同的路径。

作者谨慎地指出,这些都是充满希望的进展,而非解决所有 AI 推理问题的终极方案。他们主要在编程和数学领域测试了这些想法,虽然结果强劲,但也暗示需要更多工作来观察这些“任何顺序”的行为是否适用于其他类型的任务或更大规模的场景。但核心信息很明确:要构建像人类一样推理的 AI,我们不能只强迫它像打字机一样写作,而要让它像建筑师一样思考。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →