← 最新论文
🤖 machine learning

Rethinking Reasoning with MDLMs: Early Exits, Post-hoc Reasoning, and Beyond

本文为掩码扩散语言模型(MDLMs)引入了“推理即填空”(reasoning-as-infilling)技术,该技术通过明确指定答案区域,解锁了诸如早期退出和事后推理等独特能力,并最终证明了 MDLMs 可以实现与人类编写的思维链相媲美的推理性能,且能比自回归模型提供更准确的中间步骤评分。

原作者: Zachary Horvitz, Raghav Singhal, Hao Zou, Carles Domingo-Enrich, Zhou Yu, Rajesh Ranganath, Kathleen McKeown

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Zachary Horvitz, Raghav Singhal, Hao Zou, Carles Domingo-Enrich, Zhou Yu, Rajesh Ranganath, Kathleen McKeown

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正试图教一个机器人如何解开一个棘手的谜题。长期以来,教机器人的最佳方式是让它逐字阅读故事,根据它目前为止读到的所有内容来猜测下一个词。这就像一个正在参加考试的学生,必须逐行书写答案,且绝不允许向前预读或修改已经写下的内容。虽然这种方法在许多场景下表现良好,但它有一个缺陷:一旦机器人写错了一个词,它就会被这个错误困住,并且在摸索通往最终答案的过程中,很难“看到”最终的答案。

最近,科学家们开始实验一种不同类型的机器人大脑,称为“掩码扩散语言模型”(Masked Diffusion Language Model, MDLM)。与其逐字阅读,不如想象这个机器人面对的是一页被便利贴覆盖的纸。它的任务是猜出便利贴下的内容,但神奇之处在于,它可以同时观察整页内容,并以任何顺序同时猜测所有缺失的词。这就像是在玩一个拼图游戏,你可以同时填补角落、中间或边缘。这篇论文探讨了这种“填空式”的思维方式是否比传统的“逐字式”方法更擅长解决数学问题和逻辑谜题。研究人员想要看看能否利用这种新风格让机器人变得更聪明、更快速,并且在何时知道答案时更加诚实。

由 Zachary Horvitz 和 Raghav Singhal 领导的研究人员提出了一种聪明的技巧,称为“推理即填充”(reasoning-as-infilling)。他们不再只是要求机器人“思考然后回答”,而是给它一个带有特定方框的模板:一个用于思考步骤的大方框,以及最后用于存放最终答案的小方框,且该小方框有明确标记。然后,他们在机器人开始思考之前,先填入答案框。这听起来很反直觉,但它释放了超能力。

首先,因为机器人确切知道答案框的位置,它可以在编写思考步骤的同时,窥探自己的置信度。如果机器人对答案框内的内容变得非常确定,它可以立即停止思考并直接吐出结果。研究表明,在名为 GSM8k 的数学测试中,这种“提前退出”策略让机器人的速度提升了 1.3 倍,且几乎没有精度损失。当结合其他提速技巧时,它甚至可以运行 4 倍之快。这就像一个学生在写长篇论文的中途意识到自己已经知道了结论,于是直接写下最后一句话并提前交卷。

其次,这种方法实现了“事后推理”(post-hoc reasoning)。通常情况下,如果机器人的数学题做错了,很难教它正确的思考方式,因为它还不知道答案。但在这种新方法下,如果你先给机器人正确的答案,它可以倒推回溯,生成一个完美的、分步骤的解释过程。研究人员发现,通过让机器人针对这些“逆向生成的”解释进行训练,其数学成绩提高了 14.9%。这是一个巨大的飞跃,足以媲美雇佣人类来为机器人编写完美解释所带来的提升。这表明机器人可以利用自身的“未来知识”来进行自我教学。

最后,论文表明这种方法有助于机器人边做边判断自己的工作。当机器人编写思考步骤时,它可以不断检查:“如果我按这种方式完成思考,我达成目标答案的可能性有多大?”研究人员发现,这种自我检查得分在预测最终答案是否正确方面,比传统机器人的得分要准确得多。旧式的机器人往往直到最后才知道自己错了,而这种新机器人可以在早期就发现错误。

论文还指出了一些效果不佳的情况。他们测试了让机器人以完全随机的顺序(比如在左上角和右下角之间毫无规律地跳跃)来填充拼图碎片。他们发现,对于数学问题,这种混乱的方法实际上会让机器人的表现变差,导致它经常先猜错答案,然后再编造一个虚假的故事来为其辩护。机器人需要一定的结构,比如“推理框”和“答案框”这样的模板,才能保持不偏离轨道。

简而言之,这篇论文表明,通过改变我们要求 AI 思考的方式——给它一个可以填写的模板,而不是一张空白的纸——我们可以让它更快、更好地从错误中学习,并更有能力检查自己的工作。这虽然不是解决一切问题的万能药,但它为构建更聪明、更高效的推理机器提供了一种极具前景的新途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →