← 最新论文
💻 computer science

Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation

本文介绍了 Diffusion-Proof,这是首个将基于扩散的大语言模型应用于形式化定理证明的框架,它通过利用迭代去噪来实现长程连贯性和局部修正,从而超越了传统的自回归基准模型,在基准测试中取得了显著提升,并解决了一个现有最先进模型无法解决的国际数学奥林匹克(IMO)问题。

原作者: Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:修复 AI 数学中的“单行道”问题

想象一下,你正在尝试解决一个非常复杂的数学谜题,比如使用一种叫做 Lean 的形式化语言进行的证明。这种语言就像一段严苛的计算机代码,每一个步骤都必须在逻辑上完美无缺。如果你犯了一个微小的错误,整个证明就会崩塌。

多年来,处理这类工作的最佳 AI 模型一直是 自回归(Auto-Regressive, AR)模型。你可以把这些模型想象成一个正在逐字逐句写故事的人,严格地从左到右书写。他们看不见自己即将写下什么,也无法在不重写整个句子的情况下,轻松修改五分钟前写下的某个词。

问题所在:
在长篇数学证明中,这种“单行道”式的方法会导致两个大问题:

  1. 多米诺骨牌效应: 如果 AI 在早期犯了一个小错,它会不断基于这个错误进行构建,使错误不断累积,最终导致整个证明变得毫无意义。
  2. 无法“回溯”: 如果 AI 在写到一半时意识到第一步错了,它无法轻易地只修正那第一步。它要么必须从头开始,要么只能笨拙地尝试通过修改句子的结尾来强行匹配开头。

解决方案:“扩散”方法

该论文的作者提出了一种构建数学 AI 的新方法,称为 Diffusion-Proof。他们不再采用逐字书写的方式,而是使用了一种 扩散大语言模型(Diffusion Large Language Model, dLLM)

类比:雕塑家 vs. 抄写员

  • 旧方法(AR 模型): 想象一位正在写信的抄写员。一旦墨水干了,他们就无法更改。如果写错了一个词,他们只能划掉它,然后在旁边写下一段凌乱的备注。
  • 新方法(扩散模型): 想象一位用粘土创作的雕塑家。他们不仅仅是在添加粘土,而是从一个粗糙、带有噪声的土块开始,进行迭代式精炼。他们可以同时观察整体形状,在观察右侧曲线的同时,平滑掉左侧的一个凸起,并通过“去噪”整个画面来修复错误,直到作品趋于完美。

从技术层面讲,扩散模型是以块(blocks)(即单词块)而不是单个单词的形式生成文本。它可以同时观察句子的开头和结尾,从而确定中间部分应该填入什么。

Diffusion-Proof 如何运作:双人搭档组合

论文介绍了一个用于解决这些数学问题的两部分团队:

1. 架构师 (dLLM-Prover-7B)

这是主要的构建者。因为它采用了“雕塑家”的方法(块扩散),它在长程规划方面表现得更出色。

  • 为什么重要: 在构建长篇证明时,架构师可以把握“大局”。它知道最后的步骤需要满足某个特定条件,因此它会设定证明的开端,使其完美契合该条件。它不会在中间迷失方向,因为它能同时“看到”整块文本。

2. 检查员 (dLLM-Corrector-7B)

即使是最优秀的架构师也会犯错。有时证明看起来很完美,但某个特定的步骤却是错误的。

  • 旧方法: 如果 AR 模型犯了错,它通常会尝试通过在错误之后编写更多文本来试图修复,但这往往会让情况变得更糟。
  • 新方法: 检查员是一个专门训练用于填补空白的模型。如果证明失败了,系统会将出错的部分用一个“掩码”(类似于空白空间)盖住,并要求检查员仅仅重写那个特定的区块。
  • 超能力: 因为检查员使用的是扩散方法,它可以查看错误发生之前的文本和错误发生之后的文本,从而推断出缺失的部分究竟应该是什。这就像一位编辑,通过阅读句子中错误词汇前后的内容来猜测正确的单词,而不是仅仅根据前一个词进行猜测。

结果:击败巨头

研究人员在两个著名的数学基准测试上测试了这个新系统:

  1. MiniF2F: 一个包含高中及竞赛级数学问题的集合。
  2. ProofNet: 一个包含大学水平数学问题的集合。

计分板:

  • 这个全新的 Diffusion-Proof 系统击败了在完全相同数据上训练的传统(自回归)最佳模型。
  • 在 MiniF2F 测试中,它多解决了 6.14% 的问题。
  • 在 ProofNet 测试中,它多解决了 1.61% 的问题。

“IMO 时刻”:
最令人兴奋的结果是一个特定的国际数学奥林匹克(IMO)问题。一个非常先进且著名的 AI 模型——DeepSeek-Prover-V2(它使用“思维链”推理)未能解决这个问题。而 Diffusion-Proof 解决了它。

为什么?DeepSeek 模型陷入了一个试图修复自身计划的死循环,因为它无法看到证明开头与结尾之间的长程联系。而扩散模型凭借其能够同时观察整个证明“块”的能力,找到了正确的路径。

总结

该论文声称,通过从“逐字书写”转向“雕刻文本块”,AI 可以变得更擅长形式化数学。它创造了一个能够更好地进行长距离规划,并能通过观察整体上下文而非仅仅是即时过去来修复自身错误的系统。这使得它能够解决以往 AI 模型根本无法攻克的难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →