← 最新论文
🤖 AI

Process-Verified Reinforcement Learning for Theorem Proving via Lean

本文介绍了一种强化学习框架,该框架利用 Lean 证明助手作为符号过程预言机(symbolic process oracle),以提供密集、细粒度且可靠的策略级(tactic-level)反馈,与传统的仅基于结果的奖励方法相比,显著提升了在 MiniF2F 和 ProofNet 等基准测试上的定理证明性能。

原作者: Minsu Kim, Se-Young Yun

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Minsu Kim, Se-Young Yun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决复杂的数学谜题。在过去,我们教这些机器人(即大语言模型)的方式,就像是在玩一场由一位非常严格的裁判监督的“靠近或远离(Hot or Cold)”游戏。

旧的方法:“通过或失败”教练
以前,机器人会写出数学题的完整解法。裁判(一个叫做 Lean 的计算机程序)会查看最终答案,然后只说一句话:“你答对了!”或者“你答错了。”

如果机器人答错了,它完全不知道原因。是第一步就出错了?还是中间用错了公式?或者只是时间不够了?这就像一个学生在没看到评分纸的情况下得到了一个“不及格”,机器人只能猜测哪里出了错,然后重试,这种方式既慢又低效。

新的方法:“循序渐进”教练
这篇论文介绍了一种更聪明的训练机器人的方式。与其仅仅等待最终答案,不如让 Lean 裁判循序渐进地观察机器人的思考过程。

把数学证明想象成用积木搭塔:

  • 旧的方法: 你搭好整个塔,如果最后塌了,教练只会说:“坏塔。”你必须猜测是哪块积木导致了坍塌。
  • 新的方法(本论文): 教练看着你放置每一块积木。
    • 如果你放对了一块,教练会给你一个微小的“做得好!”(正向信号)。
    • 如果你放错了一块,教练会立即说:“停!这块不对。”
    • 至关重要的一点是: 教练会解释,因为那块积木错了,所以你放在它上面的每一块积木现在都是无效的,即使它们看起来本身没错。这被称为**“首错传播(First-Error Propagation)”**。它教会机器人,一个错误会毁掉整个基础。

论文是如何运作的
研究人员使用了一种叫做**强化学习(Reinforcement Learning)**的方法。以下是他们“秘方”的拆解:

  1. 神谕(The Oracle): 他们不仅将 Lean 证明助手作为最终的评判者,还将其作为过程神谕(Process Oracle)。这意味着它扮演着一个完美理解逻辑规则的超级老师,能够实时发现错误。
  2. 反馈循环: 当机器人尝试解决问题时,Lean 会将解法分解为一系列“策略(Tactics)”(即小的逻辑步骤)。
    • 如果整个证明成功,机器人会获得一个大的奖励。
    • 如果证明失败,Lean 会告诉机器人究竟是哪一步失败了。机器人由此学习到,失败之前的步骤是正确的,但失败的那一步以及之后的所有步骤都是错误的。
  3. 信用分配系统(The Credit System): 论文发现,一个步骤中最关键的部分是该步骤的第一个词(或 Token)。它就像是一个“命令词”(例如:“加”、“乘”、“假设”)。研究人员决定将奖励或惩罚专门针对这个第一个词进行分配。这有助于机器人学习如何为这项工作选择正确的“命令”,而不是仅仅死记硬背整个句子。

结果
当他们在著名的数学基准测试(MiniF2F 和 ProofNet)上测试这种新方法时:

  • 机器人学习得更快,犯错更少。
  • 与仅使用“通过/失败”反馈训练的机器人相比,它们变得更加稳定和可靠。
  • 它们的表现优于那些试图使用其他不太精确的方法来猜测哪些步骤是好的机器人。

大局观
核心结论是,形式化证明助手(如 Lean)不应仅仅被用来在最后检查答案。它们可以在训练过程中充当教练。通过提供关于机器人“如何思考”而非仅仅是“得出什么结论”的密集、具体的反馈,我们可以构建出更聪明、更可靠的 AI 来解决困难的逻辑问题。

他们没有做的事情
这篇论文非常明确地说明了其成就。它并未声称解决了所有的数学问题,也没有声称这种方法适用于写故事或与人聊天。它严格限于教 AI 使用 Lean 语言来证明数学定理。他们还指出,他们没有将自己的方法与其他“学习型”教练进行比较,因为对于这种特定类型的数学,目前还不存在需要大量人类编写示例的教练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →