← 最新论文
🤖 AI

Pythagoras-Prover: Advancing Efficient Formal Proving via Augmented Lean Formalisation

Pythagoras-Prover 是一个计算高效的开源 Lean 定理证明器家族,它利用基于课程的监督微调和增强型 Lean 形式化技术,以显著少于现有模型的参数量,在形式化证明基准测试中实现了最先进的性能。

原作者: Joshua Ong Jun Leang, Zheng Zhao, Mihaela Cătălina Stoian, Qiyuan Xu, Haonan Li, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Joshua Ong Jun Leang, Zheng Zhao, Mihaela Cătălina Stoian, Qiyuan Xu, Haonan Li, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人去解决极其困难的数学谜题,但有一个限制:机器人必须使用一种名为 Lean 的严格、计算机可读的语言来编写它的解法。如果机器人犯了哪怕极其微小的逻辑错误,计算机都会拒绝这个答案。这就是 自动定理证明(Automated Theorem Proving) 的世界。

长期以来,让机器人擅长这一领域的唯一方法是向它喂入海量的数据,并使用一个巨大的“大脑”(计算机模型),其运行成本高达数百万美元。这就像是通过雇佣一支由 1,000 名特级大师组成的团队来为你思考,从而试图赢得一场国际象棋锦标赛。

这篇论文介绍了 Pythagoras-Prover,这是一个全新的机器人数学家家族,它证明了你不需要一个巨大的大脑或百万美元的预算也能取胜。他们通过三个聪明的技巧实现了这一点:

1. “训练营”(课程学习 / Curriculum Learning)

他们没有直接把机器人扔进最难的问题中,而是建立了一个包含“简单、中等、困难”三个等级的 训练营

  • 类比: 想象你在教一个孩子骑自行车。你不会一开始就带他去爬山径。你会从平坦的人行道(简单)开始,然后是缓坡(中等),最后才是山路(困难)。
  • 他们是如何做的: 他们创建了一个庞大的数学问题库。如果一个问题对机器人来说太难了,他们并不会直接丢弃它。相反,他们使用一个“评分标准”(一份常见错误清单)将问题拆解成机器人 能够 解决的更简单的版本。这使得机器人能够循序渐进地学习,在挑战巨型难题之前建立信心和技能。

2. “填词游戏”机器(增强型 Lean 形式化 / Augmented Lean Formalisation)

该领域最大的问题是缺乏优质的练习题。研究人员意识到,他们可以创造出 更多 的练习题,而无需依靠人类编写或超级计算机来检查。

  • 类比: 想象你有一个完美的数学故事。与其从头开始写一个全新的故事,不如玩一场“填词游戏”(Mad Libs)。你更换数字、改变角色名字或重新排列步骤的顺序,但故事的 逻辑 保持不变。
  • 他们是如何做的: 他们提取了已验证的问题,并使用一个名为 ALF 的工具对其进行变异。他们创建了各种变体(更简单的版本、更难的版本,或者仅仅是不同的措辞)。他们并没有用那个严格且缓慢的计算机去检查每一个新变体;他们只是检查了新问题是否 看起来 像一个有效的数学问题。这使他们的练习题库扩大了 2.5 倍,为机器人提供了更多的学习材料。

3. “自我反思”循环(自我蒸馏 / Self-Distillation)

一旦机器人学会了基础知识,他们就让它进行自我教学。

  • 类比: 想象一个刻苦学习的学生。他不仅仅是参加考试,还会尝试解决刚刚学过的问题的各种 变体。如果他做对了,他就把这个过程记录下来,作为以后学习的新案例。
  • 他们是如何做的: 机器人为那些“填词游戏”式的变体生成了证明。尽管他们没有对每一个变体都进行双重检查,但机器人能够为变体生成证明这一事实,意味着它真正理解了逻辑,而不仅仅是死记硬背答案。这种“自学”的数据让机器人变得更加聪明。

结果:小脑,大胜

论文将他们的新机器人与该领域的现有“巨头”进行了比较:

  • 4B 机器人: 这个机器人拥有 40 亿个“神经元”(参数)。它比之前的冠军(DeepSeek-Prover-V2,拥有 6710 亿个神经元)大约 小了 167 倍
    • 结果: 尽管规模如此之小,这个 4B 机器人正确解决的问题数量竟然 超过 了那个巨型机器人。这就像是一个高中数学天才击败了一支由博士组成的团队,因为这位天才接受了更好的训练。
  • 32B 机器人: 这个稍大一点的机器人成为了在这些基准测试中表现 最好的开源机器人,解决了 93% 的问题。

“扩散”实验(The "Diffusion" Experiment)

研究人员还尝试了一种不同的思维方式,称为 扩散(Diffusion)

  • 类比:
    • 标准方式(自回归 / Autoregressive): 从左到右一个词一个词地写句子。如果你在早期犯了错,你必须重写整个句子。
    • 扩散方式: 想象一个句子的模糊草图。机器人看着整个草图,并一次性填补缺失的单词,不断完善图像直到清晰。它可以在不重写开头的情况下修复中间的错误。
  • 结果: 这个“扩散”机器人的生成速度比标准机器人快了 2.5 倍,尽管其准确度略低。这展示了一种在速度与精度之间进行权衡的新方法。

“压力测试”(MiniF2F-ALF)

为了观察机器人是在仅仅死记硬背答案,还是真的在学习,研究人员创建了一个“压力测试”。他们使用相同的“填词游戏”技术对测试题目进行了轻微的变异(更改数字、交换变量)。

  • 结果: 大多数机器人都在这项测试中失败了,因为它们死记硬背了原始问题。然而,Pythagoras-Prover 在处理这些变体时表现得好得多。这证明了它们学习的是 数学逻辑,而不只是特定的答案。

总结

Pythagoras-Prover 表明,你并不需要一台超级计算机来解决复杂的数学证明。通过使用智能的训练计划、创建无穷无尽的练习题变体,以及让机器人进行自我教学,你可以构建出一个高效、精简的机器人,使其超越过去那些庞大且昂贵的巨头。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →