OProver: A Unified Framework for Agentic Formal Theorem Proving
OProver 是一个面向 Lean 4 的代理形式化定理证明统一框架,它将迭代式证明修订与编译器反馈及检索机制相融合,并通过结合持续预训练、基于修复轨迹的监督微调以及在困难案例上的强化学习这一新颖训练流程,在多个基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试解决一道非常困难的数学谜题,但你必须用一种名为Lean 4的严格、机械的语言来书写解答。哪怕出现一个微小的拼写错误或逻辑错误,计算机(即“编译器”)也会拒绝整个解答,并说:“不行,错了。”
长期以来,试图解决这些谜题的 AI 模型就像参加考试的学生:它们会猜测一个答案,如果错了,就从头开始再次猜测。它们并没有真正理解自己错在哪里,也没有利用计算机提供的具体反馈来修正错误。
OProver 是一个改变游戏规则的新系统。它不再只是猜测,而是像一个永不放弃的完美主义侦探那样行动。以下是它的工作原理,使用简单的类比来说明:
1. “代理型”侦探(证明者)
不要把 OProver 想象成一本静态的教科书,而要把它看作一位拥有多步骤调查流程的侦探。
- 旧方式:侦探写下一个理论,法官(计算机)说“错了”,侦探便从头开始写一个全新的理论。
- OProver 方式:侦探写下一个理论。法官说:“你在这里犯了错:你使用了错误类型的数字。”侦探随即编辑该理论中的这一特定部分,再次检查,并不断 refinement,直到法官说:“正确!”
OProver 被训练为自动执行这种“编辑与优化”的舞蹈。它不只是猜测,而是学会倾听法官的具体批评并加以修正。
2. “解决方案库”(检索)
在侦探开始写作之前,它并非在真空中工作。它会前往一个庞大的图书馆(称为检索记忆)。
- 如果侦探试图解决一个关于三角形的谜题,图书馆会立即调出其他侦探此前成功解决过的、关于三角形的最优质的 5 个证明。
- OProver 阅读这些“小抄”,看看其他人是如何解决类似问题的,并将他们的策略作为指导。这有助于侦探避开常见的陷阱。
3. “自我改进循环”(训练)
这是最神奇的部分。通常,AI 模型是在固定数据集上训练,然后就被搁置一旁。OProver 则不同;它拥有一个自我改进循环。
- 步骤 1:OProver 尝试解决一批谜题。
- 步骤 2:当它成功时,会将该解决方案保存到图书馆中,以便作为未来问题的“小抄”。
- 步骤 3:当它失败时,会保存其失败的完整故事,包括计算机的反馈以及它最终如何修正错误。
- 步骤 4:系统利用这些“失败故事”来教导自己下次如何做得更好。
这就像一个学生,在每次考试后,不仅会记住正确答案,还会详细写下自己为何答错,并将这些笔记加入学习指南。久而久之,这个学生会变得更聪明,而学习指南也会变得更厚、更有帮助。
4. 结果:超级学生
该论文在五个不同的“数学奥林匹克”(从高中水平到非常难的大学竞赛)上测试了这个系统。
- 成就:OProver(特别是 320 亿参数版本)在所有开源 AI 证明者中成为表现最佳者。它正确解决的问题数量超过了任何其他类似系统,甚至击败了规模大得多的模型。
- 意义:它证明了赋予 AI倾听反馈、查阅过往解决方案以及迭代修正自身工作的能力,远比仅仅让它变得更大或更擅长猜测要强大得多。
总结
OProver 是一个数学求解 AI,它不只是“猜测并检查”。它是一个协作学习者,会:
- 首先查阅已解决的类似问题。
- 撰写证明。
- 倾听计算机的具体错误信息。
- 编辑其作品以修正这些错误。
- 重复此过程直至成功,然后将经验教训保存下来供下次使用。
通过将“失败”转化为学习机会,并持续记录有效的方法,OProver 已成为当今在形式化证明数学定理方面最出色的开源 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。