← 最新论文
🤖 AI

Formally Solving Answer-Construction Problems in Lean

本文介绍了 ECP,这是一个在 Lean 中实现的神经符号框架,它结合了用于枚举候选答案的工具辅助型通用大语言模型(LLMs)与用于生成机器检查证明的证明型大语言模型(LLMs),有效地解决了在形式化解决数学答案构建问题方面的空白。

原作者: Jialiang Sun, Yuzhi Tang, Ao Li, Chris J. Maddison, Kuldeep S. Meel

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Jialiang Sun, Yuzhi Tang, Ao Li, Chris J. Maddison, Kuldeep S. Meel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在参加一场非常困难的数学竞赛。你可能会遇到两种类型的题目:

  1. “证明题” (The "Prove It" Question): 评委给你一个陈述,比如“天空是蓝色的”,然后问:“你能证明这是真的吗?”你只需要写出一个逻辑严密的论证过程。
  2. “构建题” (The "Build It" Question): 评委要求:“找到满足这些奇特规则的最小数字。”你必须先发明出这个数字,然后再去证明它为什么有效。

这篇论文专门讨论第二种类型:答案构建 (Answer-Construction)。这体现了成为一名辩护已知案例的律师,与成为一名必须在设计建筑之前先证明其不会坍塌的建筑师之间的区别。

问题:工具的不匹配

作者注意到 AI 在处理这些任务时存在差距。

  • 通用 AI(“大脑袋”): 可以把它想象成一位才华横溢、能言善辩的教授。它擅长头脑风暴、猜测数字和进行粗略计算。但如果你要求它写出一个正式的、符合机器标准的证明,它往往会变得偷懒、捏造事实,或者编写无法编译的代码。而且,雇佣这样的人成本很高。
  • 证明 AI(“严格的编辑”): 可以把它想象成一个微小、高度专注的机器人,只接受过编写正式证明的训练。它很便宜,且擅长检查逻辑,但它非常不擅长猜测“答案可能是什么”。如果你问它“找到那个数字”,它可能会对着墙发呆,或者随机猜一个并不成立的数字。

陷阱:
如果仅仅要求“严格的编辑”去解决一个“构建题”,它可能会作弊。它可能会说:“答案是‘满足规则的最小数字’。”从计算机的角度来看,这在技术上是一个有效的答案,但在真正的数学竞赛中,这是一个循环论证的作弊行为。你需要一个具体的数字,比如 245。必须强制计算机停止作弊,并真正找到那个真实的数字。

解决方案:ECP (枚举-猜想-证明)

作者构建了一个名为 ECP (Enumerate-Conjecture-Prove) 的新系统。它像是一个协作团队,利用一种叫做 Lean(一种计算机证明辅助语言)的语言来解决这些“构建题”。

以下是这个团队的工作方式,使用侦探类比

1. 侦探 (通用 AI + Python 工具)

  • 角色: 这位“大脑袋”教授,但这次他配备了计算器和可以运行代码的电脑。
  • 行动: 他不再只是盲目猜测,而是编写一个 Python 程序来进行暴力搜索以寻找线索。他通过运行循环来测试成千上万个较小的数字,看看哪些符合规则。
  • “猜想” (The "Conjecture"): 基于数据,侦探提出了一个有根据的猜测:“我打赌答案是 245。”他会用直白的英语写下自己的推理过程。

2. 守门员 (可采纳性检查器)

  • 角色: 这是俱乐部的保镖。
  • 行动: 在侦探的猜想被允许进入下一步之前,守门员会对其进行检查。
    • 它是一个真实的数字吗?(是的,245 是一个数字)。
    • 它在作弊吗?(侦探只是说“答案就是答案”吗?并没有。)
    • 它使用了禁词吗?(他们是否使用了竞赛中不允许使用的复杂数学符号?没有。)
  • 如果猜想未通过检查,守门员会将它退回给侦探,让其重试。

3. 法官 (证明 AI + Lean 自动化)

  • 角色: 这是那位“严格的编辑”机器人。
  • 行动: 一旦守门员批准了猜想(245),法官就会接管工作。法官会忽略“我们是如何找到它的”部分,而完全专注于“为什么它是正确的”部分。它使用形式逻辑来证明,毫无疑问地证明 245 确实是正确答案。
  • 如果证明失败,法官会将它退回给侦探,让其尝试另一个数字。

结果:奏效了吗?

作者在两个著名的数学数据集上测试了这个系统:PutnamBench(大学水平数学)和 MathArena(类似于 AIME 的高中竞赛)。

  • 旧方法: 如果你只是要求“严格的编辑”去解决这些问题,它大多会失败,或者通过给出循环论证的答案来作弊。如果你要求“大脑袋”完成所有工作,它会在正式证明的部分卡住。
  • ECP 方法: 通过分工协作,该系统解决了 346 个难题中的 17 个,以及 75 个高中问题中的 18 个
  • 为什么这很重要: 这不仅仅是关于得到正确的数字;它是关于获得一个经过机器验证的证明,证明该数字是正确的,并且答案并非作弊。

总结

可以将 ECP 想象成一个处理数学问题的工厂流水线

  1. 工人 A (通用 AI) 使用工具挖掘答案。
  2. 检查员 B (守门员) 确保答案是一个真实的、非作弊的数字。
  3. 工人 C (证明 AI) 构建坚不可摧的逻辑之桥,以证明该数字是正确的。

这种方法弥合了“猜测答案”与“证明答案”之间的鸿沟,使 AI 能够解决既需要创造力又需要严密逻辑的数学问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →