LeanMarathon: Toward Reliable AI Co-Mathematicians through Long-Horizon Lean Autoformalization
LeanMarathon 引入了一个以演进蓝图和两阶段编排器为核心的多智能体系统,旨在克服长程自动形式化失败的问题,并成功地在无错误的情况下将来自四篇近期关于 Erdős 问题的研究论文中的七个定理进行了形式化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图用乐高积木搭建一座宏伟且复杂的城堡,但你的团队是一群人工智能机器人。你的目标不仅仅是搭建“一座”城堡,而是要根据一位人类数学家极其复杂的、手写的蓝图来搭建;而且每一块积木都必须完全符合物理定律(在这里,是指一种名为 Lean 的严格计算机语言规则)。
过去尝试中的问题在于,如果其中一个机器人在早期犯了一个小错误——比如用错了颜色的积木,或者误读了蓝图中的一行——整个团队就会在错误的基础上继续施工。最终,他们会搭建出一座看起来宏伟壮丽的城堡,肉眼观察似乎毫无问题,但一旦你试图盖上屋顶,它就会瞬间崩塌,因为地基错了。机器人会变得混乱、互相争吵,或者仅仅是没完没了地重复同一个错误,持续数日之久。
LeanMarathon 是一种全新的组织机器人团队的方式,旨在防止这种崩溃。以下是它的运作方式,我们使用简单的类比来解释:
1. “活着的蓝图”(记录系统)
与其给机器人一份静态的 PDF 文档,LeanMarathon 使用的是一份单一的、动态的文档,它同时扮演三种角色:
- 数学的骨架(形式化代码)。
- 用自然语言编写的故事(自然语言解释)。
- 展示每一部分如何相互连接的地图。
你可以把它想象成一个共享的 Google 文档,其中的每一句话旁边都有一个微小的“对勾”。如果某句话错了,对勾就会变成红色。机器人不能忽视这些红色的标记;他们必须先修复它们,然后才能继续下一步。
2. 四个专业化的机器人(智能体)
与其让一个全能型超级机器人试图完成所有工作(这容易让它感到不堪重负并陷入混乱),LeanMarathon 使用了四个各司其职的专业机器人,每个机器人都有非常明确的任务和一条严格的规则:你只能触碰属于你自己的部分。
- 建筑师(蓝图绘制者): 这个机器人阅读原始的人类论文,并将其分解为细小、易于处理的乐高零件。它绘制初始地图,但还不动手搭建墙壁。它只负责搭建结构框架。
- 检查员(目标评审员): 在任何建造工作开始之前,这个机器人会根据原始的人类论文来核对地图。它会询问:“建筑师是否误解了目标?”如果地图上写着“建造一座塔楼”,而论文里写的是“建造一座桥梁”,检查员就会停止一切工作,并发出一条修复通知。它从不参与建造;它只负责检查。
- 建造者(工人): 这些是真正进行重体力活的机器人。但诀窍在于:每个建造者只被分配了一个极小的乐高零件。 他们并行工作(许多人同时进行)。他们只能触碰自己特定的零件以及周围紧邻的积木。他们不能越界去改变邻居的工作。如果他们卡住了,他们会举手求助,而不是靠猜测。
- 修复者(精炼者): 如果建造者卡住了,或者检查员发现了问题,修复者就会介入。这个机器人会观察特定的损坏区域,重新阅读原始的人类论文以理解哪里出了错,并重写该特定部分。这就像一位外科医生,只对特定的器官进行手术,以确保身体的其他部分保持健康。
3. “红绿灯”(CI 门禁)
这是最重要的安全功能。想象一下在建筑工地入口处有一个红绿灯。
- 每当一个建造者完成一个部件或一个修复者完成一次修理时,他们都必须停在红绿灯前。
- 一个计算机程序(红绿灯)会自动检查:“这个部件契合吗?它符合故事描述吗?它连接得正确吗?”
- 如果通过了,该部件就会被合并到主城堡中。
- 如果失败了,该部件会被立即拒绝。机器人必须回去重新尝试。
- 至关重要的一点是: 这一切都是自动且即时发生的。不需要人类去检查每一个积木。这防止了“坏积木”进入主体结构。
4. “马拉松”策略
“马拉松”这个名字源于他们处理长期、艰巨任务的方式。
- 旧方法: 一个机器人试图独自跑完整个马拉松。它会感到疲惫、产生幻觉并倒下。
- LeanMarathon 方式: 他们将马拉松分解成一个个微小的冲刺阶段。如果一个机器人倒下了,只有那一个冲刺阶段会受到影响。其余的团队成员可以继续奔跑。因为工作被分解成了细小、独立的片段,团队可以在出错后立即恢复,而不会损失数日的进度。
他们究竟取得了什么成就?
研究人员在两个非常困难的、真实世界的数学论文上测试了这个系统,这些论文是借助 AI 编写的。这些论文包含了四个著名的未解数学问题(称为 Erdős 问题)。
- 结果: LeanMarathon 成功地将这些论文中的所有数学内容转化为了完美的、经过计算机校验的代码。它证明了 258 个不同的数学步骤(引理和定理),且零错误。
- 对比: 他们让一个商业性的、“全能型”AI 机器人(名为 Aristotle)在同样的论文上进行测试。那个机器人试图同时做所有事情,结果陷入混乱并未能完成任务,甚至在运行数日后依然留下了大量未完成且破碎的部分。
- 教训: 这篇论文表明,要利用 AI 进行高难度数学研究,你需要的不仅仅是一个“更聪明”的机器人。你需要的是一个更好的团队结构,它可以防止错误扩散,并确保团队始终专注于最初的目标。
简而言之,LeanMarathon 证明了通过将 AI 机器人组织成一个纪律严明、分工明确且拥有严格规则和自动检查机制的团队,我们可以将杂乱、漫长的数学论证转化为完美、经过验证且无误的代码。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。