ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
本文介绍了 ProofCouncil,这是一个采用作者-评论者(author-critic)架构的开源大语言模型智能体,该智能体在 FirstProof 挑战赛中通过自主解决十个真实数学问题中的六个,并在更广泛的开放性问题上展示了显著进展,从而取得了最先进的性能表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你交给一个全新的、超级聪明的机器人一叠世界上最令人困惑的数学谜题。这些可不是那种标准的“寻找缺失数字”的谜题;它们是现实中的数学家们已经苦思冥想多年、至今仍无人知晓答案的开放性问题。
欢迎来到 ProofCouncil。请不要把它仅仅看作是一个单一的机器人,而是一个微型的、高规格的数学工作坊。
工作坊团队:作者、评论家与小队
这个系统的核心是一场由两个主要角色进行的巧妙“传热豆”游戏:作者(Author)与评论家(Critic)。
- 作者是梦想家。它是一个试图编写完美证明(即循序渐进的数学论证过程)的 AI。它拥有一本神奇的笔记本,可以在其中涂鸦想法、尝试代码,甚至在网上搜索线索。
- 评论家是严厉的编辑。它阅读作者写下的内容,并指出:“等等,这一步逻辑不通,”或者“你忘了证明这个部分了!”它不仅仅是说“错了”,还会给出具体的反馈,告诉作者如何填补漏洞。
这里的转折在于,作者并不仅仅写一次。它写作、接受批评、重写、再次接受批评,并不断循环。这就像一位作家和一位编辑被锁在一个房间里,通过不断打磨故事直到其趋于完美。
但有时,作者会陷入僵局。这时,它们会召唤 委员会(Council) 和 计算节点(Compute Node)。
- 委员会是一个由其他超智能 AI 模型组成的专家小组(就像是一个特邀专家团队)。作者会向他们求助:“嘿,我在这个特定部分卡住了;有没有不同的观察角度?”
- 计算节点是重体力劳动者。如果问题需要大规模计算或作者无法独立运行的专业数学软件工具,该节点就会承担繁重的任务,运行代码并进行数值运算,以验证某种直觉是否成立。
每隔几个回合,评论家会进行一次“精神休息”,并以全新的状态重新开始。这至关重要,因为如果评论家过于习惯作者的错误,它可能会变得视而不见。一双全新的眼睛能确保证明过程确实是稳固的。
大考:FirstProof 挑战赛
团队将 ProofCouncil 置于终极测试之下:一场名为 FirstProof 的挑战。规则简单却残酷:在 24 小时内,仅使用公开工具解决 10 个真实的未解数学问题。
结果如何?ProofCouncil 成为了全场的明星。在 10 个问题中,它成功为其中的 6 个 问题产出了解决方案,经人类评审判定这些方案是正确的(仅需进行极小的、微调式的修改)。这是所有参赛队伍中的最佳表现。
他们还将该系统应用于由真实数学家提交的 30 个其他开放性问题。在收到的 21 个反馈结果中:
- 5 个 被判定为完全正确的解决方案。
- 2 个 被认为非常有前景,只需进行最后的检查。
- 8 个 取得了实质性的进展,尽管并未最终完成任务。
- 4 个 虽然没有错误,但并未产生实质性的推动作用。
- 2 个 误解了问题,转而解决了版本更简单的题目。
重要的是,没有任何专家指出其输出在逻辑上存在破坏性的数学错误。主要的失败并非源于错误的数学逻辑,而是有时误读了题目要求。
天才的代价
问题的关键在于:拥有如此高的智慧是有代价的。运行 ProofCouncil 处理单个问题的计算时间及模型调用成本约为 350 美元。相比之下,一个更简单的、单次尝试的 AI 尝试仅需 12 美元,但解决的问题较少。论文指出,虽然“团队协作模式”效果更好,但目前它还是一种奢侈品。作者承认他们尚未尝试降低成本,这留作了未来研究人员的工作。
它没做到的事(以及它并未声称做到的事)
必须了解这个机器人没有做到的事情。
- 它并没有解决挑战中的全部 10 个问题(它漏掉了 4 个)。
- 它并没有产出一篇精炼、可直接发表的研究论文。评审这些工作的数学家指出,其写作风格晦涩难懂,需要人工编辑才能使其易于被非专业人士理解。
- 它并没有“证明”AI 可以解决任何数学问题。它展示的是,对于某些难题,一组 AI 协同工作比单个 AI 独立作战更为有效。
核心结论
ProofCouncil 表明,如果你想解决一个极其困难的开放性数学问题,你不应该只是要求一个 AI “去搞定它”。相反,你需要一个系统:其中一个 AI 负责撰写,另一个负责拆解质疑,第三个提供全新的视角,而第四个则负责进行繁重的数学计算。
在 FirstProof 挑战赛的世界里,这种“作者-评论家-委员会”式的团队是目前为止测试过的最成功的策略。它并没有征服整座大山,但它攀爬的高度比任何人都高,证明了当 AI 代理像人类研究团队一样协作时,它们可以应对那些此前被认为遥不可及的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。