From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier
本立场文件主张数学人工智能应实现范式转移,即从解决预定义问题转向成为能够应对前沿挑战的研究智能体,同时对当前的局限性进行了系统性回顾,并概述了未来发展的战略路线图。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,数学的世界就像一座巨大且无尽的图书馆。长期以来,这座图书馆里最聪明的 AI “学生”就像是卓越的解题者(Solvers)。它们非常擅长处理一份编写得非常完美的特定作业:阅读指令并找到答案。如果你给它们一个高中竞赛级别的数学题,它们往往能比人类天才更快地解出答案。它们就像是在完美铺设的赛道上行驶的赛车:快速、精准且可靠。
但本文的作者认为,我们正在撞上一堵墙。这些“解题者”擅长跑完比赛,但它们无法发明比赛。它们无法看向图书馆,发现一个在那里静静躺了几十年的尘封已久的未解之谜,并想出一种全新的方法来破解它。
本文指出,现在是时候停止制造更好的赛车,转而开始构建**研究智能体(Research Agents)**了。这些不仅仅是遵循指令的学生,更是探索者——它们可以走进未知领域,迷失方向,尝试古怪的想法,并且可能——仅仅是可能——发现一些全新的事物。
现状:“解题者”时代
目前,AI 在已知挑战方面表现极其出色。
- MiniF2F 基准测试: 这就像是一场超级难的高中数学考试。在 2021 年,AI 的正确率约为 30%。到 2025 年 7 月,一个名为 Seed-Prover 的系统达到了 99.6%(244 道题中答对了 243 道)。这几乎是满分。
- IMO(国际数学奥林匹克): 这些是针对世界顶尖高中生的最难题目。在 2024 年,一个名为 AlphaProof 的 AI 获得了“银牌”水平的分数。到 2025 年 7 月,Seed-Prover 解决了 2025 年竞赛中的 5 道出 6 道。
这非常了不起!这证明了 AI 可以进行严密的、由机器验证的数学运算。但问题在于:这些都是答案在数学宇宙中已经存在的题目。AI 只是在寻找通往已知宝藏的路径。
问题:“研究差距”
本文指出,真正的数学研究是混乱的。它不是一道选择题。它就像是在草堆里找一根针,但你甚至还不知道这根针长什么样。
作者认为,目前的 AI 系统在面对“前沿研究”时存在根本性的局限。
- “重新发现”陷阱: 当 AI 声称解决了某个著名开放问题(例如来自 Erdős Problems 列表的问题,这是一个包含超过 1,100 个难题的集合)时,它往往只是找到了人类已经在书中写下的解法,只是 AI 并不知道。
- “幻觉”风险: 如果你要求 AI 解决一个它不知道答案的问题,它可能会编造一个看起来正确但实际上毫无意义的证明。与人类会说“我卡住了,我需要一个新想法”不同,AI 往往会自信满满地走向悬崖。
本文明确排除了当前 AI 已经准备好成为独立发现下一个重大定理的数学家的观点。他们表示,像 DeepSeek-Prover 或 AlphaProof 这样的系统仍然只是“解题者”,而非“研究者”。它们还无法在没有人类帮助的情况下,去应对像黎曼猜想或纳维-斯托克斯方程这样真正的未解巨兽。
路线图:从解题者到研究者
那么,我们如何将一辆赛车变成一名探险家?作者提出了五个需要跨越的重大障碍:
1. 数据荒漠
想象一下,你只能通过阅读 10 页文本来学习如何写小说。这就是形式化数学面临的问题。虽然互联网上有数十亿词汇的普通文本,但形式化数学的代码(在名为 Lean 的系统中)只有大约 130 万行。
- 对策: 我们需要教会 AI 将“人类数学”(模糊且依赖上下文)翻译成“计算机数学”(极其精确)。这被称为自动形式化(Autoformalization)。论文指出,这一技术正在进步,但仍然很困难。翻译过程中的微小错误可能会让一个难题看起来很简单,或者让一个简单的题目看起来极其困难。
2. 缺失的地图
目前的 AI 将每个数学问题视为独立的孤岛。但在现实的数学中,一切都是相互关联的。几何学中的一个证明可能依赖于代数中的一个引理。
- 对策: 我们需要构建一个巨大的知识图谱(Knowledge Graph)。想象一个网络,其中每个定理都是一个节点,而连接它们的线条展示了它们之间的关系。如果 AI 能看到这些联系,它就可以利用旧的思想来解决新问题,而不是每次都从零开始。
3. 从验证到发现
目前,AI 擅长检查一个证明是否正确(验证),但不擅长提出证明本身(发现)。
- 对策: 我们需要能够**猜想(conjecture)*新定理并尝试证明它们的系统。一些实验,如 AlphaEvolve,正试图通过让 AI “进化”出新想法来进行尝试,类似于自然界中物种的进化。但论文指出,这仍处于早期阶段;AI 目前还无法像人类天才那样发明一种新的*数学概念(例如一种新的数类型)。
4. 工具箱
人类数学家不仅仅依靠大脑;他们使用计算器、计算机和软件来进行繁重的计算工作。
- 对策: AI 也需要学会使用这些工具。但有一个难点:如果 AI 要求计算器进行求和,它如何知道计算器没有出错?论文建议,我们需要更好的方法让 AI 检查这些外部工具的工作,以免被误导。
5. 人机共舞
论文认为,未来的主题不是“AI 对抗人类”,而是 “AI + 人类”。
- 对策: 把 AI 想象成一名超高速的研究助手。它可以一秒钟阅读数千篇论文,检查 1,000 种可能的证明,并整理数据。而人类则是船长,提供直觉、“直觉感”以及对一个想法究竟是天才构思还是仅仅是幻觉的最终判断。
- 现实案例: 在 2025 年晚些时候,一个名为 Aristotle 的 AI 智能体帮助解决了一个来自 Erdős 列表的问题。它生成了一个证明,但事实证明,它所解决的问题是原问题的“弱化版”。人类数学家必须介入,意识到原问题仍然是一个开放问题。这表明,尽管 AI 功能强大,但它仍然需要人类来保持其诚实。
核心结论
本文是一份行动倡议。它说:“我们已经制造出了了不起的解题者。它们可以赢得任何数学竞赛。但为了推动人类知识的边界,我们需要构建研究智能体。”
这些智能体不会仅仅遵循规则;它们将帮助我们编写新的规则。但论文也明确指出:我们还没有到达那里。目前的 AI 是一名才华横溢的学徒,而非大师。它需要更好的数据、更好的地图、更好的工具,最重要的是,需要一位人类伙伴来引导它穿越数学那黑暗且未知的领域。
从“求解”到“发现”的旅程是下一个巨大的飞跃,而要实现这一目标,需要团队的共同努力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。