Mathematical Scientific Discovery Using Large Language Models: A Systematic Literature Review
本项遵循 PRISMA 2020 指南的系统性文献综述分析了 32 项关于利用大语言模型进行数学发现的研究,旨在识别七种技术范式,强调进化搜索结合形式化验证的卓越效能,并提供一个分类法以指导该领域的未来研究。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:数学不再仅仅是解决别人写下的谜题,而是关于发明谜题本身。几个世纪以来,数学中最令人兴奋的部分——发现全新的真理、奇特的模式或从未有人见过的规则的“尤里卡(Eureka!)”时刻——一直被认为是一种人类特有的超能力。它需要一种特殊的直觉,一种计算机无法拥有的创造力火花。但最近,一种被称为“大语言模型”(LLM)的新型人工智能开始改变游戏规则。不要把 LLM 仅仅看作一个计算器,而要把它看作一台超级阅读机,它几乎吞噬了所有已编写的数学书、代码手册和科学论文。它不仅仅是在记忆,它在深刻理解数学和代码的“语法”,以至于它可以开始编写自己的句子。研究人员提出的重大问题是:这种机器阅读的超级大脑能否做得更多,而不仅仅是回答问题?它真的能发现人类尚未发现的新数学吗?
这正是来自克莱姆森大学(Clemson University)和科罗拉多学院(Colorado College)的一个研究小组致力于调查的内容。他们不仅仅观察了一个酷炫的实验;他们进行了一场数字寻宝之旅,筛选了截至 2025 年底发表的数百篇研究论文,以寻找那些 AI 确实在“创造”新数学知识的研究。他们使用了一套严格的科学清单(称为 PRISMA),以确保没有遗漏任何重要内容,并过滤掉那些仅仅关于解决旧问题的研究。尘埃落定后,他们发现了 32 项研究,展示了令人惊叹的事实:AI 正开始成为数学发现的伙伴,而不仅仅是一个计算器。
研究人员发现,最成功的 AI “数学家”并不是在随机猜测。相反,它们使用了一些聪明的技巧。其中一种最强大的方法类似于数字版的进化论。想象一下,计算机正在创建成千上万个微小的、简单的数学程序。它测试这些程序,保留表现最好的,然后利用 AI 对它们进行“突变”——通过进行细微且具创造性的改变,观察是否能变得更好。随着时间的推移,这个过程演化出的解决方案如此出色,甚至超越了人类保持了数十年的纪录。例如,该研究强调了这些系统最近发现了一种更快的矩阵乘法(一种特定类型的数学网格)方法,改进了一个 1969 年的著名算法,而在此之前,没有任何人类能在 50 多年内做到这一点。
另一种流行的方法就像是一款 AI 与自己对战的电子游戏。AI 的一部分试图创建一个困难的数学问题(“猜想”),而另一部分则试图解决它。随着求解器变得越来越强,出题者也必须变得更加聪明,从而形成一个两者共同升级的循环。这帮助 AI 生成了数以千计经过验证的新数学定理和引理(小的阶梯式证明),这些成果现在正被添加到数字图书馆中。然而,论文非常明确地指出,这些 AI 系统目前还不是“魔杖”。它们仍然对计算能力有着极高的渴求,通常需要进行数百万次尝试才能找到一个好的答案。此外,虽然它们擅长发现模式,但有时也会产生一些在技术上正确但却枯燥乏味或毫无用处的答案。
研究还指出,为了让这些发现获得信任,它们需要一位“裁判”。在数学的世界里,你不能仅仅说“我觉得这是真的”,你必须证明它。在这些 AI 实验中最受欢迎的裁判是一个名为“Lean”的工具,它是一个数字证明检查器,扮演着数学领域严厉的“语法警察”。如果 AI 说它发现了一个新定理,Lean 会检查每一个步骤,以确保其逻辑百分之百严密。研究人员发现,最成功的项目是那些 AI 与裁判紧密协作的项目,裁判会提供即时反馈,以便 AI 能够实时修正错误。
那么,结论是什么?论文表明,我们正站在一个新时代的边缘。AI 并没有取代数学家,但它正在成为一个强大的“创意沙盒”。它可以生成数百万种可能性,捕捉人类会错过的海量数据中的模式,甚至解决困扰人类半个世纪的问题。但是,最后一步——将机器生成的代码片段转化为优美且易于理解的数学洞察——仍然需要人类的参与。未来的前景是一项团队运动:AI 负责搜索和测试的大量繁重工作,而人类数学家则提供决定什么是真正有趣的直觉。这是一个合作关系,机器带来了速度和规模,而人类带来了灵魂。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。