← 最新论文
🤖 AI

OEIS Open: How many conjectures can language models turn into theorems?

本文介绍了 OEIS Open,这是一个由来自 OEIS 的 492 个形式化数学猜想组成的安全性基准测试,它证明了配备了极简工具的语言模型能够以较低的成本自主解决其中约 30% 到 44% 的开放问题,尽管获取广泛的文献和复杂的智能体循环并未显著提高性能。

原作者: Tom Adamczewski

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Tom Adamczewski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个由数字组成的庞大数字图书馆,名为 OEIS(在线整数序列查询)。它就像一个巨大的目录,数学家们在其中列出他们发现的各种数字模式,从简单的(如 1, 2, 4, 8...)到怪异且神秘的。通常,在列出一个模式后,有人会写下关于这个模式如何永远成立的猜想。这些猜想被称为“猜想”(conjectures)。长期以来,证明这些猜想的工作只能由拥有黑板和无穷耐心的天才人类来完成。但最近,计算机也开始尝试解决这些谜题。一个核心问题是:人工智能(AI)真的能够独立发现真理吗,还是它只需要人类牵着它的手?本论文通过建立一个严谨的测试来探讨这个问题,在这个测试中,AI 智能体必须在没有任何未经授权的方法或人类引导的情况下,证明或证伪这些数字猜想。

这项研究背后的研究人员来自一个名为 Epoch AI 的团队,他们创建了一个名为 OEIS OPEN 的挑战。你可以把它想象成一个巨大的数学障碍赛。他们从 OEIS 中提取了 492 个开放的数学猜想,并将它们转化为一种严格的计算机语言——Lean,它扮演着超级严格裁判的角色。在这场游戏中,一个 AI 智能体被投入到一个数字房间里,那里只有一些基础工具:一个文本编辑器、一个命令行(类似于计算机终端)和一个计算器。AI 的唯一目标是编写出一个能让计算机裁判接受的证明。如果 AI 不能证明该猜想为真,它必须证明其为假。难点在于,AI 在处理每个猜想时都有 50 美元 的严格预算用于消耗计算机时间。如果它在解决问题之前用完了钱,它就输了。

结果非常令人振奋。表现最好的 AI 模型成功解决了 492 个猜想中的 147 个,得分率约为 30%。这意味着它们独立地将近三分之一的这些未解之谜变成了已证实的定理(或证伪)。最成功的模型 Claude Opus 4.8 解决了 30% 的问题,而其他模型如 GPT-5.5 和 Gemini 3.5 Flash 也表现出色,分别解决了 26% 和 22% 的问题。这之所以意义重大,是因为研究人员使用的是一种非常简单的 AI 设置——仅仅是一个不断尝试、检查并再次尝试的基础循环。它并不是一个拥有庞大人类助手团队的复杂超级机器人。事实上,这种简单的方案实际上比一个名为 AlphaProof Nexus 的更复杂的系统表现得更好,后者仅解决了 9% 的相同问题。

研究人员还测试了一些“强化道具”(power-ups),以观察是否能让 AI 变得更聪明。他们给了 AI 一个访问来自互联网(arXiv)的 47 万 篇数学论文的海量图书馆,希望它能从过去的学术成果中学习。他们还尝试给 AI 一个更复杂的“大脑”,使其能够将任务委派给子智能体并在长时间内进行记忆。令人惊讶的是,这两项升级都没有起到作用。AI 并没有通过阅读图书馆里的内容解决更多的猜想,复杂的脑结构也没有让它变得更快或更准确。对于这类特定的数学问题,拥有一个简单、专注的工具集和充足的预算,比拥有海量图书馆或复杂的个性更为重要。

一个有趣的发现是,研究人员愿意为单个猜想投入的资金越多,AI 解决问题的可能性就越大。成功率呈现出一种稳定、可预测的增长方式:每当预算增加十倍,成功率就会跳升约十个百分点。这表明,如果给予 AI 更大的预算,它本可以解决更多问题。然而,论文谨慎地指出,这些猜想虽然在数学上是有效的,但大多属于数学界的“未知领域”。它们不是像黎曼猜想那样著名的、改变世界的难题;它们很可能是那些尚未得到人类数学家太多关注的小众、晦涩的谜题。

那么,这一切意味着什么?论文表明,AI 现在已经能够在适度的成本下,自主解决真实的、开放的数学研究问题。它不再仅仅是在解决已知答案的谜题,而是在推动知识的边界。但它也展示了局限性:AI 并不会因为阅读了更多的书籍就变得更聪明,它在面对最困难、最晦涩的问题时仍然感到吃力。研究人员总结道,虽然我们并没有看到 AI 在一夜之间突然变成天才数学家的那种“质的飞跃”,但我们正看到一个强大且稳定的工具,它正在一个接一个地通过数字序列,一点点地攻克未知的领域。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →