Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics
本文介绍了“形式化猜想”,这是一个源自活跃研究的、包含 2615 个 Lean 4 形式化数学问题的动态开源基准,旨在评估并推动自动推理系统在发现新证明方面的能力,同时通过社区协作与人工智能审计验证来确保数据完整性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何从事高等数学研究。过去,你可能会给机器人一堆陈旧的数学作业题。但这里有个大问题:机器人可能只是从互联网上死记硬背了答案,而非真正学会了如何思考。这就像一个背下了考试答案钥匙却不懂数学的学生。
本文介绍了一种更智能的新方法来测试这些机器人。他们将其称为“形式化猜想”(Formal Conjectures)。
以下是其工作原理,分解为几个简单的概念:
1. “新鲜食材”测试(零污染)
大多数针对人工智能的数学测试都是“陈旧的”。答案早已在网上公开,因此人工智能可能只是在抄袭。
- 类比:想象一场烹饪比赛,评委给厨师们一份他们从未见过的、用秘密代码写成的食谱。如果厨师能做出这道菜,说明他真正懂得烹饪;如果不能,那他就只是在猜测。
- 本文的解决方案:作者创建了一个包含1,029 个未解数学问题(猜想)的库。这些问题是真实的人类数学家目前正在尝试解决的。由于尚未有人解决它们,人工智能不可能已经背下了答案。如果人工智能解出了其中一个,那就是真正的发现,而非简单的复制粘贴。
2. “严格裁判”(Lean 4)
在常规数学中,你可以写出一篇看似不错但存在微小逻辑错误的证明。人类可能会忽略它。
- 类比:想象一款视频游戏,你需要建造一座桥。如果你使用了一块脆弱的砖块,桥就会坍塌。在本文中,“桥”就是数学证明。作者使用一种特殊的计算机语言Lean 4作为裁判。
- 本文的解决方案:Lean 4 就像一位超级严格的裁判。它不在乎你的证明是否看起来漂亮;它会检查每一个逻辑步骤。只要有一个微小的错误,裁判就会说:“不行,那是错的。”这确保了当人工智能声称它解决了某个问题时,它确实做到了。
3. “活体图书馆”(不断演进的基准)
通常,一旦测试被制定,它就会永远保持不变。但人工智能每天都在变得更聪明,因此旧的测试会变得过于简单。
- 类比:想象一款每周更新的游戏。随着玩家水平提高,游戏会增加更难的关卡并修复地图中的漏洞。
- 本文的解决方案:这个基准是一个“活体”项目。
- 它在增长:他们不断从真实的研究论文中添加新问题。
- 它在自我修正:有时,数学问题本身的表述过于模糊。当人工智能尝试解决它们时,可能会因为问题不明确而失败。这种失败有助于人类数学家意识到:“哦,我们把那个问题写错了!”随后他们会修正问题陈述。
- 它有两条轨道:
- 发现轨道:尝试解决那些未解的问题(即“新鲜食材”)。
- 翻译轨道:将人类已经解决的问题转化为严格的计算机语言(Lean 4),以此教导人工智能。
4. “安全网”(避免作弊)
作者担心“数据泄露”(即人工智能通过在其训练数据中看到答案而作弊)。
- 类比:为了防止学生作弊,老师有时会将答案钥匙锁在保险箱里,只在考试结束后才打开。
- 本文的解决方案:他们创建了一个测试的“冻结”版本。这是 100 个问题的快照,被锁定在时间之中。即使主库后来发生变化,这个特定的快照也保持不变,以便科学家能够公平地比较不同的人工智能模型,而无需担心测试在他们脚下发生变化。
5. 为什么这很重要
本文表明,这套系统已经发挥作用。
- 真实成果:他们提到,利用该系统,一个人工智能(名为 Aristotle)帮助一位人类数学家解决了一个长期悬而未决的著名问题(Erdős 问题 124)。
- 信号:该基准提供了一个清晰的“可攀登信号”。它确切地展示了人工智能已经走了多远,以及还有多远的路要走。如果人工智能解决了 10% 的未解问题,那将是一件大事。如果它解决了 0%,那说明它尚未准备好。
总结
形式化猜想(Formal Conjectures)是一个为人工智能数学家打造的全新、不断更新的游乐场。它使用严格的计算机裁判(Lean 4)来检查工作,专注于尚未解决的问题以防止作弊,并作为一个协作工具,让人类和人工智能共同帮助澄清困难的数学问题。这不仅仅是一次测试;它是实现真正数学发现的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。