← 最新论文
💻 computer science

Benchmarking Testing in Automated Theorem Proving

本文介绍了"T",这是一种新颖的框架,通过验证依赖后继定理是否成功编译来评估人工智能生成的形式化定理的语义正确性,揭示了当前大型语言模型在定理生成能力方面与传统词汇或人工评估方法相比存在的显著差距。

原作者: Jongyoon Kim, Hojae Han, Seung-won Hwang

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jongyoon Kim, Hojae Han, Seung-won Hwang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在聘请一支建筑师团队来设计一座新桥。

旧有的测试方式(编译)
过去,在评估这些建筑师(在本文中即 AI 模型)时,我们仅检查他们的蓝图是否“语法正确”。我们会问:蓝图是否符合语法规则?线条是否连接?计算机是否显示“语法通过”?

如果蓝图在纸面上看起来完美无缺,我们便假设这座桥能够稳固。但问题在于:一位建筑师可以画出一张写着“这座桥由纯金制成”的蓝图,而计算机仍会显示“语法通过!”,因为这句话在语法上是正确的。然而,如果这张蓝图本应是用于“钢制悬索桥”的,那么即便语法完美,这位建筑师也未能胜任实际工作。

在数学和计算机代码的世界中,这被称为编译。AI 写下一个定理(一个数学陈述),计算机检查它是否能编译(即无错误地运行)。该论文认为,这是判断 AI 是否真正理解数学的糟糕方法。

新的测试方式(T2 框架)
该论文的作者提出了一种名为**T2(定理测试)**的新方法。他们不再仅仅检查蓝图的语法,而是问:当我们尝试围绕它建造整座城市时,这张蓝图是否真的行得通?

他们使用了一个名为集成测试的概念。想象这座桥只是庞大城市的一部分。

  1. 目标:AI 被要求证明一个特定的定理(例如,“加法具有交换性”,即 a+b=b+aa + b = b + a)。
  2. 后继者:在真实的数学中,一旦证明了一个小事实,其他数学家就会利用该事实证明更大、更复杂的内容。该论文考察了所有依赖于 AI 答案的其他定理。
  3. 测试:将 AI 的答案嵌入这些“下游”证明中。
    • 如果 AI 给出了一个“虚假”的答案(例如一个总是成立但毫无实际意义的重言式),下游证明就会崩溃。由于它们依赖于 AI 未能提供的特定含义,它们将无法编译。
    • 如果 AI 给出了正确的答案,下游证明就能顺利运行。

重大发现
作者利用来自"Lean"编程语言的 2,206 个现实世界数学问题,构建了一个庞大的测试套件。他们测试了 18 个当时最智能的 AI 模型(包括来自 Google、OpenAI 和 Anthropic 的模型)。

以下是他们利用我们的桥梁类比所发现的:

  • “语法”陷阱:大多数 AI 非常擅长通过旧测试。它们写出了看起来完美且能无错误编译的蓝图。在旧测试中,它们的成功率约为 80%。
  • 现实检验:当作者应用新的“城市集成”测试时,得分急剧下降。表现最好的 AI 仅获得了约**39%**的正确率。
  • 差距:这意味着,对于 AI 声称建造的每 100 座桥,当有人试图在上面修路时,大约有 60 座会立即坍塌。AI 擅长伪造数学的外观,却不擅长把握数学的含义

为何这很重要
该论文表明,当前衡量 AI 数学技能的方法正在欺骗我们。

  • 词汇相似度(BLEU):检查 AI 的词汇是否与人类词汇相似毫无用处。AI 可以写出看似数学的胡言乱语,却依然能通过测试。
  • 专用模型:即使是专门训练为“数学专家”的模型,表现也未比通用聊天机器人好多少。它们只是更擅长伪造语法。
  • 解决方案:唯一能确认 AI 是否真正理解数学的方法,是看当其他证明试图建立在它的工作之上时,其成果是否依然稳固。

简而言之
该论文为 AI 数学引入了一种新的“压力测试”。它不再问“这句话看起来像数学吗?”,而是开始问“当我们尝试利用这些数学解决更大问题时,它们是否真的有效?”结果是一次残酷的现实检验:尽管当今最先进的 AI 模型看起来完美无缺,但它们仍在努力进行真实、有意义的数学工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →