AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification
本文介绍了 AdvancedMathBench,这是一个包含用于评估高级数学证明生成的 ProverBench 和用于评估证明验证的 VerifierBench 的综合基准测试集,以及一个专门的自动验证流水线,旨在揭示当前的尖端大语言模型在构建和验证本科及博士水平的严谨证明方面仍然面临显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你制造了一个超级聪明的机器人,它能轻松搞定高中数学考试,解开那些复杂的代数和几何难题,速度比任何人类都要快。你可能会想:“太棒了!这个机器人是个数学天才!”但当你把它交给一个博士级别的数学问题时,会发生什么?它真的理解其中的逻辑吗?还是它只是在猜测最终的数字并碰运气?
这正是名为 AdvancedMathBench 的一项新研究所调查的内容。研究人员构建了一个特殊的“数学健身房”,来测试 AI 模型是否能够完成两件非常困难的事情:撰写一个完美的数学证明,以及检查他人的证明是否真正正确。
“证明”在于过程(而不只是答案)
大多数针对 AI 的数学测试都像是选择题测验。机器人只需要选出正确的字母(A、B、C 或 D)或写下最终的数字。如果答案正确,机器人就会获得一颗金星。
但高级数学不仅仅关乎最终的数字,更关乎旅程。这就像是要求一位厨师不仅要端出一块美味的蛋糕,还要写下精确的食谱,解释为什么要添加每一种原料,并证明蛋糕不会塌陷。如果食谱中有一个隐藏的错误(比如用了盐而不是糖),蛋糕起初看起来可能没问题,但实际上已经毁了。
论文指出,目前的 AI 基准测试过于简单,因为它们只检查最终答案。它们忽略了“食谱”部分。为了解决这个问题,研究人员创建了 AdvancedMathBench,它强迫 AI 写出整个数学问题的完整故事,然后检查这个故事是否有意义。
两大挑战
1. “作者”测试 (ProverBench)
首先,他们要求 AI 扮演数学家的角色,编写一个完整的证明。他们提供了 245 个问题,分为两个等级:
- 本科水平 (UG): 类似于一场很难的大学期末考试。
- 博士资格考试 (QE): 类似于你必须通过才能成为博士的超难测试。
结果: 即便是最聪明的 AI 模型也感到吃力。表现最好的模型 GPT-5.5-xhigh 在大学水平的问题上得到了 64.5 分。但当他们转向博士水平的问题时,其得分降至 48.9。
这表明,虽然 AI 擅长高中数学,但在处理高级研究所需的深度、严密的逻辑方面,还有很长的路要走。论文指出,仅仅得到正确答案是不够的;模型需要构建一个坚如磐石的论证,而目前来看,它在最艰难的步骤上仍然会踉跄跌倒。
2. “编辑”测试 (VerifierBench)
接下来,他们要求 AI 扮演一名严格的编辑。他们给出了 888 个由其他模型编写的证明(其中有些是正确的,有些则充满了隐藏的陷阱),并问道:“这个证明有效吗?如果无效,错误在哪里?”
结果: 这甚至更加困难。表现最好的模型 DeepSeek-V4-Pro 仅达到了 65.1 分(称为平衡 F1 分数)。
这里有一个棘手之处:论文发现,如果你只是问 AI“是对还是错?”(一个简单的“是/否”问题),它看起来表现得还不错。但当你要求它解释原因并指出具体的错误时,它的表现就会下降。
例如,有些模型因为太急于说“是的,这是正确的!”,从而忽略了明显的错误。其中一个模型 gpt-oss-120b 在面对有效的证明时有 95.3% 的概率说“是”,但对于无效的证明,它只有 32.0% 的概率说“否”。这就像是一位即便学生作弊也会给所有人打 A 的老师。论文指出,真正的瓶颈不在于识别正确的数学,而在于识别那些看起来“像模像样”但实际上错误的证明中的微妙、隐蔽的错误。
他们如何确保测试的公平性
你可能会问:“你如何知道 AI 的证明是真的好?不能直接问另一个 AI,因为它们可能会犯同样的错误。”
因此,研究人员构建了一个特殊的自动验证流水线 (Automatic Verification Pipeline)。你可以把它想象成一个由专家级人类数学家组成的团队,教给一个超级精准的机器人如何评分。
- 他们收集了数千个示例,并让真正的专家进行检查。
- 他们训练这个机器人去寻找“致命错误”(会导致整个证明崩溃的错误)和“可修复错误”(可以被修正的小失误)。
- 他们使用了一条“悲观主义”规则:只有当八项不同的检查都判定它是完美无瑕时,证明才会被接受。如果哪怕只有一项检查发现了缺陷,证明就会失败。
这套系统非常出色,它在测试集上的得分达到了 82.1,而其他模型的得分仅为 70.6。这表明,要真正测试数学 AI,你需要一个专门的、严谨的评分器,而不仅仅是一个通用的聊天机器人。
核心启示
论文并不是说 AI “不擅长”数学。它说的是,对于最难、最高级的数学,AI 仍在学习之中。
- 撰写证明: 最好的 AI 在大学水平问题上得到约 64.5 分,而在博士水平问题上降至 48.9 分。
- 检查证明: 最好的 AI 得到了 65.1 分,这意味着它仍然会错过很多细微的错误。
研究人员建议,我们不能再仅仅看最终答案了。如果我们希望 AI 能助力真正的科学发现,它就必须能够构建完美的逻辑论证,并且同样重要的是,在其他人发现错误之前,先捕捉到自己的错误。在此之前,那个“数学天才”机器人仍然是一个正在成长中的学生。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。