← 最新论文
💬 NLP

Reliable Fine-Grained Evaluation of Natural Language Math Proofs

本文针对大语言模型生成数学证明缺乏可靠细粒度评估的难题,构建了首个专家标注数据集 ProofBench,并提出了结合强推理骨干模型、参考解上下文及集成策略的 ProofGrader 评估器,其在细粒度评分任务中显著优于基线,并有效提升了下游证明生成的质量。

原作者: Wenjie Ma, Andrei Cojocaru, Neel Kolhe, Bradley Louie, Robin Said Sharif, Haihan Zhang, Vincent Zhuang, Matei Zaharia, Sewon Min

发布于 2026-03-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenjie Ma, Andrei Cojocaru, Neel Kolhe, Bradley Louie, Robin Said Sharif, Haihan Zhang, Vincent Zhuang, Matei Zaharia, Sewon Min

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给**“数学证明”这个高难度领域,开发一套“智能阅卷系统”**。

想象一下,现在的 AI(大语言模型)做数学题越来越厉害,特别是那种只要算出最终数字(比如"答案是 5")的题目,AI 只要猜对或者算对就行。但是,数学里还有一类更难的任务:写证明。证明题没有简单的“对”或“错”,它更像是一篇逻辑严密的议论文,中间每一步推理都不能出错。

目前的难题是:怎么给 AI 写的证明打分? 让真人专家打分太慢太贵,让 AI 自己打分又经常“瞎蒙”或者“偏袒”。

这篇论文就是为了解决这个问题,他们做了一件三件事:

1. 建立了一个“超级题库”:PROOFBENCH

这就好比是**“高考阅卷组”**。

  • 收集题目:他们从美国数学奥林匹克(USAMO)、国际数学奥林匹克(IMO)等顶级比赛中,收集了 145 道高难度证明题。
  • 生成答案:让当时最厉害的三个 AI(Gemini, o3, DeepSeek)去写解题过程。
  • 专家打分:请了 5 位像“高考阅卷组长”级别的数学专家,给这些 AI 写的证明打分。
  • 打分标准:不是简单的“对/错”,而是0 到 7 分的精细打分。
    • 7 分:完美无缺。
    • 4-6 分:思路对了,但有点小瑕疵。
    • 0-2 分:完全跑偏或逻辑崩塌。
    • 这就好比老师批改作文,不仅看结论,还要看论证过程是否严密。

2. 研发了“金牌阅卷员”:PROOFGRADER

有了题库,他们就开始训练和测试各种"AI 阅卷员”,看看谁能最接近人类专家的打分。他们发现,要当好一个阅卷员,光靠“聪明”是不够的,还需要**“参考资料”**。

他们尝试了不同的阅卷策略,最后发现PROOFGRADER这套组合拳最厉害:

  • 强大的大脑:使用最聪明的 AI 模型(O3)作为阅卷员。
  • 拿着“标准答案”和“评分细则”:这是关键!阅卷员手里必须有两样东西:
    1. 参考答案:看看标准解法长什么样。
    2. 评分细则(Marking Scheme):这就好比**“阅卷评分表”**,上面写着“第一步得 1 分,第二步得 2 分,如果用了错误的方法扣 1 分”。
  • 投票机制(Ensembling):让同一个阅卷员把同一份卷子看 5 遍,然后取平均分。这就像让 5 个老师独立打分,最后取平均,能避免某个老师今天心情不好乱打分。

结果如何?
这套系统打出的分数,和人类专家打出的分数非常接近(平均误差不到 1 分)。相比之下,那些没有“评分细则”的 AI 阅卷员,就像**“没带课本的监考老师”**,经常给错误的证明打高分(过度自信),或者给有瑕疵的证明打低分(过于苛刻)。

3. 实战演练:帮 AI“优中选优”

有了这个靠谱的阅卷员,能干什么呢?
想象一下,AI 一次能写出 16 个不同的证明方案。

  • 以前的方法:用简单的“对/错”判断,或者让 AI 两两 PK(像打拳击赛一样),效率低且容易出错。
  • PROOFGRADER 的方法:直接给这 16 个方案打分,挑出分数最高的那个。

实验发现,用 PROOFGRADER 挑出来的方案,质量非常高,几乎接近人类专家亲自挑选的水平。这意味着,未来我们可以用这个系统来自动筛选出最好的数学证明,用来训练更聪明的 AI,或者辅助人类数学家。


总结:这篇论文的核心比喻

如果把AI 写数学证明比作**“学生写作文”**:

  • 以前的 AI:只能写“填空题”,答案对了就行。
  • 现在的挑战:要写“议论文”(证明),逻辑必须通顺。
  • 以前的阅卷:要么太慢(请真人老师),要么太水(随便找个 AI 看两眼,觉得写得像那么回事就给高分)。
  • 这篇论文的贡献
    1. 搞了一本**“满分作文集 + 详细评分表”**(PROOFBENCH)。
    2. 训练出了一个**“拿着评分表、反复阅读、经验丰富的 AI 阅卷组长”**(PROOFGRADER)。
    3. 证明了这个阅卷组长**“火眼金睛”**,能精准识别出哪些证明是“金玉其外败絮其中”,哪些是“真正的逻辑大师”。

一句话总结:他们给 AI 数学证明领域装上了一把**“精密的尺子”,让机器不仅能做题,还能像人类专家一样精准地评价**解题过程,这将是未来 AI 攻克高难度数学问题的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →