← 最新论文
🤖 AI

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

本文介绍了 Mask-Proof,这是一个自动化的数据策展流水线,它将真实的数学证明转化为由基于 LLM 的评判器评估的掩码步骤任务,从而生成了 Mask-ProofBench 数据集,该数据集证明了经过推理增强的模型在步骤级数学推理方面显著优于标准模型,并与专家标注保持高度一致。

原作者: Jierui Zhang, Siyuan Tan, Xinhang Li, Longzhuangzhi Lin, Dailin Li, Chengfeng Gu, Xinping Li, Yaxian Hao, Shengjia Liang, Yuxiang Ren, Wenhao Liu

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Jierui Zhang, Siyuan Tan, Xinhang Li, Longzhuangzhi Lin, Dailin Li, Chengfeng Gu, Xinping Li, Yaxian Hao, Shengjia Liang, Yuxiang Ren, Wenhao Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何解决复杂的数学问题。你手里有一叠由人类专家撰写的、水平极高的研究级数学论文。你想知道:这个机器人是真的在进行逻辑“思考”,还是仅仅根据它之前看到的模式在猜测下一个词?

一篇名为《Mask-Proof》的论文介绍了一种测试这种能力的新方法,称为 Mask-Proof。以下是通过简单的类比对该方法的解释。

1. 问题所在:“填空陷阱”

通常,当我们用数学题测试 AI 时,我们会让它解决整个问题并检查最终答案。但对于长篇且复杂的证明过程来说,这就像是要求一名学生写一篇完整的论文,却只根据最后一句来评分。AI 可能会因为运气好或者模仿某种模式而得到正确的结尾,即便它中间的论述逻辑不通。

作者意识到,要真正测试“推理能力”,我们需要观察中间步骤。但这里有一个难点:

  • “缺失上下文”问题: 真正的数学论文经常会说“如引理 2.3 所示……”或“利用 X 的定义”。如果你只是从论文中随机抽出一句话并要求 AI 填补,AI 可能会失败,但这并不是因为它数学不好,而是因为这句话依赖于题目中不存在的信息。
  • “容易猜到”问题: 如果你隐藏了一个非常明显的公式部分(比如 2+2=2+2=),AI 可以不经思考直接猜出来。这并不能证明它很聪明。

2. 解决方案: “智能编辑”流水线

作者构建了一个自动化系统(流水线),它像一个超级聪明的编辑一样,将这些杂乱的研究论文转化为公平的测试题。这个过程分为三步:

  • 第一步:“自洽性”修复(收集工具箱)
    在测试 AI 之前,系统会扫描论文,找到该特定证明步骤所需的所有定义、引理或规则。它收集所有这些“工具”,并将它们附在问题上。

    • 类比: 想象你在要求某人修理汽车发动机。如果你只递给他们一把扳手并说“修好它”,他们可能会失败,因为他们没有说明书或其他工具。 “自洽性”这一步确保了 AI 手边有整套工具箱和说明书,这样如果他们失败了,是因为他们不会使用工具,而不是因为缺少工具。
  • 第二步:“策略性遮盖”(隐藏核心难点)
    系统不是隐藏一个随机的词,而是使用一个 AI 代理来寻找证明中最关键、最困难的步骤——即真正发生逻辑变换的部分。它用一个黑盒(“遮盖/Mask”)覆盖掉那个特定的步骤。

    • 类比: 想象一个魔术表演。一个糟糕的测试会隐藏魔术师手里拿着一张牌的事实(太明显了)。一个好的测试则会隐藏魔术师变换牌的那一瞬间。该系统隐藏了“魔术动作”(复杂的数学步骤),因此 AI 必须理解魔术是如何运作的,而不仅仅是猜出结果。
  • *第三步:“双重检查”裁判
    当 AI 尝试填补空白时,系统不仅仅检查字母是否完全匹配。数学是灵活的,例如 x+yx+yy+xy+x 是等价的。系统使用一个特殊的“裁判 AI”来观察答案的
    含义*。为了确保万无一失,系统会让“裁判”对答案进行多次投票,以避免随机猜测导致的错误。

3. 他们的发现(结果)

作者创建了一个名为 Mask-ProofBench 的测试库,其中包含 292 个来自真实研究论文的这类“被遮盖”的问题。他们测试了 17 种不同的 AI 模型。

  • “思考型”模型胜出: 设计用于“逐步思考”的模型(增强推理型模型)的表现显著更好(得分高出 12% 到 27%),优于那些只会吐出答案的标准模型。
  • “随机测试”失效: 当他们尝试通过隐藏随机数学部分(而不是策略性部分)来测试 AI 时,得分大幅上升,但聪明模型与普通模型之间的差距消失了。这证明了他们的“策略性遮盖”方法是唯一能真正告诉你谁具备良好推理能力的测试方式。
  • 人类一致性: 他们的自动化“裁判”与人类数学专家的意见一致率达到了 96.8%。这意味着计算机在评分这些特定步骤时,几乎与人类教授一样出色。

总结

Mask-Proof 是一种评估 AI 数学证明能力的新方法。它不再是让 AI 写完一整篇论文然后去猜测它是否理解了中间过程,而是:

  1. 收集所有必要的背景信息,以免 AI 被搞糊涂。
  2. 隐藏证明中最难、最重要的步骤。
  3. 要求 AI 填补这个特定的空白。

如果 AI 能正确填补这个空白,就证明它确实理解了逻辑,而不仅仅是在模仿模式。这有助于研究人员构建更强大、更可靠的科学 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →