← 最新论文
🤖 machine learning

VERITAS: Verifier-Guided Proof Search for Zero-Shot Formal Theorem Proving

本文介绍了 VERITAS,这是一个通过两阶段的 Best-of-N 和批判者引导的 MCTS 协议,将丰富的验证器信号反馈回搜索过程,从而增强形式化定理证明的零样本框架,在 miniF2F 和一个新的组合数学数据集等基准测试上实现了最先进的性能。

原作者: Manish Acharya, Zhenyu Liao, Yueke Zhang, Kevin Leach, Yu Huang, Yifan Zhang

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Manish Acharya, Zhenyu Liao, Yueke Zhang, Kevin Leach, Yu Huang, Yifan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个非常困难的谜题,比如一道复杂的数学题,但你是带着一个 AI 助手团队来完成的。通常情况下,当这些 AI 助手尝试解决问题时,它们会猜一个答案,检查是否奏效,如果失败了,它们只会得到一个简单的“不,再试一次”的信号。它们会丢弃关于失败原因的所有细节。

VERITAS 是一个改变游戏规则的新系统。它不再仅仅说“不”,而是倾听证明失败的具体原因,并利用这些原因来引导下一次尝试。这就像一位侦探,不仅会说“嫌疑人是清白的”,还会说“嫌疑人是清白的,因为他在下午 5 点在商店里,所以让我们去找另一个也在商店里的人”。

以下是 VERITAS 的工作原理,分为几个简单的部分:

1. 四位专家组成的团队

VERITAS 并不依赖于单一的 AI 大脑。它使用四个专门的“智能体(agent)”进行对话:

  • 策略家 (The Strategist): 在尝试解决问题之前,这个智能体决定高层级的计划(例如,“让我们尝试通过分类讨论来拆解这个问题”或“让我们尝试用反证法来证明”)。它通过缩小搜索范围来确保团队不会在错误的想法上浪费时间。
  • 检索者 (The Retriever): 这个智能体就像一位图书管理员。它能快速找到可能有助于解决当前步骤的参考书籍(数学规则和引理)。
  • 战术家 (The Tactician): 这是主要的工作者。它尝试编写实际的证明步骤。至关重要的一点是,它会查看早期失败尝试的失败记录列表。如果之前的尝试因为使用了错误的规则名称而失败,战术家会被告知:“不要再使用那个名字了;这是错误信息。”
  • 评论家 (The Critic): 这个智能体扮演教练的角色。它观察进度,并根据计算机检查数学结果的反馈给出评价,例如:“你离目标越来越近了,”或者“你正在走向死胡同。”

2. 两阶段游戏计划

该系统分两个不同的轮次进行游戏,以提高效率:

  • 第一阶段:“快速扫射” (Best-of-N)
    团队进行 5 次快速、独立的解题尝试。如果其中一个成功了,太棒了!他们立即停止。这很快,可以处理“简单”的问题。
  • 第二阶段:“深度挖掘” (Critic-Guided Search)
    如果快速扫射失败,系统就会切换到更谨慎的模式。它会将第一阶段所有的错误提取出来,并将这些信息作为“负面示例”反馈给战术家。
    • 类比: 想象你在尝试打开一扇锁着的门。在第一阶段,你快速尝试了 5 把不同的钥匙。没有一把能用。在第二阶段,你不再是随机尝试钥匙,而是观察那 5 把卡住锁的钥匙,记录下它们是如何卡住的,并利用这些信息来打造一把符合锁孔特定形状的新钥匙。

3. 为什么这很重要:“组合数学”问题

论文在两类数学问题上测试了该系统。

  • 标准数学问题: VERITAS 解决这些问题的数量超过了以往的方法(40.6% 对比 36.9%)。
  • 组合数学(计数问题): 这是 VERITAS 真正大放异彩的地方。在这些问题中,你通常需要使用非常具体且精确的数学规则名称。
    • 问题所在: 标准的 AI 猜测经常会“幻觉”(编造)不存在的规则名称。如果 AI 猜了一个虚假的规则名,标准系统只会说“失败”然后继续下一步。
    • VERITAS 的解决方法: 因为 VERITAS 会阅读具体的错误信息(例如“未知常量 'X'”),它能在实时过程中意识到“X”并不存在。它会迭代地修正名称,直到找到真实的名称。
    • 结果: 在这些困难的计数问题上,标准的猜测方法随着尝试次数的增加反而变得更糟(因为它不断编造虚假的名称);而 VERITAS 则变得越来越好,因为它能从错误中学习。

4. “单调性”保证

作者确保了 VERITAS 永远不会丢失已经找到的解。

  • 保证: 如果“快速扫射”(第一阶段)解决了问题,VERITAS 会保留该解并且不再触碰它。“深度挖掘”(第二阶段)仅针对第一阶段无法解决的问题进行工作。
  • 意义: 这证明了 VERITAS 所取得的任何额外成功,都完全来自于这种智能的、基于反馈的搜索,而不是仅仅通过尝试更多的随机猜测。

5. “批处理”技巧

论文中一个聪明的工程技巧是关于如何检查答案的。

  • 旧方法: 检查一个猜测,等待计算机说“不”,再检查下一个,等待,再检查下一个……这很慢。
  • VERITAS 方法: 他们将 6 个猜测打包进一个单一文件中,并要求计算机一次性检查所有猜测。这使得系统速度提高了约 10 到 20 倍,节省了大量的时间和成本。

总结

VERITAS 是一个将计算机错误信息视为地图而非“停止标志”的系统。通过阅读证明失败的具体原因(语法错误、类型错误、缺失步骤)并将这些信息反馈到 AI 的下一次尝试中,它能够解决其他系统会放弃的困难数学问题。它结合了快速的“尝试并观察”方法与智能的“从失败中学习”方法,以获得最佳结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →