← 最新论文
💬 NLP

Optimizing the Cost-Quality Tradeoff of Agentic Theorem Provers in Lean

本文介绍了一种具有数据面和控制面的动作路由智能体,该智能体通过根据失败信号动态决定是继续还是重启证明尝试,优化了 Lean 智能定理证明中的成本-质量权衡,在保持性能的同时,在 PutnamBench 上实现了 25.8% 的计算成本降低。

原作者: Kári Rögnvaldsson, Chenhao Sun, Jasper Dekoninck, Martin Vechev

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Kári Rögnvaldsson, Chenhao Sun, Jasper Dekoninck, Martin Vechev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个非常困难的数学谜题,比如在著名的普特南数学竞赛(Putnam competition)中发现的那种。在过去,使用人工智能(AI)通过一种被称为 Lean 的严格计算机可读语言来解决这些谜题,就像雇佣了一支被告知无论如何都要尝试相同次数的工人团队。

如果 AI 在一个无法解决的问题上卡住了,它会一直尝试直到达到预设的限制(例如 64 次尝试),从而浪费大量的资金和计算资源。如果问题实际上很简单,它可能在第一次尝试时就解决了,但系统仍会强制它尝试直到达到上限以确保万无一失。这种“一刀切”的方法极其昂贵。

这篇论文介绍了一种更聪明、更灵活的 AI 智能体,它不像僵化的机器人,而更像是一位睿智的项目经理。以下是它的工作原理,分为几个简单的概念:

1. 问题所在:“盲目”的工人

把旧的 AI 系统想象成一个被告知:“尝试修理这个损坏的引擎正好 50 次。如果 50 次尝试后还没修好,就放弃。” 的工人。

  • 浪费: 如果引擎缺少一个根本不存在的零件(一个不可能解决的问题),工人会白白浪费 50 次尝试。
  • 成本: 每次“尝试”都会消耗金钱(计算能力)。在一个坏掉的引擎上进行 50 次尝试是巨大的资源浪费。

2. 解决方案:“聪明”的经理

论文中描述的新系统将工作分为两个部分:工人(尝试解决数学问题)和经理(决定何时停止)。

工人(数据平面)

这部分将大的数学问题分解成较小的、易于处理的步骤(引理/lemmas)。它尝试证明每一个步骤。如果失败了,它会再次尝试。它是实际进行重体力劳动的部分。

经理(控制平面)

这是这项新发明。经理不再让工人盲目地尝试 50 次,而是观察工人的尝试过程。它观察失败的历史并询问两个问题:

  1. 这花了我们多少钱?(我们消耗了多少个计算机“Token”?)
  2. 还有希望吗?(根据目前为止犯下的错误,工人是在接近解决方案,还是仅仅在原地打转?)

3. “红绿灯”系统

经理使用一个简单的规则来决定下一步该做什么:

  • 绿灯(继续前进): 如果工人正在取得进展且成本较低,经理会说:“做得好,再试一次!”
  • 红灯(停止并重启): 如果工人不断犯同样的错误,或者成本过高而成功机会微乎其微,经理会说:“停!这条路是死胡同。让我们放弃这个计划,尝试一种完全不同的拆解问题的方法。”

4. 结果:在不损失胜率的情况下节省资金

研究人员在 85 个困难的数学问题上测试了这个“聪明经理”。

  • 旧方法: 为了解决一定比例的问题,旧系统花费了大量的资金。
  • 新方法: 新的智能体解决了几乎相同数量的问题,但平均节省了 25.8% 的资金
  • 权衡: 如果他们想要花费与旧系统相同的金额,新的智能体实际上能多解决 7.8% 的问题

5. 经理是如何“知道”的?

经理并非拥有魔法;它像侦探观察犯罪现场一样,寻找失败尝试中的特定线索:

  • 重复性错误: 如果工人不断犯完全相同的错误,这表明他们陷入了循环。
  • 混乱: 如果工人尝试着完全不同、随机且不合逻辑的方法,这表明这个问题对于当前的计划来说可能太难了。

核心结论

这篇论文表明,在 AI 数学证明的世界里,知道何时放弃与知道如何工作同样重要。 通过添加一个观察成本和尝试质量的“经理”,我们可以节省四分之一的计算预算,而不会牺牲解决难题的能力。它将一种浪费性的、蛮力尝试的方法转变为一种聪明、高效的策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →