← 最新论文
🤖 AI

ImProver 2: Iteratively Self-Improving LMs for Neurosymbolic Proof Optimization

本文介绍了 ImProver 2,这是一个神经符号框架,它将数据高效的专家迭代与结构脚手架系统相结合,使小型语言模型能够有效优化 Lean 4 中的复杂形式化证明,在显著超越更大规模模型的同时,将证明优化确立为一项可扩展、可学习的任务。

原作者: Riyaz Ahuja, Tate Rowney, Jeremy Avigad, Sean Welleck

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Riyaz Ahuja, Tate Rowney, Jeremy Avigad, Sean Welleck

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一个庞大且不断增长的数学证明图书馆。这些不仅仅是故事;它们是经过计算机严格检查的刚性蓝图,用于证明事物的真实性。最近,计算机(特别是人工智能)开始帮助人类编写这些证明,导致图书馆的规模急剧膨胀。

但问题随之而来:图书馆变得杂乱无章。有些证明虽然正确,但写法令人困惑;有些过于冗长;还有些依赖庞大的其他规则列表,使得它们难以维护。这就像拥有一栋房子,其中的管道虽然能工作,但管线纠缠不清,墙壁涂着冲突的颜色,而且你甚至需要背着一背包的额外工具才能打开一盏灯。

ImProver 2 登场了。

将 ImProver 2 想象成一位超级有条理、能自我完善的图书管理员,它不仅仅是把书上架,还会重写书籍以使其更优秀。它的工作是接收一个正确的证明,并将其重写得更短、更简洁或更具模块化,同时不破坏数学逻辑。

以下是它的工作原理,借助一些简单的类比:

1. “熟能生巧”循环(迭代式自我完善)

通常,要教会计算机执行某项任务,你需要向它展示成千上万个由人类编写的示例。但在证明优化领域,高质量的示例非常稀缺。

ImProver 2 通过自我教学来解决这个问题。

  • 草稿阶段:它接收一个证明,并尝试以多种不同的方式重写它(就像一位作家为同一个故事构思 10 种不同的结局)。
  • 评分阶段:它检查哪些重写版本在数学上仍然正确。然后,根据我们的目标对它们进行评分:它更短了吗?它使用的引用更少了吗?它是否被分解为更清晰的步骤?
  • 学习阶段:它将“获胜”的重写版本与“失败”的版本进行比较。它学会了:“哦,当我这样做时,证明变短了且保持正确;当我那样做时,它出错了。”
  • 回放缓冲区:为了防止人工智能遗忘所学内容或陷入糟糕想法的循环,它会建立一个“记忆库”,将旧的优质示例与新示例混合在一起。这确保它能随时间不断进步,而不是仅仅重复同样的错误。

2. “神经符号脚手架”(训练轮)

想象一下,在没有手册或图表的情况下试图修理复杂的引擎。这很难。现在想象你拥有一张图表,它精确地高亮显示你正在工作的部件,用通俗易懂的英语解释该部件的作用,并列出附近所需的工具。

ImProver 2 为每个证明向人工智能提供这种“图表”。这被称为神经符号增强。它提供:

  • 地图:展示证明的当前状态(目前已证明的内容,以及剩余待完成的内容)。
  • 上下文:调取与该特定证明相关的具体定义和规则,因此人工智能无需猜测。
  • 翻译:提供证明试图做什么的“通俗英语”摘要,帮助人工智能在开始编写代码之前理解目标

这种“脚手架”甚至能让小型、算力较弱的计算机表现得像更大、更智能的计算机一样。

3. 三大目标(指标)

这位图书管理员不仅仅希望证明是“正确”的。它希望针对特定质量进行优化,就像厨师调整食谱一样:

  • 长度(“高尔夫”指标):就像在高尔夫球中一样,目标是用最少的挥杆次数将球打入洞中。ImProver 2 试图通过移除不必要的步骤来缩短证明。
  • 依赖项(“自包含”指标):想象一个食谱说“添加邻居家的秘制酱汁”。这就是一种依赖。ImProver 2 试图重写证明,使其不再依赖如此多的外部“邻居酱汁”,从而使它们更易于理解并独立使用。
  • 模块化(“乐高”指标):杂乱的证明就像一大块粘土。模块化的证明则像一套乐高积木——由小型、独立且可重复使用的部件组成。ImProver 2 试图将大型证明分解为更小的、独立的子证明(例如“拥有 h1"、“拥有 h2"),从而使逻辑更加清晰。

结果:小即是强

最惊人的发现是,ImProver 2 将一个小型人工智能模型(70 亿参数)训练得比那些巨型人工智能模型(有些拥有数千亿参数)更擅长这些任务,而这些巨型模型没有接受这种特殊训练。

这就像将一辆紧凑、高效的跑车进行完美调校,使其在特定比赛中击败一辆拥有更大引擎的庞大重型卡车。当小型模型获得了正确的“脚手架”和正确的“练习循环”后,它学会了比那些巨头更好地重构复杂的数学论证。

总之:ImProver 2 是一个系统,它教导小型人工智能模型成为专业的证明编辑。通过为它们提供清晰的问题地图,并让它们从自己最好的尝试中学习,它可以清理杂乱的数学图书馆,使其更短、更简洁、更易于维护,而这一切都不需要最昂贵、最庞大的超级计算机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →