Visored: A Controlled-Natural-Language Prover for LLM-Generated Mathematics
本文介绍了 Visored,这是一个基于依赖类型的证明器,它通过使用类自然语言的接口和规则驱动的自动化技术将证明转换为经过检查的 Lean 文件,从而在大型语言模型生成的数学内容与形式化验证之间搭建桥梁,并在无需专门训练的情况下在 miniF2F 基准测试中展示了有效的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教导一名才华横溢但略带“幻觉”倾向的学生(一个 AI)如何编写数学证明。这个学生擅长用直白的英语讲述证明的“故事”,但他们经常会跳过那些严谨的数学老师认为必须看到的、微小且枯燥的细节。
目前,如果你要求这个学生用一种严格的、计算机可读的语言(如 Lean)来编写证明,他们往往会陷入困境。他们不知道该选择哪一个具体的“库规则”,或者会搞错像“不能除以零”这样微小的细节。
Visored 是一个旨在解决这一问题的全新工具。它作为一个翻译器和安全网,位于学生的自然语言与严格的计算机语言之间。
以下是它的工作原理,通过几个类比来解释:
1. “受控自然语言”(剧本)
Visored 并没有强迫 AI 直接编写像 Lean 那样僵硬、类似代码的语言,而是让 AI 使用一种受控版本的英语进行编写。
- 类比: 这就像是一个“填词游戏”(Mad Libs)风格的剧本。AI 不被允许随心所欲地书写;它必须使用特定的句子模板,如“设 x 为...”、“假设...”、“那么...”等。
- 为什么有效: 这让 AI 保持在自己的舒适区(编写英语),同时确保其结构足够严密,能够被计算机理解。这就像是给学生一份填空练习题,而不是一张白纸。
2. “中间人”(中间表示层,IR)
Visored 不仅仅是猜测 AI 的意思。它将那段英语脚本转换为一种中间层表示(称为 IR)。
- 类比: 想象 AI 写了一份草稿。Visored 拿到这份草稿后,会填补 AI 跳过的所有隐形“脚注”。AI 是否假设了 是正数?Visored 会把这一点记录下来。AI 是否除以了一个变量?Visored 会检查该变量是否为非零。
- 神奇之处: 如果 AI 犯了错误,Visored 不仅仅是说“错误”,它还会精确地指出逻辑断裂的具体句子,就像老师用红笔圈出特定错误一样。这给了 AI 一个清晰的信号,告诉它下一步该如何修正。
3. “规则驱动求解器”(自动阅卷器)
一旦 Visored 将证明转换成这种中间层格式,它就会使用一个基于规则的引擎来检查那些“枯燥”的步骤。
- 类比: 想象一本数学教科书。当教科书说“由此得出...”时,它通常会跳过代数运算,因为这对人类来说显而易见。Visored 的求解器就像一个不知疲倦的机器人,负责填补这些被跳过的步骤。它会自动检查这些小步骤中的算术、代数和逻辑。
- 结果: 如果 AI 提供了主要思路,Visored 则负责处理这些琐碎的“苦力活”,去证明其中的微小步骤。
4. “回译”(Lean 输出)
如果 Visored 对该证明感到满意,它可以将其翻译回 Lean 代码(即那种严格的语言)进行最终验证。
- 代价: 论文承认目前的翻译非常“冗长”。这就像是将一份 1 页的摘要扩展成一份 200 页的法律合同,仅仅是为了确保每一个词在法律上都是精确的。虽然可行,但体积巨大。
他们究竟取得了什么成就?
研究人员在 244 个数学问题(主要来自初中竞赛)上测试了该系统。
- 结果: 使用 Visored 的 AI 智能体成功解决了这些问题中的 91%。
- 代价: AI 并不是“独自”解决问题的。它是在一个循环中工作的:AI 写一个草稿,Visored 检查并反馈“此处出错”,AI 进行修正,然后再次尝试。
- 局限性: 它在处理极难问题(如国际数学奥林匹克竞赛题目)时遇到了困难,因为 Visored 的“规则书”尚未具备处理这些高级数学技巧的能力。
核心结论
Visored 并不是一个能瞬间解决难题的“魔杖”。相反,它是一个协作式工作空间。它允许 AI 用它理解的语言(英语)编写证明,同时由一个计算机系统处理严格的逻辑和错误检查。
该论文声称,通过使用这种“中间人”方法,我们可以让 AI 生成真正可靠的数学证明,而无需强迫 AI 从头开始学习那些困难且僵化的形式化证明系统编程语言。它将 AI 的“幻觉”转化为了一个结构化的、可检查的过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。