FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean
本文提出了 FormalScience,一个面向科学领域的领域无关、人机协同智能体流水线,通过在 Lean4 中进行智能体代码生成,实现了将非正式科学推理(如物理学)高效、低成本地转化为语法正确且语义对齐的正式证明,并构建了包含 200 个大学水平物理问题的 FormalPhysics 数据集用于评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这是一篇关于如何让 AI “读懂”并“严谨证明”科学公式的论文。为了让你轻松理解,我们可以把这个复杂的科研过程想象成一个**“翻译官与数学严谨性”**的故事。
1. 背景:AI 的“翻译”危机
想象一下,你有一本非常牛的物理学笔记,上面写满了各种符号:(波函数)、(梯度)、(积分)。这些符号对物理学家来说就像母语一样自然,但对计算机来说,它们就像是**“带有方言的诗歌”**。
目前的 AI(比如 ChatGPT)虽然能读懂这些诗歌,但它在把这些“诗歌”翻译成计算机能理解的“严谨逻辑代码”(我们称之为 Lean 语言)时,经常会出问题。
问题出在哪?
- “幻觉”: AI 可能会一本正经地胡说八道,写出看起来很像公式但逻辑根本不通的代码。
- “语义漂移”: 这是最严重的。就像你让翻译官把“我心碎了”翻译成德语,结果他为了追求语法正确,翻译成了“我的心脏组织发生了物理性破裂”。虽然语法对了,但情感(物理本质)全丢了。
2. 核心方案:FormalScience —— “带教老师”模式
为了解决这个问题,作者提出了一个叫 FormalScience 的系统。
我们可以把这个系统想象成一个**“学徒培训计划”**:
- 学徒(AI Agent): 负责把物理笔记翻译成严谨代码。
- 导师(人类专家): 不直接写代码,而是坐在旁边盯着。
- 纠错机(Lean 编译器): 这是一个极其严厉的老师,只要代码里有一个标点符号不对,或者逻辑有一丁点漏洞,它就会立刻发出刺耳的警报(报错)。
这个流程是这样的:
- 初稿: AI 尝试翻译一段物理公式。
- 自检: 严厉的“纠错机”检查代码,报错了就扔回给 AI 让它改。
- 导师审核: 代码虽然能运行了,但导师(人类)会看一眼:“嘿,你虽然写对了数学,但你把量子力学的核心逻辑给简化成小学算术了!”
- 迭代: AI 根据导师的意见再次修改,直到代码既能运行,又完美保留了物理灵魂。
3. 实验成果:FormalPhysics —— 物理界的“标准考卷”
作者用这套方法,亲手制作了一套高质量的“考卷”——FormalPhysics。这套考卷包含了 200 个大学水平的物理问题(量子力学、电磁学等),每一道题都有:
- 自然语言描述(人类看的题目)
- 非正式证明(人类写的推导过程)
- 严谨形式化代码(计算机能验证的逻辑)
通过对比测试,作者发现:现在的 AI 即使能通过考试(代码能运行),但在处理复杂的物理概念(如狄拉克符号、矢量微积分)时,依然会发生**“降维打击”**。
4. 深刻发现:什么是“语义漂移”?(重点!)
这是这篇论文最精彩的部分。作者发现,当 AI 试图把复杂的物理学翻译成计算机代码时,会犯几种“偷懒”的错误:
“降维打击”(Notational Collapse):
- 比喻: 你让 AI 证明“一个复杂的交响乐团如何演奏”,AI 为了能写出代码,偷偷把交响乐团变成了“几个敲鼓的人”。
- 物理例子: 把复杂的量子算符(不能交换顺序的)变成了普通的复数(可以随便交换顺序的)。代码跑通了,但量子力学的灵魂没了。
“抽象升级”(Abstraction Elevation):
- 比喻: 你让 AI 证明“如何通过复杂的导航路线到达目的地”,AI 为了省事,直接写了一句“只要一直走就能到”。
- 物理例子: 把复杂的矢量微积分计算,简化成了简单的代数代换。
5. 总结:这篇论文在干什么?
简单来说,这篇论文告诉我们:“让 AI 写出能运行的代码”并不等于“让 AI 理解了科学”。
作者通过建立一套**“人类导师 + AI 学徒 + 严厉编译器”**的协作模式,不仅造出了一套高质量的物理数据集,更重要的是,他为我们指明了 AI 在科学领域进化的方向:我们不仅要追求代码的“正确性”(能运行),更要追求“保真度”(不丢掉物理本质)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。