← 最新论文
💻 computer science

PROMISE: Proof Automation as Structural Imitation of Human Reasoning

本文提出了 PROMISE 框架,通过将证明生成重构为基于证明状态转换的结构化搜索,利用结构感知挖掘技术从证明状态和策略转换中提取模式,从而在 seL4 基准测试中显著超越了现有方法,实现了高达 186% 的相对性能提升。

原作者: Youngjoo Ahn, Sangyeop Yeo, Gijung Lim, Jongmin Lee, Jinyoung Yeo, Jieung Kim

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Youngjoo Ahn, Sangyeop Yeo, Gijung Lim, Jongmin Lee, Jinyoung Yeo, Jieung Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 PROMISE 的新系统,它的目标是帮助计算机自动完成一项极其困难的任务:形式化验证(Formal Verification)。

为了让你轻松理解,我们可以把这项任务想象成**“建造一座完全不会倒塌的摩天大楼”**。

1. 背景:为什么这很难?(建造摩天大楼的噩梦)

想象一下,你要建造一座摩天大楼(比如一个操作系统,像 seL4 微内核)。

  • 传统方法(测试): 就像你盖好楼后,派人去敲敲墙、跑跑楼梯,看看有没有裂缝。但这只能发现“这里有问题”,不能保证“其他地方绝对没问题”。
  • 形式化验证(数学证明): 这要求你在盖楼之前,就用数学公式证明每一块砖、每一根钢筋在逻辑上都是完美的,保证大楼永远不可能倒塌。

痛点:
虽然这种方法最安全,但太累了

  • 以前的证明过程就像让一个人类建筑师,拿着放大镜,手动去检查每一块砖的拼接逻辑。
  • 对于像 seL4 这样的大系统,人类工程师花了几十年的时间,写出的“证明文档”比“大楼图纸”本身还要厚好几倍。
  • 最近,大家想用人工智能(大语言模型,LLM) 来帮忙,让 AI 自动写这些证明。

2. 问题:现有的 AI 为什么“翻车”了?

现在的 AI 助手(比如早期的自动证明工具)在写证明时,就像是一个只会死记硬背的实习生

  • 它怎么找资料? 它会在图书馆里搜索关键词。比如你要证明“电梯不能同时停在 1 楼和 2 楼”,它就去找标题里包含“电梯”、“停止”这些词的旧证明。
  • 它的毛病: 它只看表面文字,不看深层逻辑
    • 比喻: 就像你想学做“红烧肉”,实习生去图书馆找了一本叫《红烧肉》的书,但书里讲的是“红烧牛肉”的做法,只是标题写错了。或者它找到的书里,虽然也是做肉,但用的是完全不同的烹饪流派(比如法式煎肉),完全不适合你的中式厨房。
  • 结果: 在简单的数学题上,AI 还能凑合;但一遇到像操作系统这样复杂、环环相扣的大工程,AI 就晕头转向,因为它的参考书(检索到的证明)虽然名字像,但结构完全不对,根本没法用。

3. 解决方案:PROMISE 的“结构模仿”魔法

论文作者提出了 PROMISE 系统。它的核心思想是:不要只模仿“说什么”,要模仿“怎么做”

核心比喻:从“查字典”变成“看施工流程图”

  • 旧方法(关键词检索): 就像你在查字典,找“电梯”这个词。
  • PROMISE 方法(结构检索): 它不看标题,而是看施工过程中的“状态变化”

PROMISE 是怎么工作的?

  1. 观察“施工状态”:
    证明一个定理,就像把一堆杂乱的积木(初始目标)一步步拼成完美的形状(完成证明)。每一步,积木的形状都会变(比如:把一个大目标拆成两个小目标,或者消除一个障碍)。
    PROMISE 不关心你拼的是什么积木,它关心的是**“从形状 A 变成形状 B 的这个过程”**。

  2. 寻找“同款施工法”:
    当 AI 遇到一个难题时,PROMISE 会去数据库里找:“以前有没有人遇到过类似的‘形状变化’?”

    • 比如:现在的状态是“需要把一个大房间拆成两个小房间”,PROMISE 会找到以前有人用“拆墙法”成功处理过类似情况的记录。
    • 哪怕那个旧案例是处理“厨房”的,而你现在处理的是“卧室”,只要**“拆墙”的逻辑结构是一样的**,PROMISE 就能把那个成功的“拆墙步骤”借过来用。
  3. 像人类专家一样思考:
    人类专家在盖楼时,不会死记硬背“电梯”这个词,而是会想:“哦,这个情况和我上次处理‘楼梯承重’时的逻辑结构很像,当时我是先加固地基,再拆掉临时支撑。我也应该这么干。”
    PROMISE 就是模拟了这种**“结构模仿”**的能力。

4. 实验结果:真的有用吗?

作者拿 seL4 操作系统这个“超级大工程”来测试:

  • 对手: 以前的 AI 助手(Selene, Rango),它们还在用“查关键词”的老办法。
  • PROMISE: 用“看结构”的新办法。

结果:

  • PROMISE 的成功率比对手高出了186%(在某些测试中)。
  • 即使换用不同能力的 AI 模型(有的强,有的弱),PROMISE 都能保持很高的成功率,说明它很稳健
  • 它甚至能帮那些不太聪明的 AI 模型(比如只有 70 亿参数的模型)发挥出接近顶级模型的水平。

5. 总结:一句话看懂

如果把自动证明看作**“教 AI 盖摩天大楼”**:

  • 以前的 AI 是拿着关键词索引去找旧图纸,结果经常拿错图纸,导致大楼盖歪了。
  • PROMISE 是教 AI 看施工流程图,只要发现现在的“施工难点”和以前某个成功的“施工步骤”在结构上长得像,就直接把那个成功的步骤“复制粘贴”过来,不管大楼的名字叫什么。

PROMISE 证明了:在复杂的系统工程中,模仿人类专家的“思考路径(结构)”,比模仿人类的“说话内容(文字)”要重要得多。 这让 AI 真正具备了处理大规模、高难度软件验证的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →