← 最新论文
🤖 machine learning

Can LLMs Reason Like Automated Theorem Provers for Rust Verification? VCoT-Bench: Evaluating via Verification Chain of Thought

本文提出了 VCoT-Lift 框架和包含 1,988 个任务的 VCoT-Bench 基准,通过将求解器推理转化为人类可读的验证思维链来细粒度评估大语言模型在 Rust 程序验证中的逻辑推理能力,结果显示当前模型在此领域远未达到自动化定理证明器的水平。

原作者: Zichen Xie, Wenxi Wang

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zichen Xie, Wenxi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的"AI 程序员”做一场极其严格的“逻辑体检”

简单来说,研究人员发现:虽然现在的 AI(大语言模型)写代码很厉害,但在证明代码绝对安全(特别是 Rust 语言)这件事上,它们其实是在“蒙混过关”,并没有真正像数学家那样去一步步推导逻辑。

为了揭开这个真相,他们发明了一套新工具和一个新考试。下面我用几个生动的比喻来解释:

1. 背景:AI 写代码,但“黑盒”验证

想象一下,Rust 是一种对安全性要求极高的编程语言(就像造飞机,不能有一点螺丝松动)。以前,AI 写代码后,验证工具(像 Z3 这样的自动定理证明器)会给出一个结果:“通过”或“失败”

  • 以前的做法(黑盒测试): 就像老师批改作业,只看最后的答案对不对。如果 AI 猜对了答案,老师就给它打勾。但这不知道 AI 是真的懂了,还是瞎蒙的。
  • 现在的痛点: 现有的 AI 可能只是记住了“这种代码长这样,答案就是那样”的统计规律,而不是真的理解了背后的逻辑。

2. 核心发明:VCoT-Lift(把“天书”翻译成“人话”)

验证工具(Z3)在证明代码正确时,会生成一份1 万行的“证明报告”。但这报告全是机器看的“天书”(比如 x775=x775 = x775 这种废话),人类根本看不懂,也没法用来教 AI。

  • VCoT-Lift 是什么?
    它就像一个超级翻译官。它把 Z3 生成的那 1 万行“机器天书”,提炼、压缩、翻译成了人类能看懂的**“验证思维链”(VCoT)**。
    • 比喻: 就像把一份复杂的法院判决书(全是法条引用和逻辑推演),翻译成一份清晰的**“案情复盘报告”**,告诉法官每一步是怎么推理出来的。
    • 作用: 它把验证过程从“黑盒”变成了“白盒”,让我们能看清 AI 到底有没有真的在思考。

3. 新考试:VCoT-Bench(挖坑测试)

有了这个“思维链”作为标准答案,研究人员设计了一个新考试,叫 VCoT-Bench

  • 怎么考?
    他们把完整的“思维链”挖掉一部分,让 AI 去补全。

    • 挖坑方式 1(挖掉比例): 挖掉 10%、50% 甚至 100% 的逻辑步骤。
    • 挖坑方式 2(挖掉类型): 专门挖掉“循环不变量”(像跑步时的配速表)或者“断言”(像检查点)。
    • 挖坑方式 3(挖掉位置): 挖掉开头、中间还是结尾。
  • 比喻: 就像给 AI 看一道数学题的解题过程,然后把中间的关键步骤擦掉,问 AI:“这一步是怎么算出来的?”如果 AI 只是死记硬背,它一擦掉就懵了;如果它真懂了逻辑,它应该能推出来。

4. 考试结果:AI 很脆弱(像纸糊的)

研究人员找了 10 个最厉害的 AI 模型(包括 GPT-5, Claude, Gemini 等)来考,结果很扎心:

  • 发现一:一挖就塌(脆弱性)
    只要挖掉一点点逻辑(比如 10%),AI 的准确率就大幅下降。如果全挖掉(让它从头推导),大部分 AI 直接“摆烂”,准确率跌到接近零。

    • 比喻: 它们就像搭积木,如果给你看完整的塔,它能照着搭;但如果你把中间的几块抽走,让它自己补,它就不知道该怎么搭了。它们依赖的是“上下文提示”,而不是真正的“逻辑推理”。
  • 发现二:中间最难(连接性)
    AI 在证明的开头(设条件)和结尾(下结论)表现还行,但在中间(连接前后的逻辑推导)表现最差。

    • 比喻: 就像讲故事,开头和结尾能编出来,但中间怎么把情节逻辑圆回来,AI 就经常“断片”。
  • 发现三:大模型也不够强
    即使是参数最大的模型,在这个逻辑推理任务上,也远不如专门的自动定理证明器(Z3)。

    • 结论: 现在的 AI 更像是**“熟练的模仿者”,而不是“严谨的数学家”**。它们擅长模仿代码的“样子”,但还没掌握证明代码“正确性”的“灵魂”。

5. 总结与未来

这篇论文告诉我们:

  1. 别太迷信 AI 的验证能力: 目前让 AI 去自动证明代码安全,风险很大,因为它们可能只是在“猜”答案。
  2. 新方向: 我们需要用这种“思维链”(VCoT)去训练 AI,让 AI 学会像数学家一样一步步推导,而不仅仅是猜下一个字是什么。

一句话总结:
这篇论文给 AI 做了一次“逻辑 X 光”,发现它们虽然能写出漂亮的代码,但在证明代码绝对安全这件事上,还像个只会背公式的“学渣”,离真正的“逻辑大师”还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →