← 最新论文
💻 computer science

Neuro-Symbolic Software Verification: Hyper-charging Local Language Models with Symbolic Reasoning at Scale

本文介绍了 VerIbmc,这是一个神经符号流水线,它利用本地开源权重语言模型,结合符号不变性合成与迭代验证器反馈,实现了用于软件验证的最先进循环不变式生成,为专有的云端工具提供了一种保护隐私且具有成本效益的替代方案。

原作者: Muhammad A. A. Pirzada, Julian Parsert, Weiqi Wang, Konstantin Korovin, Lucas C. Cordeiro

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad A. A. Pirzada, Julian Parsert, Weiqi Wang, Konstantin Korovin, Lucas C. Cordeiro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图证明一台复杂的机器(一个计算机程序)永远不会损坏,无论它运行多少次。证明中最困难的部分是理解这台机器的“循环”——即那些重复执行任务的部分。为了证明机器是安全的,你需要找到一个循环不变式(Loop Invariant)

循环不变式想象成一条“安全规则”,它在循环的每一次新周期开始时都必须成立。例如,如果一个循环从 10 倒数到 0,那么安全规则可能是:“数字始终在 0 到 10 之间。”如果你能证明这条规则在开始时成立、在每一步之后依然成立,并最终导向一个安全的终点,那么整台机器就被证明是安全的。

问题在于,自动寻找这些规则极其困难。这就像是在没有任何线索的情况下,试图猜出保险箱的密码。

旧方法 vs. 新方法

旧方法(符号推理):
传统上,计算机尝试使用严格的数学和逻辑来寻找这些规则。这就像一位极其精准的会计在检查每一个数字。它非常可靠,但速度很慢,并且经常在复杂、混乱的问题面前卡壳。这就像是通过逐一检查每一面墙来试图走出迷宫。

“云端”方式(大型 AI 模型):
最近,人们开始使用大规模的人工智能(AI)模型来猜测这些规则。这些 AI 就像是博学多才的学生,阅读过数百万个代码示例。它们可以非常快速地猜出正确的规则。然而,要使用它们,你通常必须将你的代码发送到巨大的、昂贵的云端服务器(这就像把你的秘密蓝图交给一个陌生人)。对于需要保护代码隐私的公司来说,这既不利于隐私,也耗费大量资金。

解决方案:VerIbmc(本地“超级助手”)

该论文的作者构建了一个名为 VerIbmc 的新系统。你可以把它想象成一个本地工作坊,在这里你可以使用智能 AI 助手,而无需离开你的建筑。

以下是 VerIbmc 的工作原理,我们使用一个简单的类比:

想象你正在尝试解决一个困难的谜题(循环不变式)。

  1. 确定性侦探(阶段 0 & 1): 在请求 AI 帮忙之前,VerIbmc 会先派出一名严谨的逻辑侦探(一个名为 ESBMC 的工具)来观察谜题。侦探会先检查简单的事实。如果谜题很简单,侦探会立即解决它。如果侦探发现了一些坚实的线索(例如“数字始终为正数”),他们会将这些线索写在白板上。
  2. 本地 AI 助手(阶段 2): 如果侦探卡住了,他们就会请出本地 AI 助手。但诀窍在于:AI 并不是从零开始。侦探会将写有已发现线索的白板交给 AI。
  3. 反馈循环: AI 猜出一个完整的解法。侦探对其进行检查。
    • 如果错了,侦探不会只说“不对”。他们会说:“这一部分是错的,但另一部分实际上是正确的。”他们会提取正确的部分,将其写在白板上,然后要求 AI 再次尝试,并利用新的线索。
    • 这个过程会不断重复,直到谜题被解决或时间耗尽。

两种思考方式(CoT vs. ToT)

论文还测试了 AI 在解决谜题时应该如何“思考”:

  • 思维链(Chain-of-Thought, CoT): AI 以直线方式思考,循序渐进,就像在写一个单一的故事。
  • 思维树(Tree-of-Thoughts, ToT): AI 像树一样向外分支。它同时尝试几条不同的路径,观察哪些看起来更有希望,然后将精力集中在最好的路径上。论文发现,对于最强的 AI 模型,这种分支方法效果很好;但对于较小、较弱的模型,这种方法有时会浪费时间。

结果:为什么这很重要

研究人员使用五种不同的“开源权重”AI 模型(任何人都可以下载并在自己电脑上运行的模型),在数百个不同的编程谜题上测试了这个系统。

  • 隐私至上: 因为一切都在本地机器上运行,代码永远不会离开组织。这就像是在自己的房间里做数学作业,而不是把作业交给一个陌生人。
  • 成本效益: 你不需要向大型云端公司支付昂贵的费用。
  • 性能表现: 最好的配置(使用名为 GPT-OSS-120B 的大型本地模型)解决了 86.4% 的问题。这优于许多传统的工具,并且足以与昂贵的基于云端的 AI 工具相媲美。
  • “免费”的提升: 系统发现,“侦探”阶段(符号部分)在完全不需要 AI 介入的情况下就独立解决了 75 个问题。对于较弱的 AI 模型,侦探提供的线索帮助它们比单独使用 AI 时多解决了 35 个问题。

核心结论

VerIbmc 证明了你不需要昂贵且侵犯隐私的云端超级计算机来进行软件安全验证。通过将严谨的逻辑侦探与能够从错误中学习的智能本地 AI 助手相结合,你可以在自己的电脑上获得顶级的性能。这是一种让软件验证变得私密、经济且强大的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →