← 最新论文
💻 computer science

Code-Augur: Agentic Vulnerability Detection via Specification Inference

Code-Augur 是一种新颖的智能体漏洞检测框架,它通过从代码中显式推断安全规范,并利用运行时证伪进行持续优化,从而增强了自主大语言模型的可靠性与有效性,进而发现了其他方法所遗漏的真实世界开源项目中的关键漏洞。

原作者: Zhengxiong Luo, Mehtab Zafar, Dylan Wolff, Abhik Roychoudhury

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengxiong Luo, Mehtab Zafar, Dylan Wolff, Abhik Roychoudhury

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位才华横溢但略显自负的侦探,来检查一座规模宏大、结构复杂的工厂是否存在安全隐患。这位侦探是一个 AI 智能体。

在过去,如果这位 AI 侦探说:“这台机器是安全的”,你只能听凭其言,却无法得知其背后的依据,也无法得知他做了哪些假设。如果他因为误以为某个零件是钢制的(实际上是塑料)而忽略了一个隐藏的危险,你只能等到机器爆炸时才会发现。

CODE-AUGUR 是一个旨在解决这一问题的全新系统。它通过强制要求 AI 侦探写下其假设,并随后立即尝试证明这些假设是错误的,从而改变了 AI 侦探的工作方式。

以下是它的工作原理,分为几个简单的步骤:

1. 侦探编写“安全承诺”

不再只是观察代码并简单地说“安全”或“不安全”,现在的 AI 侦探被要求在判定一段代码安全时,必须编写一条具体的规则,即安全规范(Security Specification)

  • 类比: 想象侦探看着一座桥说:“这座桥是安全的。”在旧系统中,故事到此结束。但在 CODE-AUGUR 之下,侦探必须在桥上贴一张便签,上面写着:“我假设这座桥可以承载 10 吨重量。”
  • 结果: 这个“便签”实际上是嵌入在软件内部的一行代码(断言)。它将侦探无形的思考过程转化为了可见的、可测试的规则。

2. “恶魔代言人”试图破坏它

一旦侦探写好了规则,第二个工具——被称为 Fuzzer(可以理解为一个混乱且不知疲倦的压力测试员)——就会被雇佣。它的唯一任务就是试图破坏侦探制定的规则。

  • 类比: Fuzzer 就像是一名拆解专家,试图开着一辆 15 吨重的卡车驶过那座桥,以观察桥是否会坍塌。
  • 两种结果:
    • 结果 A(桥塌了): Fuzzer 找到了破坏规则的方法。这意味着侦探错了。桥确实并不安全,并且发现了一个真实的漏洞。
    • 结果 B(规则本身有误): Fuzizer 破坏了规则,但桥并没有发生危险性的坍塌。这意味着侦探的“便签”写得过于严格,或者误解了情况。随后,侦探会更新他们的规则,使其更加准确。

3. 改进的循环

这个过程创造了一个持续的循环:推理 \rightarrow 编写规则 \rightarrow 尝试破坏规则 \rightarrow 修补规则或发现 Bug。

通过这种方式,该系统不仅是在寻找 Bug,更是在强制要求 AI 将其对代码“应该如何运作”的理解与代码“实际表现如何”进行对齐。如果 AI 做出了错误的假设,Fuzzer 会立即将其抓获。

他们发现了什么?

研究人员在真实的软件项目上测试了这个系统(称为 CODE-AUGUR)。以下是他们报告的关键结果:

  • 优于竞争对手: 它发现的 Bug 数量显著高于其他顶尖的 AI 安全工具(增加了 34% 到 370%)。
  • 全新的发现: 它在流行的开源软件中发现了 22 个全新的漏洞,此前从未有人知晓。
  • 现实世界的冲击力: 开发人员已经修复或确认了其中 16 个新 Bug。其中一些发现甚至获得了“漏洞赏金”(发现安全漏洞的现金奖励)。
  • 长期价值: AI 编写下的这些“规则”(不变性)具有持久性。即使在审计完成后,它们依然保留在代码中。在一个涉及 GPS 软件项目的案例研究中,这些规则帮助开发人员在四个月内修复了一整类相关的 Bug,防止了同样的错误再次发生。

为什么这很重要

论文指出,仅仅拥有一个能找 Bug 的 AI 是不够的。我们需要知道它为什么认为某样东西是安全的。CODE-AUGUR 让 AI 的思考过程变得透明、可测试且具备自我纠错能力。它将一个“黑盒”AI 转变为一个能够写下逻辑、接受测试并从错误中学习的合作伙伴,使软件安全变得更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →