← 最新论文
💻 computer science

Security in a Workflow: Exploring Role-Based Agentic Architectures for Vulnerability Handling

本文提出并评估了一种由规划者(Planner)、分析者(Analyzer)、修复者(Fixer)和验证者(Verifier)智能体组成的基于角色的智能体工作流,旨在弥合孤立的 LLM 安全任务与现实工业实践之间的差距,并在 25 个真实的 C/C++ 漏洞上展示了 44% 的漏洞检测准确率和 19% 的修复准确率。

原作者: Srijita Basu, Miroslaw Staron

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Srijita Basu, Miroslaw Staron

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图修理一栋非常古老且复杂的房子(一个用 C 或 C++ 编写的软件程序),这栋房子隐藏着裂缝和薄弱环节(安全漏洞)。在过去,你可能会雇佣一名超级聪明的侦探(标准的 AI)来检查房子,寻找裂缝,并尝试一次性修补所有问题。有时这位侦探做得很好,但通常他们会被搞得应接不暇,错过细微的线索,或者修错了墙壁。

这篇论文提出了一种不同的方法:雇佣一支专业的特种作业团队,而不是一名孤独的侦探。他们在一个严格的流水线上协同工作,每个人都有特定的职责。

以下是该团队是如何运作的,使用了论文中的研究结果:

1. 团队角色(“智能体工作流”)

研究人员建立了一个由四个不同角色组成的数字团队,类似于一个建筑施工队:

  • 规划者(现场经理): 在任何人开始挖掘之前,这个智能体会扫描蓝图(代码)以发现明显的麻烦点。它不负责修复任何东西;它只是指引团队走向看起来可疑的区域,比如“检查后门”或“观察地基”。
    • 关键发现: 论文发现,拥有这个“现场经理”至关重要。当他们移除这个角色时,团队发现问题的能力下降了近一半。
  • 分析者(检查员): 这是主要的侦探。他们根据规划者提供的线索和原始代码,弄清楚到底哪里坏了、为什么坏了,以及窃贼会如何潜入。
    • 关键发现: 研究人员尝试给这个智能体配备了一台高科技金属探测器(一个名为 CodeQL 的工具)来帮助寻找裂缝。令人惊讶的是,金属探测器并不总是有效。有时它会发出过多的虚假警报,让检查员感到困惑。最好的结果来自于 AI 模型本身的深度思考,而不是过度依赖这个额外的工具。
  • 修复者(修理工): 一旦检查员说:“门框腐烂了”,修复者就会尝试造一扇新门。他们编写代码来填补这个漏洞。
    • 关键发现: 这是最难的工作。虽然团队在发现问题方面表现尚可(准确率约为 44%),但要正确修复它却难得多(仅为 19% 左右)。通常,修复者在修补漏洞的同时,会不小心损坏附近的其它部分,或者添加了不必要的部件。
  • 验证者(安全检查员): 在维修完成后,这个智能体会复核工作。他们会询问:“你真的修复了腐烂吗?你是让房子变得更安全了,还是仅仅在裂缝上刷了层漆?”
    • 关键发现: 这个角色在发现错误方面表现相当出色,捕捉到了大约 69% 的维修错误。

2. 实验

研究人员在 25 个真实的安全性漏洞上测试了这个团队,这些漏洞发现于流行的 C/C++ 软件(例如用于安全关键系统的软件)。他们使用了三种不同的“大脑”(AI 模型)来驱动团队成员。

他们比较了两个版本的团队:

  1. 团队 A: 仅由四个角色进行对话。
  2. 团队 B: 同样的四个角色,但检查员配备了 CodeQL 金属探测器来帮助寻找裂缝。

3. 他们的发现

  • “经理”最为关键: 过程中最重要的部分是 规划者。如果没有一个经理来引导团队去哪里寻找,AI 就会迷失方向。有了经理,团队在发现漏洞方面的表现与顶尖的商业级 AI(GPT-5.5)不相上下。
  • 工具并非万能: 给检查员配备一个高级工具(CodeQL)并不会自动让他们变得更好。事实上,有时情况会变得更糟,因为 AI 难以正确解读工具的数据。论文表明,对于低级计算机语言(如 C),AI 需要足够聪明,能够自行判断哪些线索更重要。
  • 发现 vs. 修复: AI 发现安全漏洞比修复漏洞要容易得多。团队发现漏洞的成功率约为 44%,但正确修复它们的成功率仅为 19%。
  • 人工干预仍然必要: 由于“修理工”(修复者)经常犯错或添加不必要的改动,论文得出结论:在现实世界的安全领域,你不能只让 AI 说了算。你需要有人在 AI 肩后监督,检查维修工作,并确保房子确实安全。

核心结论

这篇论文并不是声称 AI 现在可以独立完美地保障软件安全。相反,它表明将 AI 组织成具有明确角色的结构化团队,比让单个 AI 处理所有事情是更好的处理安全问题的方法。然而,即使拥有优秀的团队,“修复”部分仍然非常棘手,人类专家对于验证工作仍然至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →