← 最新论文
🤖 AI

Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

这项实证研究得出结论,目前由 Ollama 模型驱动的开源通用大语言模型(LLM)智能体尚不足以在现实的网络安全场景中取代像 Bandit 这样成熟的静态应用安全测试(SAST)工具。

原作者: Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个庞大的书籍(代码)图书馆,你需要找出其中每一个错别字、情节漏洞或隐藏其中的危险秘密。为了完成这项工作,你请来了两位助手:

  1. 资深图书管理员(Bandit): 这是一个传统的工具。它不会“思考”或“想象”。它有一份严格的、预先写好的检查清单(比如“不要让后门敞开”或“不要使用生锈的锁”)。它快速、有条理地扫描书籍,并准确地告诉你问题出在哪里。它很枯燥,但很可靠。
  2. 创意实习生(AI Agent): 这是一个新的、时髦的大型语言模型(LLM)。它就像一个读遍了整个互联网的优秀学生。它没有检查清单,你只需要给它一份职位描述:“寻找任何看起来危险的东西。”它利用自己的想象力来猜测哪里可能出了问题。

实验过程
研究人员决定让这两位助手进行一场对决。他们给他们三个不同的“图书馆”(开源软件项目)进行扫描:

  • 一个虽然退役但依然稳固的软件包管理器(Yum)。
  • 一个个人习惯追踪应用(Beaverhabits)。
  • 一个用于拦截恶意登录尝试的安全工具(Fail2ban)。

他们先让资深图书管理员进行扫描,以创建一个真实的“金标准”问题列表。然后,他们让创意实习生(由三种不同的 AI 模型:Gemma、Llama 和 Qwen 提供支持)执行同样的工作。

发生了什么?(结果)

对于创意实习生来说,结果有点惨不忍睹。以下是使用简单类比进行的拆解:

  • “幻觉”问题: 实习生不断编造并不存在的问题。它看到一行完全正常的代码,就会说:“啊哈!这是一个泄露秘密密码的漏洞!”而实际上那只是一个标准的设置。在论文中,这被称为误报(False Positive)。实习生因为太渴望发现麻烦,以至于把无害的东西标记为危险。
    • 类比: 这就像一名保安认为拿着红苹果的人手里拿着炸弹,因为“红色的东西很危险”。
  • “丢失位置”问题: 当实习生确实发现了一个真实的问题时,它往往无法告诉你问题到底在哪里。它会说:“代码里有一个漏洞,”但当你问“哪个文件?哪一行?”时,它会编造一个不存在的文件名,或者指向一个空白的行号。
    • 类比: 这就像一名侦探说:“小偷在房子里,”但当你问“在哪个房间?”时,他猜“阁楼”,而小贼其实是在地下室。
  • “错失良机”问题: 实习生漏掉了资深图书管理员发现的大部分实际问题。它只抓住了大约 25% 的真实问题。
    • 类比: 图书管理员找到了 100 个错别字。实习生只找到了 25 个,而且它发现的那些问题中,有 50 个根本不是错别字。
  • “速度”问题: 资深图书管理员在不到一分钟内就完成了工作。而创意实习生则需要数小时(有时每个库需要 1 到 4 小时)才能完成同样的工作。
    • 类比: 图书管理员是一列高速列车。实习生是一只蜗牛,每走一段路都要停下来闻闻花香。

结论

论文得出结论:目前的创意实习生还没有准备好取代资深图书管理员。

虽然实习生非常擅长写故事或总结邮件,但对于目前这种特定的、高风险的安全扫描工作来说,它显得过于不可靠。它产生了太多的“噪音”(虚假警报),漏掉了太多真正的危险,而且完成工作的时间太长了。

研究人员建议,也许实习生可以作为图书管理员的助手——例如去发现图书管理员遗漏的东西——但前提是必须由人类先对它的每一个猜测进行核查。但如果要作为一种独立的工具来取代旧的、可靠的方法?论文给出的答案是。这些“幻觉”(凭空捏造)和缺乏精确性的问题,使得目前将它信任于安全领域的风险过高。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →