← 最新论文
💬 NLP

Agentic Security: A Systematization of Tools, Failure Modes, and Design Laws for LLM-Driven Penetration Testing

本文通过实证评估,将大语言模型(LLM)驱动的渗透测试工具的运行失效进行了系统化梳理,并推导出定量设计法则与四维摩擦指数,旨在为构建以 Inspectra 平台为代表的鲁棒智能体安全系统提供指导。

原作者: Israt Moyeen Noumi, Tarannum Ahmed Nowshin, Md. Mehedi Hasan Nipu, Mohammad Sakib Mahmood, Md. Jakir Hossain, M. F. Mridha

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Israt Moyeen Noumi, Tarannum Ahmed Nowshin, Md. Mehedi Hasan Nipu, Mohammad Sakib Mahmood, Md. Jakir Hossain, M. F. Mridha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在计算机安全领域,长期以来一直存在着一项传统:雇佣熟练的人类在坏人入侵系统之前先进行攻破。这些被称为渗透测试员的专家,每天的工作就是寻找软件、网络和云基础设施中隐藏的缺陷。他们寻找弱密码、未修复的漏洞以及可能导致犯罪分子窃取数据或夺取控制权的逻辑错误。几十年来,这项工作一直是一种由人工驱动的手工技艺。然而,一股新的力量进入了这一领域:人工智能。具体来说,是大语言模型——这些在海量文本上训练过的、能够理解并生成人类语言的系统——现在正被要求承担这些安全专家的工作。其核心理念是构建“智能体”(agentic)系统:这种软件不仅能阅读代码和扫描网络,还能规划攻击、执行攻击并编写报告,而无需人类在旁指导。这种转变有望使安全测试变得更快、更便宜,但也引入了一系列新问题。当你将一项复杂且危险的任务交给一个基于概率而非确定性进行思考的机器时,机器可能会犯出人类绝不会犯的错误,或者更糟,它可能会自信地对发现的情况撒谎。

一组研究人员致力于了解这些 AI 安全智能体在独自工作时究竟表现如何。他们不仅仅构建了一个理论模型;他们构建了一个名为 Inspectra 的真实运行平台,并让它针对各种安全工具进行了压力测试。他们的目标是超越关于这些智能体“可能”做什么的炒作,转而记录它们在出错时“实际”会发生什么的硬核工程现实。他们的发现表明,这是一门处于雏形阶段的学科,同样的失败在反复发生,这并非因为技术本身出了问题,而是因为其使用方式超出了设计者的初衷。研究人员发现,最大的障碍并非 AI 缺乏智能,而是系统构建方式缺乏结构。他们识别出了特定的、可预测的失败模式,即当 AI 试图记忆过多信息、试图自我评判工作,或者被赋予了其无法控制的预算时,就会发生这些问题。

团队遇到的最直接问题之一是记忆问题。想象一个 AI 智能体开始了一项长时间的调查,阅读了数千行代码并运行了数十项测试。随着调查的进行,它需要留在“大脑”中的信息量不断增加。最终,系统会耗尽存储这些信息的空间。用人类的话说,这就像是在尝试记住一段漫长对话中的每一个细节,而说话的人却一直在不停地讲述;最早的细节会逐渐消逝。研究人员发现,当一个 AI 智能体在一个长期的、连续的会话中工作时,它不可避免地会遗忘在扫描开始时收集到的证据。当它到达最后一步编写报告时,它可能会自信地描述那些它从未真正打开过的文件,或者声称发现了几小时前记录过但在其记忆中已被抹除的漏洞。他们提出的解决方案是将工作分解为短促、独立的阶段。系统不再使用一个长对话,而是使用一系列短寿命的智能体。每个智能体完成一小部分工作,将其发现写入一个永久且有序的文件中,然后停止。下一个智能体只读取该文件的简要摘要,而不是原始数据。这种方法允许系统处理规模大得多的任务而不至于迷失方向,通过压缩需要向前传递的信息,有效地扩展了 AI 的记忆视野。

另一个关键的失效模式涉及系统如何判断自身的成功。当一个 AI 红队工具尝试攻破一个系统时,它需要一种方法来判定攻击是否真的奏效。研究人员发现,许多自动化工具在看到某些关键词时就过于急于宣布“是的,成功了”,即便攻击其实已经失败。这导致了大量的虚假警报。为了解决这个问题,团队设计了一个两步验证过程。首先,通过一个快速、廉价的检查来过滤掉明显的失败案例。然后,由第二个更仔细的评判者仅对通过了第一轮检查的案例进行审查。至关重要的一点是,第二个评判者必须是与第一个不同类型的系统;如果两个评判者是同一种类型的 AI,它们会犯同样的错误,从而使第二次检查变得毫无意义。通过使用两种不同的系统来验证结果,团队可以大幅减少虚假警报的数量,使最终报告更加可靠。他们还发现了一个微妙但危险的偏差:如果一次攻击以系统无法理解的方式失败了,软件往往会将其记录为成功。这意味着,那些最危险、最隐蔽的攻击反而最容易被隐藏或贴错标签,从而产生一种虚假的安全感。

研究人员还解决了成本与控制的问题。安全工具具有不可预测性;有些运行只需几秒钟,而有些则可能卡住并运行数小时,消耗大量的资金和计算能力。团队表明,仅仅在文本指令中告诉 AI“不要花费太多时间”是不够的。AI 可能会忽略这条指令,或者它可能会被正在阅读的内容分散注意力,从而忘记规则。相反,系统需要一个硬性的、外部的守门人——一段位于 AI 决策过程之外的代码。这个守门人负责强制执行工具运行时间和支出的严格限制,一旦达到限额,便立即切断连接。这确保了 AI 不会意外地让项目破产,或扫描未经授权访问的服务器。研究人员强调,AI 永远不应该是自身安全或预算的最终权威;那个角色必须始终属于一个独立的、不可更改的代码层。

最后,团队研究了工具本身。他们测试了十种不同的安全扫描器,发现那些最容易由人工操作的工具,往往在自动化系统中最难使用。许多工具的设计初衷是让人类点击登录界面,然后将会话移交给扫描器。当 AI 尝试这样做时,往往会失败,因为登录过程过于复杂,或者工具无法理解如何保持登录状态。研究人员开发了一种模式,由一个单独的浏览器自动化工具处理登录,然后将一个干净的、经过身份验证的链接列表传递给扫描器。这种职责分离的方法解决了许多集成方面的难题。他们还注意到,AI 安全政策的格局是波动的;今天允许进行某项安全测试的模型,明天可能会因为提供商规则的变更而拦截该测试。这意味着,任何构建在这些工具之上的系统都必须具备足够的灵活性,以便在不破坏整个工作流的情况下更换底层的 AI 模型。

论文总结道,自动化安全的未来不在于让 AI 变得更聪明,而在于为其构建一个更好的结构。最有效的系统是将 AI 视为一个强大但易出错的工人,并将其置于由规则、短记忆周期和独立检查构成的严密框架之中。通过接受 AI 会遗忘、会犯错以及有时会忽略指令的事实,工程师可以构建出足以应对现实世界的稳健系统。研究人员的工作提供了一份从实验性演示转向可靠、部署型产品的蓝图,确保当 AI 安全智能体声称发现了一个缺陷时,它确实发现了该缺陷,并且是在没有破坏预算或违反规则的前提下完成的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →