Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing
本文认为,未来对自主渗透测试智能体的评估必须建立受控的、模型匹配的普通智能体基准,以准确区分性能提升究竟是源于架构创新,还是归因于底层模型的改进。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一座巨大且不断变化的数字建筑城市。其中一些建筑隐藏着陷阱和损坏的锁——这些是坏人可以利用来潜入的安全漏洞。几十年来,寻找这些漏洞的工作一直属于人类专家,就像数字锁匠一样,他们穿梭于每一个房间,测试门窗。但这座城市增长得太快了;每秒钟都有新的建筑拔地而起,锁匠们已经跟不上节奏了。于是,科学家们开始利用人工智能构建“机器人锁匠”。这些机器人由大语言模型(LLMs)驱动,这些模型就像超级聪明的头脑,它们读过了几乎互联网上的所有内容,并且能够编写代码、进行推理并遵循指令。
这个领域的核心问题不仅是“机器人能否找到锁?”,而是“机器人的成功有多少来自于它的头脑,又有多少来自于我们给它的高级工具?”想象一下你有一个天才学生。如果你只给他一个简单的笔记本和一支笔,他可能会解出一道数学题。但如果你给他一台高科技计算器、一个导师团队和一张特殊的地图,他可能会解题更快。那么,是计算器让他变得更聪明了,还是它仅仅提供了帮助?在AI安全领域,研究人员一直在构建复杂的“吊架(harnesses)”——即由AI智能体、特殊记忆系统和搜索工具组成的团队,来帮助AI攻击网站。但由于他们总是同时改变AI大脑和工具,导致没人知道到底是那些华丽的工具在承担重任,还是AI本身正在变得更好。
这篇题为《架构之前的基准线》(Baselines Before Architecture)的论文,通过一项非常严谨的实验介入其中,试图平息这场争论。研究人员设置了一个受控测试,使用了一套由104个数字挑战组成的标准集——XBOW基准测试。他们没有构建一个新的、华丽的机器人,而是采用了三个现有的、“朴素的”编程助手——分别命名为Codex、OpenCode和Pi——并要求它们使用一个单一且强大的AI大脑(GPT-5)以及没有任何特殊安全工具来解决这些挑战。他们想看看一个“赤裸”的AI在不添加任何额外装置前能表现如何。
结果既充满了惊喜,也揭示了现实的真相。首先,朴素的编程智能体表现得异常强大。“Codex”智能体在运行GPT-5模型时,在第一次尝试中就解决了大约67%的挑战。当研究人员让它再次尝试(运行两次相同的测试并将结果合并)时,它解决了77.9%的挑战。这是一个重大发现,因为这意味着一个简单的、通用的编程机器人已经可以处理大部分工作,而不需要复杂的安全团队。
该研究还测试了两个许多人认为必不可少的特定想法。一个是“安全提示词(security prompting)”,即你给AI一份特殊的指令单,告诉它要像黑客一样思考。另一个是认为复杂的、多智能体架构(即不同的AI角色相互交流)对于顶尖性能是必要的。研究发现,特殊的“黑客指令”实际上让AI的表现变差了,不仅解决的挑战更少,而且成本更高。至于复杂的架构,论文将朴素的Codex结果与两个著名的、高科技的系统(MAPTA和PentestGPT V2)进行了对比。
其中的细微差别在于:那些华丽的系统确实仍具有微弱的优势。在匹配相同的AI大脑时,专门的MAPTA系统比朴素的Codex多解决了约9.6个百分点的挑战。然而,论文显示这种差距并没有看起来那么大。当研究人员将朴素的Codex智能体升级到更先进、更聪明的头脑(GPT-5.5)时,它在第一次尝试中就解决了92.3%的挑战,在合并两次运行的结果后达到了95.2%。这个新的朴素智能体甚至在没有使用任何华丽工具的情况下,就击败了那些旧有复杂系统的头条得分。
其主要结论是对科学界的一个警告:不要仅仅因为一个复杂的架构获得了高分,就假设它是英雄。通常情况下,高分来自于AI模型的进化,而不是工具变得更华丽。论文建议,在声称一个新的“安全吊架”是一项突破之前,研究人员必须首先展示它比使用完全相同AI大脑的简单、朴素编程智能体好多少。虽然专门的工具在节省金钱和时间方面仍有帮助,但“朴素”的AI已经在承担大部分重任,因此,仅仅等待下一代AI模型的到来,可能与构建一个更复杂的机器人一样有效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。