AgentCyberRange: Benchmarking Frontier AI Systems in Realistic Cyber Ranges
该论文介绍了 AgentCyberRange,这是一个开放的多主机基础设施,旨在基准测试前沿人工智能系统在现实的网络漏洞利用及后渗透场景中的自主攻击能力,并揭示了尽管当前模型表现出的成功率有限,但它们仍能在现实条件下发现未知漏洞并绕过防御措施。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:在“数字道场”中测试 AI
想象一下,你想知道一个全新的、超级聪明的机器人是否具有危险性。你不能直接问它:“你危险吗?”因为它可能会撒谎。你也无法只给它做一道数学题,因为擅长数学并不意味着它具备破门入室的能力。
为了真正了解这个机器人是否会制造麻烦,你需要把它放入一个模拟社区(即“网络靶场”)中,让它像真正的窃贼一样尝试闯入。
这篇论文介绍了 AGENTCYBERRANGE,它正是一个这样的“数字道场”:一个巨大的开源平台,旨在测试世界上最聪明的 AI 系统执行现实网络攻击的能力。
问题所在:“电子游戏” vs. “现实世界”
在本文发表之前,测试 AI 的安全性就像是在玩一款只能一次解决一个谜题的电子游戏。
- 旧有的测试: “这里有一扇锁着的门。请撬开它。”(这被称为“漏洞复现”)。
- 现实情况: 一个真正的黑客不会只撬开一扇门。他们首先必须绕着社区走动,寻找后门,潜入室内,找到走廊里的万能钥匙,然后解锁房子里的每一间房。
作者认为,之前的测试过于简单。它们没有测试 AI 将“寻找门路”到“接管整栋房子”这一系列动作串联起来的能力。
解决方案:两阶段劫案
AGENTCYBERRANGE 基准测试为 AI 设置了两个主要挑战,模拟了一场真实的劫案:
- Web 漏洞利用(前门): AI 必须观察一个真实的网站(例如银行或博客网站),并找到隐藏的后门或脆弱的窗口。它必须在没有人告知的情况下,自行摸索出“该去哪里寻找”。
- 后渗透攻击(内部行动): 一旦 AI 通过那扇门进入内部,它就必须留在那里。它需要通过不断升级权限来获取“Root”(最高管理权限/老板钥匙),避开安全警卫(杀毒软件),并在不同计算机之间移动,直到控制整个网络。
为了确保测试公平且可重复,他们构建了一个名为 CAGE 的工具。你可以把 CAGE 想象成裁判兼舞台经理。它负责搭建这些“假房子”,让 AI 机器人运行,观察它们的行为,并自动检查它们是真的成功了,还是仅仅运气好。
实验:谁是最强窃贼?
研究人员在数字道场中测试了全球六个最先进的 AI 系统(包括 GPT、Claude 等版本)。他们给了这些 AI 一个“步数预算”(类似于时间限制)来尝试闯入。
结果显示:
- 获胜者: AI 系统 GPT-5.5(配合名为 Codex 的编程工具)表现最佳。
- 得分: 即便是最强的 AI,在“前门”挑战中的成功率也仅为 16% 左右,而在“内部行动”挑战中的成功率约为 32%。
- 核心启示: 这些 AI 正在变得越来越可怕。它们不仅仅是在解谜,它们实际上正在攻破真实的软件并在网络中穿梭。但它们离成为完美的、可靠的黑客还很远。它们经常迷路、错过隐藏的门,或者被安全警报抓个正着。
“惊喜”发现
论文发现了两个并非原定测试计划内的有趣现象:
- 发现了新秘密: 在尝试攻破测试网站的过程中,AI 意外发现了流行软件中全新的、未知的漏洞(零日漏洞),甚至连人类开发者都还不知道这些漏洞的存在。
- 具备适应能力: 当测试环境试图阻止它们时(例如通过杀毒程序),AI 有时会改变其“工具”或“手段”来绕过防御,展示了它们能够随机应变的能力。
结论:我们需要一面新镜子
作者总结道,我们不能再仅仅用简单的谜题来测试 AI 了。因为这些系统已经开始展现出将复杂攻击链条化(寻找入口、破门而入、接管系统)的能力,所以我们需要像 AGENTCYBERRANGE 这样真实的、端到端的测试环境。
我们需要在安全的、受控的“道场”中,看清它们是如何失败以及如何成功的,以便在它们投入现实世界使用之前,理解其中的风险。论文强调,虽然这些 AI 功能强大,但它们尚未成为“可靠”的攻击者,但它们的发展潜力增长极快,因此我们需要密切关注。
简而言之: 这篇论文构建了一个真实的模拟环境,用来测试超强 AI 是否能像人类一样进行黑客攻击。研究发现,最聪明的 AI 已经可以攻破真实系统并发现新的漏洞,但它们仍然会犯很多错误。我们需要这类测试来守护我们的数字世界安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。