想象一个这样的世界:计算机不再仅仅是执行命令,而是像初级侦探一样,在坏人闯入之前,主动搜寻庞大且混乱的办公大楼中的安全漏洞。这就是“自主网络防御”的梦想——AI智能体不断扫描组织的数字状态:检查谁拥有服务器室的钥匙、哪些软件已经过时,以及是否有人在暗中潜行。但问题在于:要信任一名侦探,你需要知道他们是在真正破案,还是仅仅在瞎猜。目前存在一个巨大的难题:真实的商业数据是机密的,因此研究人员无法在这些同样混乱且真实的场景中测试这些 AI 侦探。这就像试图通过只给飞行员看云朵的照片来教他们驾驶飞机,却从未让他们在真正的风暴中触碰操纵杆。如果没有一个共享且公平的测试场,我们就无法得知这些 AI 智能体是准备好拯救我们,还是仅仅在信口开河。
本文介绍了一种名为“开放安全基准(Open Security Benchmark, OSB)”的解决方案,它本质上是一个巨大的、冻结的、虚构的“数字城市”,专门用于测试这些 AI 侦探。你可以把它想象成一个庞大且不可更改的视频游戏关卡,它看起来、感觉起来都完全像一家真实的股份有限公司,配备了虚假的员工、虚假的云端服务器和虚假的密码。作者创建这个“城市”是为了弥合理论与现实之间的差距。他们构建了一个框架,让 AI 智能体去解决一个谜题——例如:“找出所有在上个月被解雇但仍拥有公司机密文件访问权限的员工”——而智能体必须通过两种不同的方法来寻找答案:要么通过编写一种特殊语言(SQL)来搜索庞大的数据库,要么模拟人类操作员点击使用 AWS 或 Google Workspace 等真实的厂商工具。
这篇论文不仅仅是在说“看,我们做了一个游戏”。它提出了一个严谨的框架来测试这些智能体,通过冻结环境,确保每次智能体运行时,“地面真相”(正确答案)都保持完全一致。这使得研究人员不仅能根据 AI 是否得到了正确答案来评分,还能根据它“如何”得到答案来评分。它是问对了问题吗?它是否连接了不同系统之间的线索?该研究通过合成的虚假组织实例化了这个框架,从而允许在不同规模的公司(从 75 人的小团队到 2,000 人的大型企业)进行测试。该框架旨在揭示 AI 智能体是否能够处理现实世界的复杂任务,例如将人力资源记录与跨不同厂商的云账户联系起来,这种能力对于单一厂商的工具来说是极其困难的。
至关重要的是,论文指出,我们不能仅仅因为一个 AI 智能体给出了听起来很有信心的答案就信任它。作者明确排除了仅在隔离环境下或在小型、干净的数据集上评估这些智能体的想法;他们坚持认为,环境必须是“冻结的”且“跨厂商的”,这样才是公平的。他们并不是在声称 AI 已经解决了网络防御问题。相反,他们认为这个基准测试是一个必要的工具,用以衡量进展,将“这个 AI 安全吗?”这一模糊的问题转化为一份具体的计分表。通过提供一个共享且可复现的目标,OSB 旨在推动该领域从“猜测”转向“测量”,确保当我们最终让 AI 智能体在真实的数字城市中掌舵时,我们确切地知道它们的表现会如何。
技术摘要:开放安全基准 (Open Security Benchmark, OSB)
问题陈述:环境数据鸿沟
本文指出,开发自主企业级网络防御的一个关键瓶颈在于:缺乏一个用于评估智能体 AI (Agentic AI) 的共享、可查询且可复现的环境。虽然企业正朝着能够感知、推理并根据安全状态采取行动的智能体方向发展,但该领域正面临“环境数据鸿沟”。真实的业务环境是私有的,跨越多个供应商,并且包含深度关联的数据,这些数据并未公开。因此,目前缺乏一个共同的底层架构,来对端到端的防御态势调查智能体进行评估。现有的基准测试仅针对狭窄的切片(例如,攻击性安全或特定的漏洞检测),或者缺乏安全态势管理 (SPM) 所需的跨供应商、全局性的视角。从业者无法在他们实际部署智能体时所需的任务上进行对比,而研究人员也缺乏一个稳定的目标来进行系统性评估。