← 最新论文
💻 computer science

Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense

本文介绍了开放安全基准(Open Security Benchmark, OSB),这是一个旨在评估并建立对用于企业网络防御的自主人工智能智能体信任的新型框架,它通过提供一个冻结的、整体性的且可查询的安全环境以及标准答案,来弥补公开、跨厂商评估数据的关键空白。

原作者: Gal Engelberg, Michael Arenzon, Leon Goldberg

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Gal Engelberg, Michael Arenzon, Leon Goldberg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机不再仅仅是执行命令,而是像初级侦探一样,在坏人闯入之前,主动搜寻庞大且混乱的办公大楼中的安全漏洞。这就是“自主网络防御”的梦想——AI智能体不断扫描组织的数字状态:检查谁拥有服务器室的钥匙、哪些软件已经过时,以及是否有人在暗中潜行。但问题在于:要信任一名侦探,你需要知道他们是在真正破案,还是仅仅在瞎猜。目前存在一个巨大的难题:真实的商业数据是机密的,因此研究人员无法在这些同样混乱且真实的场景中测试这些 AI 侦探。这就像试图通过只给飞行员看云朵的照片来教他们驾驶飞机,却从未让他们在真正的风暴中触碰操纵杆。如果没有一个共享且公平的测试场,我们就无法得知这些 AI 智能体是准备好拯救我们,还是仅仅在信口开河。

本文介绍了一种名为“开放安全基准(Open Security Benchmark, OSB)”的解决方案,它本质上是一个巨大的、冻结的、虚构的“数字城市”,专门用于测试这些 AI 侦探。你可以把它想象成一个庞大且不可更改的视频游戏关卡,它看起来、感觉起来都完全像一家真实的股份有限公司,配备了虚假的员工、虚假的云端服务器和虚假的密码。作者创建这个“城市”是为了弥合理论与现实之间的差距。他们构建了一个框架,让 AI 智能体去解决一个谜题——例如:“找出所有在上个月被解雇但仍拥有公司机密文件访问权限的员工”——而智能体必须通过两种不同的方法来寻找答案:要么通过编写一种特殊语言(SQL)来搜索庞大的数据库,要么模拟人类操作员点击使用 AWS 或 Google Workspace 等真实的厂商工具。

这篇论文不仅仅是在说“看,我们做了一个游戏”。它提出了一个严谨的框架来测试这些智能体,通过冻结环境,确保每次智能体运行时,“地面真相”(正确答案)都保持完全一致。这使得研究人员不仅能根据 AI 是否得到了正确答案来评分,还能根据它“如何”得到答案来评分。它是问对了问题吗?它是否连接了不同系统之间的线索?该研究通过合成的虚假组织实例化了这个框架,从而允许在不同规模的公司(从 75 人的小团队到 2,000 人的大型企业)进行测试。该框架旨在揭示 AI 智能体是否能够处理现实世界的复杂任务,例如将人力资源记录与跨不同厂商的云账户联系起来,这种能力对于单一厂商的工具来说是极其困难的。

至关重要的是,论文指出,我们不能仅仅因为一个 AI 智能体给出了听起来很有信心的答案就信任它。作者明确排除了仅在隔离环境下或在小型、干净的数据集上评估这些智能体的想法;他们坚持认为,环境必须是“冻结的”且“跨厂商的”,这样才是公平的。他们并不是在声称 AI 已经解决了网络防御问题。相反,他们认为这个基准测试是一个必要的工具,用以衡量进展,将“这个 AI 安全吗?”这一模糊的问题转化为一份具体的计分表。通过提供一个共享且可复现的目标,OSB 旨在推动该领域从“猜测”转向“测量”,确保当我们最终让 AI 智能体在真实的数字城市中掌舵时,我们确切地知道它们的表现会如何。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →