← 最新论文
💻 computer science

A Red Teaming Framework for Evaluating Robustness of AI-enabled Security Orchestration, Automation, and Response Systems

本文介绍了一种自主红队框架,该框架将大语言模型与强化学习相结合,以有效生成针对人工智能赋能的安全编排、自动化与响应系统的自适应多阶段攻击行动,证明这种混合方法在评估网络防御韧性方面优于独立的大语言模型或领域专用模型。

原作者: Ayan Javeed Shaikh, Nathaniel D. Bastian, Ankit Shah

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ayan Javeed Shaikh, Nathaniel D. Bastian, Ankit Shah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一场在数字战场上进行的高风险国际象棋对弈。一方是蓝队:一个超智能的自动化安全系统(人工智能),旨在保护公司的计算机网络。另一方则需要一支红队:一个旨在尝试入侵的黑客人工智能,其目的并非窃取数据,而是测试蓝队是否真的足够强大。

这篇论文的作者指出的问题是,测试这些安全系统的旧方法已经失效。传统的“黑客脚本”就像遵循严格、预写指令列表的机器人。它们无法随机应变。如果蓝队改变策略,机器人只会继续尝试同样的动作并失败。

论文提出了一种构建红队人工智能的新颖且更聪明的方法。他们称之为分层大语言模型 - 强化学习框架。以下是其工作原理,使用简单的类比来说明:

问题:两个有缺陷的选手

研究人员尝试了两种不同类型的人工智能选手,但两者都惨败:

  1. “言者”(仅大语言模型): 想象一位读过所有战争著作的杰出军事战略家。他们能制定出完美、复杂的作战计划。但是,他们从未真正握过剑或开过枪。当他们试图在真实、混乱的战场上执行计划时,会感到困惑,忘记步骤,并不断重复同样的错误。在论文的测试中,这些“言者”人工智能能想出好主意,却无法真正执行多步骤的长期攻击。
  2. “行者”(仅强化学习): 想象一位极其擅长对眼前发生之事做出反应的士兵。他们通过试错来学习。但是,他们没有战略。他们不知道为什么而战,也不知道最终目标是什么。在测试中,这个“行者”人工智能陷入了循环,只是反复戳刺敌人的墙壁,因为它不知道如何策划一场全面入侵。它放弃了大局观。

解决方案:将军与士兵

作者意识到,要获胜,你需要两者——战略家和士兵——在同一个团队中协同工作。他们构建了一个两部分系统:

  • 将军(大语言模型规划器): 这就是“言者”。它着眼于大局。它制定战略:“我们需要潜入,找到后门,爬上梯子,然后接管服务器。”它不触碰控制装置;它只下达命令。它保持“冻结”状态(在游戏过程中不学习新事物),从而保持其对攻击运作方式的广泛知识。
  • 士兵(强化学习控制器): 这就是“行者”。它听从将军的命令。它的工作是弄清楚在每一秒确切应该按下哪个按钮,以使该命令得以实现。它通过试错来学习,随着游戏的进行,在执行将军计划方面变得越来越擅长。

关键要素:“反思”笔记本
为了让将军更聪明,他们增加了一个“反思”步骤。每场比赛结束后,将军会在笔记本上写一条简短的笔记:“我试图爬梯子,但被蓝队抓住了。下次,我会尝试不同的路线。”将军在下一场比赛开始前会阅读这条笔记。这有助于将军改进其策略,而无需从头开始重新学习一切。

结果:一支获胜的团队

他们在高度逼真的企业网络模拟(称为 CAGE 4)中测试了这个新的“将军 + 士兵”团队,对抗当时可用的最强自动化防御者。

  • 仅靠**“言者”**,入侵成功率仅为约 30%(通常仅停留在第一步)。
  • 仅靠**“行者”,入侵成功率为0%**。它陷入循环,反复做着无用之事。
  • “将军 + 士兵”团队的入侵成功率达到了94% 至 100%。他们成功贯穿了整个“杀伤链”(从发现网络到接管控制权的完整路径)。

核心结论

论文得出结论,不能仅依赖一种类型的人工智能来测试安全性。

  • 仅靠思考是不够的: 你需要有人能够真正执行工作。
  • 仅靠行动是不够的: 你需要有人知道做什么

通过将智能规划器(大语言模型)与快速学习者(强化学习)相结合,他们创建了一个稳健、适应性强且能够测试现代人工智能安全系统极限的红队。这有助于公司了解其防御措施是否真正准备好应对真实、聪明的黑客。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →