✨ 要点🔬 技术摘要
想象一场在数字战场上进行的高风险国际象棋对弈。一方是蓝队 :一个超智能的自动化安全系统(人工智能),旨在保护公司的计算机网络。另一方则需要一支红队 :一个旨在尝试入侵的黑客人工智能,其目的并非窃取数据,而是测试蓝队是否真的足够强大。
这篇论文的作者指出的问题是,测试这些安全系统的旧方法已经失效。传统的“黑客脚本”就像遵循严格、预写指令列表的机器人。它们无法随机应变。如果蓝队改变策略,机器人只会继续尝试同样的动作并失败。
论文提出了一种构建红队人工智能的新颖且更聪明的方法。他们称之为分层大语言模型 - 强化学习框架 。以下是其工作原理,使用简单的类比来说明:
问题:两个有缺陷的选手
研究人员尝试了两种不同类型的人工智能选手,但两者都惨败:
“言者”(仅大语言模型): 想象一位读过所有战争著作的杰出军事战略家。他们能制定出完美、复杂的作战计划。但是,他们从未真正握过剑或开过枪。当他们试图在真实、混乱的战场上执行计划时,会感到困惑,忘记步骤,并不断重复同样的错误。在论文的测试中,这些“言者”人工智能能想出好主意,却无法真正执行多步骤的长期攻击。
“行者”(仅强化学习): 想象一位极其擅长对眼前发生之事做出反应的士兵。他们通过试错来学习。但是,他们没有战略。他们不知道为什么 而战,也不知道最终目标是什么。在测试中,这个“行者”人工智能陷入了循环,只是反复戳刺敌人的墙壁,因为它不知道如何策划一场全面入侵。它放弃了大局观。
解决方案:将军与士兵
作者意识到,要获胜,你需要两者 ——战略家和士兵——在同一个团队中协同工作。他们构建了一个两部分系统:
将军(大语言模型规划器): 这就是“言者”。它着眼于大局。它制定战略:“我们需要潜入,找到后门,爬上梯子,然后接管服务器。”它不触碰控制装置;它只下达命令。它保持“冻结”状态(在游戏过程中不学习新事物),从而保持其对攻击运作方式的广泛知识。
士兵(强化学习控制器): 这就是“行者”。它听从将军的命令。它的工作是弄清楚在每一秒确切 应该按下哪个按钮,以使该命令得以实现。它通过试错来学习,随着游戏的进行,在执行将军计划方面变得越来越擅长。
关键要素:“反思”笔记本 为了让将军更聪明,他们增加了一个“反思”步骤。每场比赛结束后,将军会在笔记本上写一条简短的笔记:“我试图爬梯子,但被蓝队抓住了。下次,我会尝试不同的路线。”将军在下一场比赛开始前会阅读这条笔记。这有助于将军改进其策略,而无需从头开始重新学习一切。
结果:一支获胜的团队
他们在高度逼真的企业网络模拟(称为 CAGE 4)中测试了这个新的“将军 + 士兵”团队,对抗当时可用的最强自动化防御者。
仅靠**“言者”**,入侵成功率仅为约 30%(通常仅停留在第一步)。
仅靠**“行者”,入侵成功率为 0%**。它陷入循环,反复做着无用之事。
“将军 + 士兵”团队 的入侵成功率达到了94% 至 100% 。他们成功贯穿了整个“杀伤链”(从发现网络到接管控制权的完整路径)。
核心结论
论文得出结论,不能仅依赖一种类型的人工智能来测试安全性。
仅靠思考是不够的: 你需要有人能够真正执行 工作。
仅靠行动是不够的: 你需要有人知道做什么 。
通过将智能规划器(大语言模型)与快速学习者(强化学习)相结合,他们创建了一个稳健、适应性强且能够测试现代人工智能安全系统极限的红队。这有助于公司了解其防御措施是否真正准备好应对真实、聪明的黑客。
技术摘要:用于评估 AI 赋能 SOAR 系统鲁棒性的红队框架
问题陈述
随着企业越来越多地采用 AI 赋能的安全编排、自动化与响应(SOAR)系统以实现自主威胁检测与响应,这些系统针对自适应、战略性对手的韧性仍未得到充分探索。传统的渗透测试和基于规则的红队演练无法捕捉现实世界攻击活动中动态、多步骤的本质。尽管大型语言模型(LLM)和强化学习(RL)的最新进展为自主红队演练提供了潜力,但这两种范式在独立应用时均表现出根本性局限:
LLM: 难以处理长视野的状态跟踪、行动一致性及通过环境反馈进行的适应。它们通常无法在对抗自适应防御者时维持多阶段攻击活动。
RL: 存在样本效率低下、可解释性有限以及在异构网络环境中泛化能力差的问题。纯 RL 智能体在面对稀疏奖励和复杂状态空间时,往往收敛至退化策略(例如,重复侦察行动)。
在评估 AI 赋能的网络防御系统针对能够结合高层战略推理与自适应战术执行的智能体的鲁棒性方面,存在关键缺口。
方法论
作者提出了一种分层混合框架 ,将基于 LLM 的战略规划与基于 RL 的战术执行相结合,用于自主红队演练。该系统被建模为部分可观测马尔可夫决策过程(POMDP),并在CybORG CAGE Challenge 4 环境中运行,这是一个具备部分可观测性和协调 AI 防御者的高保真企业网络仿真环境。
架构
该框架将智能体解耦为两个不同的层级:
战略规划器(LLM): 一个冻结的 LLM 在粗略的时间分辨率下运行(例如,每 20 步)。它基于当前观测和可选记忆生成结构化的“意图”。这些意图编码了高层决策,如行动类型、MITRE ATT&CK 战术、目标选择和风险态势。LLM 参数在训练期间保持固定,以保留外部知识。
战术控制器(RL): 一个可训练的 RL 控制器(使用近端策略优化,PPO)在每个时间步执行行动。其策略以当前环境观测和 LLM 生成的意图为条件。这使得控制器能够在遵循高层战略指导的同时,学习基于环境 grounding 的策略。
关键机制
分层奖励塑形: 为解决稀疏和延迟奖励问题,作者引入了多组件奖励函数(r t = r e n v + r p r o g r e s s + r c o n s t r a i n t + r a l i g n m e n t r_t = r_{env} + r_{progress} + r_{constraint} + r_{alignment} r t = r e n v + r p r o g r ess + r co n s t r ain t + r a l i g nm e n t )。这包括对无效行动的惩罚,以及对推进杀伤链阶段(例如,发现、利用、权限提升、影响)的奖励,并与 MITRE ATT&CK 保持一致。
反思(记忆): 一种可选机制允许 LLM 规划器在每个回合结束时生成自然语言的自我反思。这些反思(总结成功、失败和防御者行为)存储在先进先出(FIFO)缓冲区中,并反馈给后续回合规划器的输入,从而在不更新参数的情况下实现战略适应。
状态表示: 观测值被转换为 LLM 的文本摘要和 RL 控制器的数值特征向量。LLM 的结构化意图被编码为与 RL 策略网络兼容的嵌入空间。
主要贡献
分层 LLM-RL 架构: 本文提出了一种新颖架构,将战略规划(LLM)与战术执行(RL)解耦,实现了高层意图生成与底层环境 grounding 控制之间的结构化交互。
与杀伤链对齐的 RL 框架: 作者引入了一种专门设计的奖励塑形机制,用于引导符合 MITRE ATT&CK 阶段的长视野对抗行为,从而在稀疏奖励环境中稳定学习。
全面的实证研究: 该工作评估了广泛的 LLM(0.6B 至 70B 参数),包括通用模型(Qwen3、Llama)、推理专家模型(DeepSeek-R1、QwQ)以及领域专用的网络安全模型(Foundation-Sec、DeepHat)。
严格的基准测试: 该框架针对 CAGE 4 设置中已发布的最强自主防御者(H-MARL Expert 策略)进行了评估,提供了在现实对抗条件下对红队能力的稳健测试。
结果
实验在 CAGE 4 环境中进行了 200 个回合。主要指标是回合妥协率(ECR) 。
混合框架性能: 所提出的 LLM+RL 智能体取得了近乎完美的成功。
Qwen3 + RL: 实现了100% ECR (200/200 个回合)。
Foundation-Sec + RL: 实现了94% ECR 。
这些智能体可靠地推进了多个攻击阶段,包括权限提升和影响。
独立 LLM 的局限性: 仅 LLM 智能体(零样本)表现出有限的端到端能力。
在 14 个模型中,仅有 6 个模型实现了初始立足点之外的任何妥协。
最强的独立模型(QwQ-32B)仅在**30%**的回合中成功。
领域专用模型(例如 Foundation-Sec-8B)生成了高行动量,但未能将其转化为有意义的攻击推进(6.5% ECR),表明仅凭领域知识不足以在没有一致执行的情况下发挥作用。
独立 RL 的局限性: 仅 RL 智能体崩溃为退化策略,在几乎所有时间步选择单一的侦察行动,实现了0% ECR 。在给定的奖励结构下,它未能发现多阶段攻击所需的结构化行动序列。
扩展观察: Qwen3 系列的性能呈非单调性;较小模型(0.6B、1.7B)取得了一定成功,而较大变体(4B+)尽管进行了有效探索,却未能尝试利用。
意义与主张
该论文主张,针对 AI 赋能 SOAR 系统的自主红队演练需要战略推理与学习执行的紧密耦合 。作者认为:
独立方法不足: 仅推理(LLM)或仅学习(RL)的系统都无法在对抗自适应防御者时执行完整的杀伤链行为。
混合集成产生乘数效应: 将 LLM 规划与 RL 执行相结合,在多阶段攻击成功率和鲁棒性方面带来了显著改进。
结构化规划比领域专业化更为关键: 在混合设置中,通用模型的表现始终优于更大规模的网络安全专用模型。这表明,在分层决策系统中,输出的可靠性和结构化可控性是 LLM 的关键要求,其重要性超过了特定领域微调带来的益处。
研究结论指出,该混合框架弥合了 LLM 的战略推理能力与 RL 的自适应战术执行之间的差距,为压力测试自主网络防御系统的鲁棒性提供了一种原则性方法。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。