技术摘要:Trident —— 如何破解深度强化学习
问题陈述
基于深度强化学习(DRL)的自主网络防御系统正越来越多地被部署用于监控网络并实时恢复受损主机。然而,其针对自适应威胁的鲁棒性仍处于研究严重不足的状态。目前的评估几乎完全依赖于具有固定行为特征的静态、启发式“红队智能体(red agents)”。因此,DRL 防御者开发的策略在隐性程度上受限于这些静态模式,从而产生了传统评估方法无法发现的系统性盲点。
与此同时,虽然具有可验证奖励的强化学习(RLVR)已在数学和软件工程等领域的逻辑推理(LLM reasoning)方面取得了进展,但由于缺乏合适的基准环境,其在网络安全领域的集成受到了阻碍。现有的网络安全数据集通常仅提供静态语料库或孤立的夺旗赛(CTF)挑战,缺乏训练对抗自适应防御者的智能体所需的持续、多步交互能力。目前存在一个关键的基础设施缺口,无法为通过 RLVR 训练基于 LLM 的红队智能体提供稳定的、可重复的对抗环境以及可验证的奖励信号。
为了解决这些差距,作者引入了 Trident,这是一个动态红队框架,由基准基础设施、数据集和智能体架构组成。
1. Trident 基准与数据集
Trident 在两个高保真模拟器上运行:CybORG CAGE 4(模拟具有协作多智能体防御者的分段军事网络)和 CyberWheel(将攻击行为锚定在真实的 MITRE ATT&CK 技术中)。
- 基础设施: 该框架利用采用客户端-服务器架构的隔离容器化沙盒服务器。生成的攻击策略被传输到这些沙盒中,在这些环境中针对实时的 DRL 防御者进行原生执行,并返回确定性的、可验证的执行日志。
- 数据集: 作者构建了一个包含超过 13,000 条高保真红蓝对抗轨迹的数据集。这些轨迹被序列化为结构化的自然语言日志,捕捉了部分观测结果、差异化主机情报以及动作结果,为 RLVR 后训练奠定了基础。
2. Trident 智能体架构
Trident Agentic 将红队智能体训练问题从去中心化部分可观测马尔可夫决策过程(Dec-POMDP)重新表述为使用“代码即策略(Code-as-Policies)”范式的**上下文多臂老虎机(Contextual Bandit)**问题。该架构由三个专门模块组成:
- 日志摘要器(Log Summarizer): 一个结合了基于规则的解析和冻结 LLM 的混合模块,用于压缩原始执行日志。它保留了关键的“里程碑”事件(例如成功的漏洞利用、权限提升),同时对失败的尝试进行采样,从而为规划器合成密集的语义摘要。
- 规划器 (πθ): 唯一的训练组件(一个 7B 参数的 LLM)。它接收压缩后的摘要作为上下文,并在单次前向传播中生成高层攻击策略,输出结构化的 JSON 负载。它通过**群体相对策略优化(GRPO)**进行优化,利用源自沙盒执行的可验证奖励。
- 编码器(Coder): 一个冻结的 LLM,负责将规划器的 JSON 策略转化为可执行的 Python 代码。它采用了基于抽象语法树(AST)的补丁机制和迭代自我修复循环(最多 K=3 次尝试)来纠正语法错误,从而确保规划器不会因为偶然的实现噪声而受到惩罚。
3. 奖励设计
系统使用直接源自执行日志的密集、可验证奖励函数:
- 正面里程碑 (R+): 对杀伤链进度(如系统影响、权限提升)进行加权奖励,并辅以基于“成就-步骤比”的效率系数。
- 负面事件 (R−): 对失败的漏洞利用、无效动作和操作噪音进行惩罚。
- 执行惩罚: 对语法错误、运行时失败或尝试访问不可观测模拟器内部(如诱饵标志)的行为实施严格惩罚,确保智能体依赖于行为推理而非特权状态访问。
核心贡献
- Trident 评估基准与数据集: 首个跨环境的红队评估基准,涵盖 CAGE 4 和 CyberWheel,通过隔离的沙盒执行为针对实时 DRL 防御者的可验证奖励提供支持。它包含一个专门设计用于支持 RLVR 训练的 13,000 多条轨迹数据集。
- Trident Agentic: 一个三部分的 LLM 智能体架构,利用“代码即策略”来实现可执行攻击策略的直接生成。通过将策略生成视为上下文多臂老虎机问题,它绕过了逐步进行 POMDP 规划的计算复杂性。
- DRL 脆弱性的经验证据: 该框架证明,当前的自主防御者在面对自适应攻击者时,其表现比以往静态评估所显示的要脆弱得多。
实验结果
作者在 CAGE 4 和 CyberWheel 中,针对最先进的 DRL 蓝队智能体(包括 GNN、HMARL 和 MARL 变体)对 Trident Agentic 进行了评估。
- 性能下降: 与默认的启发式基准相比,Trident Agentic 使蓝队智能体的防御性能平均降低了 522%。
- 与基准对比:
- 静态启发式: 传统的红队智能体未能发现学习策略中的弱点。
- 零样本/思维链(CoT): 虽然零样本提示和思维链方法较静态基准有所改进,但仍远逊于经过 RLVR 训练的 Trident Agentic。
- 前沿模型: 通过 RLVR 训练的 7B 参数模型(Trident Agentic)超越了以零样本能力使用的前沿规模模型(如 GPT-4o),这突显了任务特定 RLVR 训练相对于单纯模型规模的有效性。
- 涌现行为: 训练后的智能体自主发现了静态启发式方法无法表示的新型攻击向量,包括:
- 诱饵规避: 在 CyberWheel 中,智能体学会了在观察到多次失败的主机时中止攻击,从而有效地识别并避开蜜罐。
- 自适应状态优先级排序: 在 CAGE 4 中,智能体学会了优先考虑高价值目标(如 Root/User 权限)而非基础侦察,根据网络状态动态调整重心。
重要性与主张
本文指出 Trident 揭示了自主网络防御领域的一个根本性评估差距:目前的实践严重低估了 DRL 防御者在面对自适应、生成式攻击者时的脆弱性。通过证明一个紧凑的、开源权重的 7B 模型可以系统性地瓦解最先进的防御系统,作者认为该领域必须超越静态的对手评估。
Trident 不仅仅被视为一种进攻工具,更是实现网络攻防“协同进化”的必要基础设施。其模拟器无关、RESTful 的沙盒设计允许集成更高保真的环境,从而能够训练出能够抵御生成式、自适应威胁的强健蓝队智能体。作者强调,公开这些能力对于推动开发同样具备自适应能力的、由 RL 驱动的防御系统至关重要,以免此类攻击策略被对手独立部署。