← 最新论文
🤖 AI

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

该论文介绍了 Trident,一个利用“代码即策略”(Code-as-Policy)RLVR 架构来生成自适应攻击策略的智能体 LLM 红队测试框架,并揭示了现有的深度强化学习网络安全防御在面对动态威胁时,其表现远逊于静态启发式基准,且本质上是脆弱的。

原作者: Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一场高风险的数字象棋比赛,但对抗的不再是棋盘上的棋子,而是两支队伍在争夺一个庞大且无形的计算机网络。其中一支队伍是“蓝队”,他们构建了一个人工智能防御者,能够实时识别入侵者并修复损坏的计算机。另一支队伍是“红队”,试图破门而入。多年来,科学家们一直在测试这些蓝队防御者,而对抗的红队就像是遵循严格、不变脚本的机器人。它们一遍又一遍地重复同样的招式,就像发条玩具一样。问题在于,真正的黑客并不是发条玩具;他们聪明、具有适应性,并且会在看到防御手段时立即改变策略。与此同时,一种被称为“大语言模型”(LLM)的新型超智能AI,在解决谜题和编写代码方面已经变得极其出色。科学家们正在问一个大问题:如果我们教这些超智能AI成为红队,它们是否最终能以一种旧有的、静态的机器人永远无法做到的方式,智取蓝队的防御?

这正是名为 Trident 的项目背后的研究人员想要探寻的真相。他们建立了一个全新的、动态的测试场,让智能AI攻击者可以通过实践来学习,而不是仅仅遵循预先写好的脚本。他们创建了一个包含超过13,000场模拟战斗的大型库,用于训练其AI攻击者与防御者。他们并没有让AI一次只选择一个动作,而是教会了它将自己的“攻击策略”编写成一段计算机代码,然后运行这段代码来对抗防御者。

结果令人震惊。经过训练的Trident AI,仅使用了一个参数量为70亿的模型(在现代AI中属于相对较小的规模),它不仅击败了防御者,还导致防御者的效能大幅下降。虽然旧有的、静态的攻击者几乎没能造成什么影响,但Trident使蓝队的防御性能相比基准线平均下降了 522%。这表明,当今许多“智能”的网络防御实际上比我们想象的要脆弱得多,因为它们此前仅针对愚笨、可预测的敌人进行过测试。Trident不仅仅是在遵循规则;它学会了自主发现聪明的各种新招数,比如意识到防御者正试图用假目标(“诱饵”)来欺骗它并学会忽略它,或者弄清楚哪些计算机最值得优先攻破。该论文指出,为了构建真正安全的系统,我们需要停止用静态机器人来测试它们,转而开始使用像Trident这样具有适应性和学习能力的AI来进行测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →