← 最新论文
⚡ electrical engineering

Learning Red Agent Policy from Observations for Neurosymbolic Autonomous Cyber Agents

本文提出了一种模仿学习技术,旨在使神经符号自主网络防御智能体能够从网络观测数据中预测不可观测的红队智能体策略与行为,从而增强其在部分可观测环境下应对复杂网络攻击的能力。

原作者: Ankita Samaddar, Sandeep Neema, Daniel Balasubramanian, Xenofon Koutsoukos

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ankita Samaddar, Sandeep Neema, Daniel Balasubramanian, Xenofon Koutsoukos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一场在迷雾缭绕的房间里进行的激烈国际象棋比赛。你是防御者(“蓝色特工”),试图保护你的城堡。你的对手是攻击者(“红色特工”),试图破门而入。

问题在于?你看不见你的对手。你只能看到他们行动的结果:一扇门突然开了,灯光闪烁了一下,或者一件家具被移动了。你知道你自己的动作,但你必须根据房间的变化来猜测你的隐形对手刚刚做了什么。

这篇论文描述了一种新的方法,让防御者能够“读取”数字网络中攻击者的思想,即使攻击者处于隐藏状态。

背景设定:数字城堡

研究人员使用了一个名为 CybORG 的模拟网络。把这个网络想象成一座城堡,分为三个区域:

  1. 前庭(用户子网): 普通人工作的地方。
  2. 办公室(企业子网): 重要服务器和数据存放的地方。
  3. 保险库(运营子网): 最关键、最敏感的机械设备所在地。

攻击者试图从前庭出发,穿过办公室,最后进入保险库造成破坏。防御者则试图阻止他们。

问题:“黑盒”迷雾

在这场游戏中,防御者是“部分可观测的”。这是一个高级说法,意思就是:“我看不见攻击者。”

  • 防御者看到了网络的状态(例如:“服务器 A 现在已被攻陷”)。
  • 防御者知道自己做了什么(例如:“我扫描了网络”)。
  • 但防御者不知道是什么导致了这种变化的攻击者行为。他们是进行了扫描?破解了密码?还是安装了病毒?

由于不知道攻击者的具体动作,很难预测他们的下一步,也很难理解他们已经渗透到了系统的多深程度。

解决方案:一个“福尔摩斯”AI

作者提出了一种使用类似于**模仿学习(Imitation Learning)的方法进行策略学习(Policy Learning)**的技术。

这里有一个类比:想象你在观察一位魔术师表演魔术。你看到魔术师的手在移动(防御者的动作),然后看到兔子出现了(网络状态的变化)。你并没有看到魔术师为了从帽子里变出兔子而做的那个秘密动作。

研究人员构建了一个像侦探一样的 AI:

  1. 观察并学习: 他们让 AI 观看成千上万场攻击者与防御者对弈的游戏。尽管在游戏过程中 AI 看不到攻击者的具体动作,但在训练期间,它拥有一个“小抄”(地面真值/ground truth)来查看实际发生了什么。
  2. 寻找模式: AI 学习到一种模式:“当防御者扫描网络且服务器看起来突然发生变化时,攻击者一定做了 X。”
  3. 预测未来: 一旦训练完成,AI 就可以在实时游戏中进行观察。它看到防御者的动作以及随之而来的变化,然后说:“我敢打赌攻击者刚才做了 X。”

它是如何运作的:三个步骤的侦探过程

研究人员将此分解为三个阶段,就像侦探破案一样:

  1. “发生了什么?”阶段(逆动力学/Inverse Dynamics): AI 观察网络的“之前”和“之后”以及防御者的动作。它尝试猜测导致这种变化的“隐形”动作(攻击者的动作)。它会产生一个粗略的、抽象的猜测(即“潜动作/latent action”)。
  2. “练习”阶段(策略学习/Policy Learning): AI 通过自我训练来提高猜测的准确性。它尝试模仿在第一步中推断出的隐形动作。这就像是一个学生通过观察老师的足迹来练习舞蹈。
  3. “翻译”阶段(映射/Mapping): AI 的猜测仍然很模糊。这一步将模糊的猜测转化为具体的、现实世界的攻击名称(例如:“利用远程服务”)和特定的目标(例如:“服务器 3”)。

“神经符号”大脑

论文提到了神经符号 AI(Neurosymbolic AI)行为树(Behavior Trees)

  • 神经符号意味着结合两种类型的思维方式:
    • 神经(Neural): 从数据中学习(就像人类通过经验学习)。
    • 符号(Symbolic): 遵循逻辑规则(就像计算机遵循严格的清单)。
  • 行为树就像流程图或决策树。想象一名拿着剪贴板的安全警卫。警卫检查:“门开了吗?是的。有入侵者吗?是的。那么,拉响警报。”
  • 研究人员将他们这种“读心术”AI 接入了这个流程图中。现在,警卫不仅仅是对门开着做出反应;警卫可以预测入侵者下一步可能会去保险库,并提前做好准备。

结果:效果如何?

研究人员在模拟的“CybORG”环境中,针对两类攻击者进行了测试:

  1. “直线型”攻击者(B-Line Attacker): 沿着直接、笔直的路径前往目标。(就像一个奔向保险库的窃贼)。
  2. “徘徊型”攻击者(Meander Attacker): 一个在各处游荡的攻击者,在移动之前会检查每个房间并尝试进入每台电脑。(就像一个在整个房子里四处窥探的窃贼)。

研究结果:

  • 直接型攻击者: AI 的预测准确率极高(超过 99%)。因为他们的路径是可预测的,这个“侦探”AI 可以轻易猜出下一步。
  • 徘徊型攻击者: AI 依然表现出色(对于大致区域的预测准确率约为 95%,尽管在精确到具体电脑方面稍逊一筹)。
  • 切换策略型攻击者: 他们甚至测试了一个在途中变换策略的攻击者。AI 能够适应并继续进行预测,尽管在策略改变时需要一点时间来跟上节奏。

为什么这很重要

其核心意义在于,这个系统允许防御者看见不可见之物。通过预测攻击者正在做什么,防御者可以:

  • 更早地检测到入侵。
  • 了解攻击者已经渗透到了多深(例如:“他们拥有用户权限,但尚未获得管理员权限”)。
  • 更有效地做出反应,因为他们不仅仅是在瞎猜,而是基于攻击者隐藏的“策略”做出有根据的预测。

简而言之,这篇论文展示了一种将迷雾重重的盲目防御游戏转变为清晰对决的方法,使防御者即使在看不见对手的情况下,也能预判对手的下一步行动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →