← 最新论文
🤖 AI

BehaviorGuard: Online Backdoor Defense for Deep Reinforcement Learning

BehaviorGuard 是首个面向深度强化学习的在线、触发器无关的防御框架,它通过识别并抑制动作分布中的异常偏移,在单智能体和多智能体场景中检测并缓解后门攻击,相较于现有方法具有更优的效能与效率。

原作者: Yinbo Yu, Xueyu Yin, Jiadai Wang, Chunwei Tian, Sai Xu, Qi Zhu, Daoqiang Zhang

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yinbo Yu, Xueyu Yin, Jiadai Wang, Chunwei Tian, Sai Xu, Qi Zhu, Daoqiang Zhang

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位技术高超的机器人飞行员,驾驶无人机穿越一座复杂的城市。你训练它安全地运送包裹。但秘密的是,一名黑客在机器人的大脑中植入了一个“特洛伊木马”。在正常条件下,机器人飞行完美无缺。然而,一旦黑客发送一个特定的、隐蔽的信号(例如特定模式的光线或一系列转向动作),机器人就会突然撞向建筑物或掉落包裹。

这就是深度强化学习(DRL)中的后门攻击。机器人看起来无辜,直到触发器被激活。

你分享的论文《BehaviorGuard》提出了一种新方法,可以在无需知晓秘密触发器具体样貌的情况下,揪出这些狡猾的机器人。以下是其工作原理的通俗解释:

旧防御手段的缺陷

以往的安全守卫试图通过以下方式揪出这些黑客:

  1. 寻找“触发器”: 试图猜测秘密信号长什么样(例如,“角落是否有一个红色像素?”)。如果黑客改变了信号,守卫就会失效。
  2. 监控得分: 检查机器人坠毁时是否获得了异常低的分数(奖励)。但有时,黑客会让机器人以看似“良好”得分的方式坠毁,从而愚弄守卫。
  3. 重新训练: 如果发现机器人有问题,他们试图从头开始重新训练它。这需要耗费巨大的时间和金钱,就像仅仅为了纠正一个错误就解雇飞行员并雇佣新飞行员一样。

新理念:观察“性格”,而非“秘密代码”

BehaviorGuard 的作者意识到一个巧妙的点:即使黑客改变了秘密触发器,机器人的大脑也必须被“布线”成不同的方式,以确保在触发器出现时它能服从指令。

这就像一名双重间谍

  • 普通间谍表现自然。
  • 双重间谍必须在脑海中保留一份秘密计划。即使他们未被激活,他们的大脑也会因那个秘密计划而略微“紧张”或“偏向”。为了保持秘密随时可用,他们可能在日常行动中犯下微小到几乎不可见的错误。

在机器人的情况下,这种“紧张”表现为行为漂移。即使没有触发器存在,被植入后门的机器人的选择也会略微偏离正常机器人应有的行为。这就像一个秘密计划逃跑的人;即使他只是坐在椅子上,他的脚也会朝特定方向神经质地 tapping(轻敲)。

BehaviorGuard 如何运作

BehaviorGuard 就像一个行为保镖,实时监视机器人。

  1. 漂移分数(“神经质轻敲”探测器):
    系统为机器人采取的每一个动作计算一个“漂移分数”。它将机器人当前的动作与该情境下“干净”(诚实)机器人通常会采取的动作进行比较。

    • 如果机器人表现正常,分数较低。
    • 如果机器人表现“紧张”(受后门影响),分数会飙升。
    • 关键在于,即使黑客使用复杂且不断变化的触发器,或者机器人在与其他机器人协作(多智能体)玩游戏,该方法依然有效。
  2. 缓解措施(“温和的推搡”):
    如果保镖发现机器人长时间处于“紧张”状态(漂移分数过高),它不会直接关闭机器人。相反,它会温和地将机器人推回安全路径。

    • 想象机器人正要向左转(这是坏动作)。保镖会说:“嘿,为了安全起见,我们试着向右转吧”,并以一定的概率执行此操作。
    • 这发生在在线过程中(即机器人飞行时),且无需重新训练。这就像副驾驶在瞬间接管控制权以防止坠毁,随后又将控制权交还。

为何这意义重大

  • 无需知晓秘密: 无论黑客使用的是红色像素、声音,还是特定的动作序列,只要机器人的行为“不对劲”,BehaviorGuard 就能将其揪出。
  • 适用于团队: 无论机器人是单独飞行,还是在机器人团队中工作(如足球队或无人机群),该方法都有效。
  • 快速且经济: 它不需要重新训练机器人,从而节省了海量的时间和计算资源。
  • 坚固可靠: 论文测试了该方法对抗那些试图通过让机器人得分看起来正常或使用复杂、序列化的触发器来隐藏行踪的黑客。BehaviorGuard 依然成功揪出了他们。

核心结论

BehaviorGuard 就像一个不寻找特定钥匙来开门的安全系统。相反,它观察人的步态。如果某人走路的跛行暗示其有所隐瞒,系统就会将其拦下,即使你完全不知道他们隐瞒了什么,也不知道他们使用了什么钥匙。它能在无需彻底 overhaul(全面改造)的情况下,确保机器人安全、快速且功能正常。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →