想象一支机器人团队协同解决复杂谜题,就像一支足球队试图赢得比赛,或是一群无人机协调执行救援任务。在人工智能领域,这被称为多智能体系统(MAS)。这些团队正变得越来越智能和普遍,但这也意味着它们正成为“黑客”的目标,后者试图探究它们有多容易被欺骗。
本文介绍了一种名为AdapAM的新型“黑客”工具。可以将其视为一位技艺高超、隐形的破坏者,旨在测试这些机器人团队的安全程度究竟如何。
以下是 AdapAM 的工作原理,分解为简单概念:
问题:“全有或全无”的困境
现有测试这些机器人团队的方法存在两大缺陷:
- 需要“白盒”视角:大多数方法要求黑客能够看到机器人的内部“大脑”(代码和权重),才能知道如何攻破它。在现实世界中,攻击者通常只能看到机器人所看到的内容(即“黑盒”),这使得这些方法变得毫无用处。
- 过于显眼:某些方法试图同时干扰团队中的每一个机器人。这就像试图通过绊倒每一名球员来阻止一场足球比赛。虽然有效,但过于明显、容易被发现,且不切实际。
解决方案:AdapAM(“狙击手”策略)
AdapAM 旨在严格的黑盒设定下工作(即攻击者无法看到代码),并力求隐蔽(难以被检测)。它通过两个主要技巧实现这一目标:
1. 自适应选择策略(“智能狙击手”)
AdapAM 不像绊倒所有人那样行事,而是像一名狙击手。
- 工作原理:在每一时刻,它观察比赛局势并问道:“此刻谁是最重要的球员?如果我只干扰一个人,谁会导致整个团队失败?”
- 类比:想象一支足球队。如果你绊倒了守门员,球队可能会输掉比赛;如果你绊倒了替补席上的随机一名球员,则不会发生任何事。AdapAM 学会识别当下的“守门员”,并仅针对其进行攻击。
- 目标:它还会决定该特定机器人应被诱骗去做什么(例如,“向左跑而不是向右”)。这样能在接触尽可能少的智能体的同时,最大化破坏效果。
2. 基于代理的扰动(“双重间谍”)
这是棘手之处:如果你无法看到机器人的“大脑”(黑盒),如何欺骗它?
- 问题:要制造一个完美的欺骗(即“扰动”),通常需要知道机器人的内部数学逻辑。
- 解决方案:AdapAM 创建一个代理智能体。可以将其视为一名“双重间谍”或“训练假人”。
- 首先,系统训练这个双重间谍,使其行为与真实机器人团队完全一致。它学会完美模仿它们的动作。
- 由于双重间谍处于攻击者的控制之下,攻击者可以看到其“大脑”(白盒)。
- 攻击者利用双重间谍来精确计算出,对机器人视觉施加何种微小、几乎不可见的改变,才能使其犯错。
- 一旦在双重间谍身上设计好该欺骗手段,便将其应用于真实机器人。由于双重间谍对真实机器人的模仿如此逼真,该欺骗手段在真实机器人身上同样有效。
结果:安静且高效
作者在八个不同场景中测试了 AdapAM,从虚拟足球比赛(Google Football)到战略对战(星际争霸)以及导航任务。他们将其与另外四种顶尖方法进行了比较。
- 有效性:AdapAM 在导致机器人团队失败方面表现最佳。即使机器人团队经过专门训练以抵御攻击,AdapAM 仍能成功将其瓦解。
- 隐蔽性:这是 AdapAM 真正闪耀之处。
- 最小扰动:它使用的“欺骗”手段是尽可能微小的改变。这就像向球员耳语秘密,而不是大声喊叫。
- 最难检测:由于它仅干扰单个智能体并使用微小改变,试图发现攻击的安全系统最难找到它。事实上,它比那些试图干扰所有人的方法更难被检测。
总结
简而言之,AdapAM 是一种测试机器人团队安全性的新方法。它不采用对所有人进行蛮力攻击的方式,而是利用智能策略挑选出最脆弱的单一目标,并借助模仿者来找出欺骗该目标的完美且隐形的方法。这使得攻击既高效又极难被察觉。
论文结论指出,该方法是一种强大的工具,有助于理解多智能体系统的弱点,从而为未来构建更完善的防御体系奠定基础。
以下是论文《基于自适应扰动的黑盒多智能体对抗攻击》(AdapAM)的详细技术总结。
1. 问题陈述
本文探讨了在严格黑盒设置下运行的**多智能体系统(MAS)**所面临的关键安全与可靠性挑战。
- 背景:多智能体系统正越来越多地应用于无人机、工业机器人和自动驾驶领域。然而,它们容易受到对抗性攻击,即通过扰动输入来误导决策。
- 现有工作的局限性:
- 白盒假设:许多现有方法需要访问内部模型参数或网络输出,这在现实部署中是不切实际的。
- 高控制权限:某些方法假设攻击者可以直接控制智能体动作,但这在现实中极少可能实现。
- 缺乏隐蔽性与有效性的权衡:当前的黑盒方法通常扰动所有智能体(隐蔽性差),或无论环境状态如何都针对固定智能体(有效性差)。它们缺乏一种策略来动态选择最具破坏性的受害者和最具破坏力的动作。
- 目标:开发一种攻击框架,在严格黑盒设置下运行(仅观察输入/输出),仅扰动智能体观测(而非动作),并通过仅攻击单个自适应选择的智能体,在保持高隐蔽性的同时实现高有效性。
2. 方法论:AdapAM 框架
作者提出了AdapAM(多智能体系统的自适应对抗攻击),该框架包含两个核心模块:
A. 自适应选择策略(πϕ)
该模块确定在每个时间步攻击哪个智能体以及诱导何种恶意动作。
- 目标:通过选择最具关键性的智能体(攻击者)和造成最坏影响的动作,最大化多智能体系统全局奖励的退化。
- 架构:
- 建模为使用**软演员 - 评论家(SAC)**的强化学习(RL)过程。
- 分层设计:为了减少搜索空间,该策略使用两个分类器:
- Cϕ1:基于全局状态 st 选择攻击者智能体索引(it)。
- Cϕ2:基于 st 和选定的智能体 it 选择恶意动作(a~t)。
- 奖励信号:选择策略的奖励是受害多智能体系统全局奖励的负值(Rtα=−R(st,at,st+1))。
- 操作:在每一步,策略采样一个智能体和一个目标动作。随后,系统尝试扰动选定智能体的观测,以强制其执行该特定动作。
B. 基于代理的扰动以诱导恶意动作
由于受害多智能体系统是黑盒,攻击者无法直接计算梯度来生成扰动。
- 代理智能体:攻击者使用多智能体生成对抗模仿学习(MAGAIL)训练一组代理智能体(πψ)。这些代理通过学习模仿受害智能体的观测到动作的映射,从而近似受害智能体的策略(πψ≈πvictim)。
- 扰动生成:
- 一旦代理智能体训练完成,攻击者便获得了对代理模型的“白盒”访问权限。
- 利用代理模型上的**C&W(Carlini & Wagner)**攻击技术,系统生成扰动观测 o~t,i,强制代理(并通过迁移性,强制受害智能体)输出所需的恶意动作 a~t。
- 扰动被最小化(欧几里得距离),以确保在满足策略输出目标动作的约束下保持隐蔽性。
- 注入:生成的扰动观测被注入到真实黑盒环境中选定受害智能体的输入流中。
3. 主要贡献
- 新颖的黑盒框架:提出了 AdapAM,这是第一个在严格黑盒多智能体系统设置下,无需动作控制即可自适应选择受害智能体和预期恶意动作的框架。
- 基于代理的扰动:引入了一种利用生成对抗模仿学习(MAGAIL)训练代理智能体的方法。这填补了黑盒约束与生成有效扰动所需的白盒梯度信息之间的空白。
- 平衡的性能:通过仅攻击一个关键智能体而非所有智能体,实现了有效性(降低系统性能)与隐蔽性(最小扰动幅度和低检测率)之间的优越权衡。
4. 实验结果
作者在三个基准测试的8 个多智能体环境中评估了 AdapAM:SMAC(星际争霸)、GF(谷歌研究足球)和MPE(多智能体粒子)。他们与四个基线方法进行了比较:MASafe、AMCA、AMI 和 Lin。
攻击性能:
- 有效性:AdapAM 显著降低了“普通”和“鲁棒”(ROMANCE 训练)目标多智能体系统的奖励和胜率。
- 对比:在智能体数量较少(<10)的环境中,AdapAM 将胜率降低至0%,优于所有基线。即使在大规模环境(例如 27m vs 30m)中,它仍保持高度竞争力,通常优于扰动所有智能体的方法。
- 鲁棒性:即使面对专门针对攻击进行鲁棒训练的多智能体系统,AdapAM 仍保持了优越的性能。
- 扰动率:AdapAM 在各种扰动率(15% 到 100%)下始终优于基线。
隐蔽性评估:
- 扰动幅度:通过 L∞ 范数测量。AdapAM 添加了最小的扰动,优于所有基线(例如在 SMAC-8m 中为 0.12 对比 0.33),使攻击难以察觉。
- 抗检测性:通过现有攻击检测机制的 F1 分数测量。AdapAM 具有最低的 F1 分数(例如 0.57 对比 0.82),表明其最难被检测。
- 原因:与扰动所有智能体且容易被检测的 MASafe 不同,AdapAM 的选择性、单智能体方法结合优化的扰动生成,确保了高隐蔽性。
5. 意义
- 安全评估:AdapAM 提供了一种严格的工具,用于评估多智能体系统在现实黑盒场景中的真实鲁棒性,揭示了白盒或非自适应方法可能遗漏的漏洞。
- 实用性:通过在严格黑盒约束下运行(仅扰动观测)并仅需最小的攻击预算(单个智能体),该方法反映了自动驾驶和无人机群等关键基础设施的现实威胁模型。
- 防御启示:AdapAM 的成功凸显了当前鲁棒训练方法在应对自适应、针对性攻击方面的不足,表明需要针对智能体选择和观测完整性制定专门的防御机制。
总之,AdapAM 证明了自适应目标选择结合基于代理的白盒生成是一种极具效力且隐蔽的策略,可用于破坏多智能体系统,在攻击成功率和隐蔽性方面均优于最先进的方法。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。