← 最新论文
🤖 machine learning

ARMOR: Robust Reinforcement Learning-based Control for UAVs under Physical Attacks

本文介绍了 ARMOR,一种无模型强化学习控制器,它通过采用两阶段训练框架来学习具有抗攻击能力的潜在状态表示,从而在无需在部署期间获取特权攻击信息的情况下,确保无人机在物理传感器攻击下的鲁棒运行。

原作者: Pritam Dash, Ethan Chan, Nathan P. Lawrence, Karthik Pattabiraman

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Pritam Dash, Ethan Chan, Nathan P. Lawrence, Karthik Pattabiraman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人驾驶无人机。在现实世界中,机器人没有像人类那样的眼睛;它们依靠一系列传感器——用于定位的 GPS、用于平衡的陀螺仪以及用于感测运动的摄像头——来弄清楚自己在哪里以及如何移动。这就是强化学习 (Reinforcement Learning, RL) 的世界,这是一种人工智能类型,计算机通过尝试各种方法并根据表现获得奖励来学习决策,就像狗学习做动作并获得零食一样。目标是创造一个能够安全地引导无人机完成复杂任务的“大脑”。

然而,有一个狡猾的问题:这些传感器可能会被欺骗。就像魔术师可以蒙蔽你的眼睛一样,黑客可以向无人机的传感器发送虚假信号。这被称为物理攻击 (physical attack)。例如,他们可能会发送一个虚假的 GPS 信号,让无人机误以为自己在不同的位置,或者利用声波来干扰其平衡传感器。如果无人机的大脑相信了这些谎言,它可能会坠毁或撞上建筑物。科学家们曾尝试构建“安全”的大脑来规避危险,但大多数这类安全网在无人机受到黑客积极欺骗时都会失效。它们假设世界只是有点“混乱”,而不是有人在主动对机器人撒谎。

这正是名为 ARMOR 的新理念发挥作用的地方。研究人员希望构建一个能够识别谎言的无人机控制器,即使传感器正大声疾呼着那是真相。他们不仅仅是让无人机变得更“强壮”;他们教会了它一种看待世界的新方式。ARMOR 并不直接观察那些容易被欺骗的原始传感器数据,而是学习如何创建一个关于真实情况的“秘密摘要”。论文指出,通过使用一种特殊的两阶段训练方法,他们可以创造出一种即使在传感器遭到破坏时也能保持航向的无人机,且无需针对每一种黑客发明的新把戏进行重新训练。

ARMOR 的故事:一个懂得识破谎言的无人机

来认识一下 ARMOR(自适应鲁棒操纵优化状态表示)。不要只把 ARMOR 看作一名飞行员,把它看作一名学会了忽略虚假不在场证明的侦探。

在无人机控制的世界里,通常的方法是将传感器的原始数据输入计算机:“我在坐标 X”,“我正以速度 Y 旋转”。但如果黑客注入了一个虚假信号,计算机就会相信这个谎言。以往的方法试图通过针对特定技巧进行训练(就像学生只针对一种特定类型的考试题目进行复习)来教会无人机变得“多疑”。这种方法速度慢、成本高,而且如果黑客稍微改变一下技巧,无人机就会失败。

ARMOR 采取了不同的方法。它使用了一个两阶段训练框架,就像拥有一位大师级教师和一名学生。

第一阶段:拥有“超能力视觉”的老师
首先,研究人员训练一个“教师编码器 (Teacher Encoder)”。这是一个聪明的 AI 组件,它拥有一种超能力:它可以获取特权信息 (privileged information)。在模拟环境中,老师完全知道什么时候正在发生攻击,哪个传感器正在被欺骗,以及谎言有多大。这就像一位在学生考试时能看到答案解析的老师。

利用这一参考信息,老师学习将混乱、充满谎言的传感器数据转化为鲁棒的潜在表示 (robust latent representation)。你可以将其想象为一个“秘密代码”或“真实的摘要”。即使 GPS 说无人机在海洋里,老师的秘密代码也知道:“不,GPS 在撒谎;无人机实际上在空中。”无人机的控制策略(即它的脑)学习基于这个秘密代码而非原始传感器数据来做出决策。这使得无人机即使在遭受攻击时也能学习如何完美飞行,因为它是在向真相学习。

第二阶段:学会洞察真相的学生
这里是棘手的部分:在现实世界中,无人机并没有一个带着答案解析的老师。它无法知道自己何时受到了攻击。因此,研究人员训练了一个学生编码器 (Student Encoder)

学生就像一名必须在没有答案解析的情况下查明真相的侦探。它只能访问无人机的历史记录——即过去几秒钟的传感器数据流。学生被训练去观察这段历史,并猜测老师生成的“秘密代码”。它学会了识别模式,比如“嘿,GPS 数值正在缓慢漂移,这通常意味着存在虚假信号”,或者“陀螺仪正在以一种奇怪的节奏震动”。

一旦学生擅长猜测这个秘密代码,老师就会退役。无人机仅带着学生和控制策略进行部署。现在,当无人机在现实世界中飞行并受到攻击时,学生会分析传感器数据的历史,生成“真实的摘要”,然后控制策略利用该摘要来保持无人机飞行平稳。

实验结果显示

研究人员在模拟的 3D 世界中测试了 ARMOR,使其对抗五种不同类型的物理攻击:GPS 欺骗、陀螺仪篡改、加速度计诡计、磁力计损坏和光流欺骗。他们将 ARMOR 与其他顶尖方法进行了对比,包括 RARL(使用对抗性训练)和 HRP(混合恢复策略)。

实验结果在模拟中非常清晰:

  • 生存率 (Survival Rate): 面临攻击时,ARMOR 能在约 88% 的时间内成功维持无人机飞行。相比之下,旧方法表现挣扎,成功率在 30% 到 83% 之间波动。
  • 坠毁率 (Crashes): 或许最令人印象深刻的是,ARMOR 在所有测试的攻击类型中,坠毁率为 0%。其他方法频繁坠毁;例如,在 GPS 攻击下,一种竞争方法有 50% 的概率坠毁。
  • 保持航向 (Staying on Course): 当无人机确实被推离航线时,ARMOR 能将“状态漂移”(即偏离路径的程度)控制在极低的水平,对于 GPS 攻击而言约为 0.1 米。而其他方法会让无人机漂移数米或数度,这足以导致坠毁或任务失败。

“零样本”超能力

最令人兴奋的发现是作者所称的零样本泛化 (zero-shot generalization) 能力。通常,如果你训练一个机器人处理 GPS 谎言,当它突然遇到陀螺仪谎言时,它可能会失败。这就像只学习了数学却在历史考试中挂科。

然而,ARMOR 展示了它可以在没有任何额外训练的情况下处理未见过的攻击

  • 当他们仅针对 GPS 攻击训练无人机,然后在陀果仪攻击(它从未见过的攻击)上进行测试时,ARMOR 仍能实现 60% 的成功率。而另一种方法 (RARL) 则彻底失败,成功率为 0%
  • 当他们针对陀螺仪攻击进行训练并在 GPS 攻击上进行测试时,ARMOR 取得了 70% 的成功率,而另一种方法仅达到了 5%

这表明,通过学习“真实物理状态”的“秘密代码”,无人机可以识别出任何传感器是否在撒谎,即使这种谎言类型是它从未练习过的。

这意味着什么(以及它不意味着什么)

论文指出,这种两阶段方法是一个重大进步,因为它同时解决了两个大问题。首先,它更快、更便宜。传统的对抗性训练需要计算机与虚假攻击者进行成千上万小时的反复博弈,而 ARMOR 通过使用老师快速学习真相,再教学生模仿真相,跳过了这一过程。

其次,它让无人机在面对多种威胁时更加安全。作者指出,虽然 ARMOR 在处理单一传感器攻击甚至某些多传感器攻击方面表现出色,但它也有局限性。如果攻击者以复杂的方式同时干扰过多的传感器,系统可能仍会面临困难。此外,这些结果目前是基于模拟环境(计算机模型),而非使用被黑硬件的真实无人机进行的实际飞行。作者谨慎地表示,尽管结果令人鼓舞,但下一步是观察它在真实世界的真实无人机上是否同样有效。

简而言之,ARMOR 教会了无人机停止倾听嘈杂、撒谎的传感器,转而倾听现实的“秘密摘要”。这是一个巧妙的技巧,它将一个脆弱的机器人变成了一个具有韧性的机器人,使其即使在世界试图欺骗它时,也能飞得笔直。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →