← 最新论文
🤖 machine learning

ASGARD: Action-Space Guard for UAV Resilience via Reinforcement Learning

本文介绍了 ASGARD,这是一个两阶段教师-学生框架,通过训练一个仅利用物理状态历史来生成修正动作指令的监测器,增强了基于强化学习的无人机控制器在面对运行时动作空间攻击时的韧性。

原作者: Mohsen Salehi, Karthik Pattabiraman

发布于 2026-09-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohsen Salehi, Karthik Pattabiraman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

无人机已不再仅仅是遥控玩具;它们是复杂的机器,利用软件来解释世界并决定飞行路径,从而在空中进行导航。这种自主性的核心是一种被称为“强化学习”的人工智能,在这种学习方式下,计算机程序通过试错法来学习控制飞行器,就像儿童学习骑自行车一样。系统观察周围环境,尝试一次动作,并根据该动作是否使其更接近目标而获得反馈。随着时间的推移,它会建立起一套安全且高效飞行的策略。然而,这种对软件的依赖也制造了一个漏洞。正如人类飞行员会被错误信号误导一样,无人机的计算机也会被欺骗。虽然研究人员长期以来一直担心黑客向无人机的传感器输入虚假数据,但一种更隐蔽、更危险的威胁已经出现:即在无人机已经做出决策之后发生的攻击。

想象一下,无人机计算出为了保持航向,它需要稍微向左倾斜。计算机将这一指令发送给电机。在一种特定类型的网络攻击中,入侵者会在计算机做出决策与电机执行动作之间的那极短瞬间拦截该指令,在指令被执行前对其进行篡改。无人机的“大脑”认为自己正在正确飞行,但其“身体”却被强迫向一个错误且危险的方向移动。这被称为“动作空间攻击”(action-space attack)。由于攻击发生在决策之后,那些检查无人机传感器或计算机逻辑的传统安全系统往往完全无法察觉。即使在被劫持的过程中,无人机看起来仍是在清晰地思考。

为了应对这一隐形威胁,不列颠哥伦比亚大学的研究人员开发了一种名为 ASGARD 的新型防御系统。该系统旨在作为无人机指令的守护者,确保电机接收到的内容正是计算机原本意图执行的内容,即使有攻击者试图篡改信息。研究人员使用了一种“两阶段训练法”来构建这个系统,模拟了大师如何训练学生的过程。在第一阶段,“教师”系统在拥有关于攻击的秘密信息(例如确切知道入侵者何时以及如何试图干扰控制)的情况下学习飞行。这种特权知识使教师能够理解什么是安全的指令,什么是被破坏的指令。它学习生成一种隐藏信号,无论环境中有多少噪声,都能捕捉到飞行的真实意图。

一旦教师掌握了这项技能,它就会将知识传递给将在现实世界中实际驾驶无人机的“学生”系统。学生无法获取关于攻击的秘密信息;它只能看到无人机物理运动的历史记录,例如位置、速度和姿态。通过精心的训练,学生学会了仅利用这些可观测的事实来重建教师的隐藏信号。这使得学生即使在不知道攻击具体细节的情况下,也能识别出指令是否被篡改。该系统包含一个轻量级的监控组件,位于决策软件与电机之间。该监控器不断将输出的指令与重建的隐藏信号进行对比。一旦检测到差异,它会在指令到达电机之前立即进行修正,从而有效地实时抵消攻击。

研究人员在一个模拟环境中测试了这种方法,在该环境中,无人机必须飞过一系列检查点。他们让无人机遭受了各种类型的攻击,包括试图强制其俯仰、横滚或改变速度的攻击。在这些测试中,没有这种保护的标准无人机控制器在近一半的情景中坠毁。甚至此前一种旨在应对传感器攻击的高级防御系统,在面对这些动作空间入侵时也完全失效——当四个控制通道同时受到攻击时,该系统在所有尝试中全部失败。相比之下,ASGARD 系统保持了无人机的安全飞行。当只有一个控制通道受到攻击时,该系统成功完成了 95% 的任务,未发生一次坠毁。即使在最困难的情景下,即四个控制通道同时受到攻击时,该系统仍设法完成了三分之二的任务,这是其他系统无法实现的壮举。

该系统还表现出了惊人的适应性。研究人员训练无人机去防御针对单一特定控制(如俯仰)的攻击,然后测试它对从未见过的其他控制攻击的防御能力。该系统表现出了良好的泛化能力,成功防御了这些未知的威胁并完成了大部分任务。这表明该系统学习到的是一种检测控制流损坏的基础理解,而不仅仅是记忆特定的攻击模式。此外,该系统对于那些随着时间推移逐渐增加干扰程度的隐蔽攻击依然有效,而这类策略往往会让其他防御系统措手不及。通过持续追踪无人机的历史记录并随着扰动的增长调整其修正措施,该系统防止了无人机偏离航线。

结果表明,这种两阶段方法为解决让自主无人机处于脆弱境地的难题提供了一个稳健的解决方案。通过在决策软件与物理电机之间放置一个智能的修正层,该系统确保了无人机能够执行其预定路径,即使攻击者试图劫持指令行。虽然这项研究是在模拟环境中进行的,但其发现为在日益互联且可能充满敌意的世界中实现更安全的自主飞行指明了清晰的路径。这项工作证明,抵御网络攻击的韧性并不一定需要停止无人机或进行紧急着陆;相反,可以通过实时修复指令来实现,从而让机器能够充满信心地继续执行其任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →