← 最新论文
⚡ electrical engineering

TRUST-UP: Trustworthy Reinforcement learning Using Safe Techniques for UAV Pursuit

本文介绍了 TRUST-UP,这是一个用于无人机追逐的可信强化学习框架,它将基于控制障碍函数的安全滤波器与透明的切换策略相结合,以确保在拥挤的城市环境中实现可证明安全且可认证的自主飞行。

原作者: Yaosheng Deng, Mengtao Lyu, Junjie Gao, Jiaping Xiao, Mir Feroskhan

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaosheng Deng, Mengtao Lyu, Junjie Gao, Jiaping Xiao, Mir Feroskhan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一台无人机玩“捉迷藏”游戏,场景是一个充满了人、其他无人机和树木的繁忙城市公园。你希望这台无人机既要速度快、反应灵敏,又要能够追逐移动的目标。

问题所在:“技术上安全”但“令人恐惧”的无人机
标准的 AI(强化学习)在学习如何快速移动方面表现出色。然而,它有一个重大缺陷:它只关心数学上的安全性

  • 数学视角: 如果无人机在撞到人头部的最后一秒紧急转向避开,数学逻辑会说:“做得好!没有发生碰撞。”
  • 人类视角: 同样这种临阵变向的行为会让人的感觉非常惊悚。它侵犯了人的个人空间,让人感到不安和不信任。

这篇论文指出,如果无人机想要在人群周围飞行,它们不仅需要具备“技术上的安全性”,还需要具备“感知上的安全性”。它们需要尊重一个“信任半径”(Trust Radius)——即围绕在人周围的一个更大的、无形的保护圈,这个圈子能让人们感到舒适,而不是仅仅保证物理上不受伤害。

解决方案:TRUST-UP
作者创建了一个名为 TRUST-UP(用于无人机追逐任务的安全可靠强化学习技术)的系统。你可以把它想象成一个坐在 AI 大脑与无人机电机之间的“智能安全副驾驶”。

它是如何工作的,这里使用简单的类比来解释:

1. “狂野”飞行员(RL 模型)

首先,他们训练了一个标准的 AI(使用一种叫做 Soft Actor-Critic 的方法)来成为一名优秀的飞行员。这个 AI 学习如何高效地追逐目标。然而,就像一个鲁莽的赛车手一样,它可能会为了赢得比赛而尝试进行危险、剧烈的动作。它本质上并不理解人类的舒适区。

2. “严厉”的安全过滤器(CBF)

这是核心创新点。在 AI 的指令到达无人机电机之前,它必须通过一个安全过滤器

  • 类比: 想象 AI 是一个在操场上奔跑的孩子,而安全过滤器就是一个拿着牵引绳、严格但公正的家长。
  • 工作原理: 该过滤器使用被称为**控制障碍函数(Control Barrier Functions, CBFs)**的数学规则。这些规则就像是隐形的、具有弹性的墙壁。
    • 墙壁 1(碰撞): 你不能撞到人或树木。
    • 墙壁 2(感知): 你必须保持足够近的距离以便观察目标(就像一条狗被绳子拴着,不能跑得太远)。
    • 墙壁 3(引擎极限): 你不能将无人机的引擎推向其物理极限。
      如果“狂野飞行员”试图冲向墙壁,过滤器会瞬间抓住“绳索”并重新引导无人机走向一条安全的路径。论文从数学上证明,即使在有风吹袭或目标进行不规则移动的情况下,这个过滤器也始终能找到一条安全的路径。

3. “开关”(透明度)

该系统有一个特殊的“开关”,决定在任何给定时刻由谁掌控。

  • 绿灯: 如果 AI 的计划已经足够安全,并且尊重“信任半径”,开关就会让 AI 自由驾驶。
  • 红灯: 如果 AI 试图做出不安全的动作,开关会瞬间接管,计算出最安全的可能路径,并执行该路径。
  • 为什么这很重要: 这使得系统具有“透明度”。我们可以查看代码并明确知道:“我们确切知道为什么无人机停止了或转向了”,这对于获得官方认证(例如在城市中飞行的许可)至关重要。

4. “虚拟引擎”技巧

论文提到了一个巧妙的技巧,即在数学模型中加入了一个“虚拟引擎”。

  • 类比: 想象一辆汽车只能以特定的速度加速。如果你突然要求进行急转弯,汽车可能会侧滑。作者的方法增加了一个“虚拟档位”来平滑这些突发的指令,确保无人机不会产生剧烈晃动,从而即使在紧急情况下也能保持“信任半径”不受侵犯。

结果:模拟实验中发生了什么?

作者在计算机模拟中进行了测试,两台无人机在障碍物周围追逐两个目标。

  • “狂野”AI(仅使用 SAC): 它撞上了障碍物,丢失了对目标的观测,并做出了不稳定的动作。它未能维持“信任半径”。
  • TRUST-UP 系统: 无人机成功追逐了目标,避开了所有障碍物,保持了观察目标的必要距离,并且从未违反安全限制。即使当目标进行“8 字形”突然转向或有风吹袭时,TRUST-UP 无人机依然保持稳定且安全。

核心结论

论文声称,TRUST-UP 弥合了快速、智能的 AI 与人类信任需求之间的鸿沟。它将一个潜在危险的 AI 包装在一个经过数学证明的“安全防护服”中,保证无人机永远不会做出让感官上觉得不安全的行为,使其为在拥挤的城市空中实际应用做好准备。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →