想象你有一群完全相同的无人机(就像一群蜜蜂),以及一份它们需要访问的地点清单(就像花朵)。棘手之处在于,没有人知道哪架无人机应该去哪个花朵。它们都是可互换的。它们的目标是弄清楚谁去哪里,尽可能快地到达那里,并确保它们不会相互碰撞或撞墙,同时它们通过略有延迟的对讲机彼此交流。
本文提出了一种新的“大脑”,用于让这些机器人团队解决该问题。以下是其工作原理,分解为简单的部分:
双部分大脑:“战略家”与“飞行员”
作者构建了一个双层系统,就像一位将军和一名士兵协同工作。
1. 战略家(GATP - 图注意力规划器)
将其视为团队队长。它不担心无人机如何移动马达的细微细节。相反,它着眼于大局。
- 思考方式:它使用一种称为图神经网络(Graph Neural Network)的特殊人工智能。想象无人机是地图上的点,线条将它们与邻居连接起来。队长观察这个连接网络。
- “注意力”技巧:就像你可能会更关注一位朋友大喊“小心!”而不是背景中某人的低语一样,这种人工智能学会聚焦于最重要的邻居。它会问:“谁离目标最近?谁在阻挡路径?”
- 职责:它不会告诉无人机具体如何飞行。它只是给出一个子目标,比如一个航点。“嘿,接下来几秒钟飞向那个位置。”它这样做非常快,并且只与直接邻居交谈,因此不会被过多的 chatter 所淹没。
2. 飞行员(NMPC - 非线性模型预测控制器)
将其视为坐在无人机内的熟练飞行员。
- 思考方式:这部分了解物理原理。它知道无人机很重,无法瞬间转向,并且电池容量有限。
- 职责:它接收来自战略家的“子目标”,并计算出到达那里的精确、安全、平滑的路径。它不断检查:“如果我这样急转弯,会撞墙吗?我的马达够强吗?”它确保无人机永远不会撞毁,并且即使有风吹拂也能平稳移动。
为何不同(且更优)
以往解决该问题的尝试存在两个主要缺陷:
- 过于简单:它们通常假设机器人是重量为零的点,可以瞬间停止和启动。在现实世界中,无人机很重,无法做到这一点。
- 过于嘈杂:它们要求机器人与其他所有机器人多次交谈以达成一致计划。如果无线电信号缓慢或中断,整个团队都会陷入混乱。
本文的解决方案:
- 现实性:通过将“大局”(战略家)与“物理”(飞行员)分离,该系统能够与具有真实限制的真实、重型无人机协同工作。
- 最小化交谈:战略家仅与其最近的 2 个邻居交谈,并且仅在两步(层)内完成。这就像一场只有两名选手而不是十名选手的接力赛。即使对讲机很慢(延迟高达 200 毫秒),团队也能继续移动,因为消息无需传播很远。
实验:从模拟到现实
团队通过两种方式测试了该系统:
在计算机中(模拟):他们模拟了 10 架无人机尝试形成圆形或覆盖大片区域。
- 结果:系统运行良好。即使他们人为地减慢通信速度(模拟信号不良),只要延迟不是太大,无人机仍能完成任务。
- 扩展性:他们测试了该系统是否适用于更大的团队(多达 50 架无人机)。由于“战略家”只关注其直接邻居,增加更多无人机并不会破坏系统。它具有良好的泛化能力。
在现实中(实验室):他们将 4 架真实的四旋翼无人机放入一个装有动作捕捉相机系统的房间。
- 测试:无人机必须形成不同的形状(如直线或三角形),并绕过障碍物移动。
- 结果:成功了!无人机成功交换位置以避开障碍物,并安全地形成了所需形状。
- 速度:“战略家”速度极快,决策时间约为 1 毫秒。无人机之间发送消息所需的时间是最慢的部分(约 26 毫秒),但这仍然足以让系统处理。
结论
本文表明,你可以教会一群机器人高效协作,而无需超级计算机或完美的通信。通过将工作划分为智能、低交谈的战略家和具备物理意识的飞行员,他们创建了一个稳健、安全且准备好在现实世界中飞行的系统,即使无线电连接并不完美。
技术摘要:面向多机器人通信受限无标签运动规划的图神经规划与预测控制
问题表述
本文解决了同质多机器人系统的无标签运动规划问题。在该设定下,N 个可互换的机器人必须协同到达一组N个目标点,且无需预先分配配对关系。目标是在确保避撞的同时,最小化总行程时间和距离。该问题被表述为联合分配与轨迹规划任务,属于 PSPACE 难问题。
作者指出了现有图神经网络(GNN)方法在该问题中存在的关键差距:
- 简化的动力学:先前的 GNN 方法通常依赖仿真中的简化动力学,并直接预测速度指令,未能考虑现实世界中的非线性动力学和执行器限制。
- 安全保证:避撞通常被视为软约束或事后过滤器,这无法在执行器限制下保证安全性。
- 通信约束:现有的 GNN 架构通常要求多跳通信(4–5 层),使其容易受到现实世界中通信延迟和丢包的影响。
- 部署:大多数基于学习的方法依赖集中式、机外推理,而非去中心化、机载执行。
方法论:分层 GATP-NMPC 框架
作者提出了一种分层框架(图 1),将高层规划与底层控制解耦,集成了图注意力规划器(GATP)与去中心化非线性模型预测控制器(NMPC)。
高层规划(GATP):
- 架构:规划器利用图注意力网络(GAT),仅包含2 层消息传递。每个机器人仅与其最近的M个邻居通信(例如,M=2)。
- 机制:GNN 处理局部观测(Pg个最近目标点和Pr个最近机器人的相对位置),以预测中间子目标(si),而非直接的速度指令。
- 设计选择:该架构采用多层感知机(MLP)将初始节点嵌入与聚合的邻居信息融合。这种“更新函数”(f1)保持了置换不变性并增强了节点区分度。输出根据期望的时间范围Tp和最大速度vmax缩放至空间范围Sp(例如 4 米)。
- 训练:GATP 通过模仿学习进行训练,使用集中式专家(匈牙利算法)生成最优子目标。采用课程采样方案,在训练过程中逐步用 GATP 预测替换专家子目标。
底层控制(NMPC):
- 执行:每个机器人运行去中心化 NMPC 以跟踪 GATP 提供的子目标。
- 约束:NMPC 在预测时域Tc上求解非线性优化问题以生成控制输入。它明确强制执行:
- 非线性动力学:四旋翼动力学被建模为控制仿射系统。
- 安全性:使用**指数控制障碍函数(ECBFs)**强制执行硬安全约束,以在机器人之间保持安全距离dsafe。
- 执行器限制:遵守电机推力约束。
- 集成:GATP 根据机器人不断变化的位置持续更新 NMPC 参考轨迹,允许低频重规划(例如 1–2 Hz),而 NMPC 以高频运行(例如 100–160 Hz)。
主要贡献
- 分层框架:将基于 GNN 的规划器与安全保证的 NMPC 新颖地集成,使得基于学习的方法能够应用于具有非线性动力学和执行器约束的现实世界系统。
- 鲁棒的 GNN 架构:一个仅需最少通信(1 跳,M=2个邻居)的 2 层图注意力网络。作者证明,与先前工作中使用的深层 GNN 相比,这种浅层架构提高了对通信延迟的鲁棒性。
- 现实世界部署:首次在物理四旋翼上,在完全去中心化、机载推理的设置中验证了基于 GNN 的无标签运动规划器。
- 消融与基准测试:一项比较研究表明,所提出的 GATP 架构(具有特定的更新函数)在覆盖性能和对更大团队规模的泛化能力方面,优于标准图卷积网络(GCN)和其他替代更新策略。
实验结果
- 仿真(10 架四旋翼):
- 覆盖性能:GATP 实现了与 GCN 相当的覆盖性能(10 架机器人 40 秒内分别为 94.55% 对 95.00%),但在扩展到更大团队(多达 50 架机器人)时表现出更优越的泛化能力。随着团队规模增加,GATP 的性能下降幅度较小(23.5%),而 GCN 为 34.5%,这归因于注意力机制能够动态加权邻居的重要性。
- 通信延迟:系统在模拟高达 0.6 秒的通信延迟下进行了测试。该框架对高达200 毫秒(总延迟D=0.2s)的延迟保持鲁棒,覆盖时间仅增加约 3.8–5.5%。仅当延迟接近规划更新间隔(0.5 秒)时,性能才显著下降。
- 现实世界实验(4 架四旋翼):
- 部署:该系统部署在配备高通 VOXL 2 处理器的定制四旋翼上,在室内测试场中进行。
- 任务:成功执行了圆形编队和区域覆盖任务,以及动态避障任务,其中规划器重新分配目标以避免碰撞。
- 延迟:GATP 推理时间约为1 毫秒(不包括通信)。每层的平均通信延迟为26 毫秒,导致每架机器人的总规划时间在 51 毫秒至 134 毫秒之间。这证实了系统在仿真中确定的鲁棒延迟范围内运行。
意义与主张
本文声称,这项工作弥合了可扩展的、基于学习的多机器人规划与现实世界部署的严格安全要求之间的差距。通过将通信高效的 GNN 与感知约束的 NMPC 相结合,作者证明了:
- 安全性与可行性:可以使用 GNN 进行高层协调,同时通过 NMPC 保证安全性和动力学可行性。
- 可扩展性与鲁棒性:浅层的、基于注意力的 GNN 架构在扩展到更大团队以及对通信延迟的鲁棒性方面,优于深层的多跳架构。
- 实际可行性:去中心化、机载推理对于多机器人系统是可行的,四旋翼成功的现实世界实验证明了这一点。
作者谦逊地总结道,虽然他们当前的设计能很好地处理有界延迟,但未来的工作将调查更现实的异步通信条件,以及在训练过程中规划与控制之间更紧密的耦合。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。