想象一下,天空中布满了小型自主飞行器,每一架都承担着从不同起点飞向同一个汇合点的任务。它们的使命不仅是到达那里,还要在同一时间抵达,同时还要穿梭在一个可能充满隐形墙壁、危险区域和其他移动飞行器的三维世界中。这就是多无人机路径规划的挑战。几十年来,工程师们一直试图利用基于几何规则或简单试错的方法来解决这个问题,但当环境变得过于复杂或发生意外变化时,这些方法往往会陷入僵局或失败。近年来,一种不同的方法脱颖而出:教这些机器通过实践来学习。通过让它们在模拟世界中进行交互,并对它们的正确决策给予奖励,研究人员可以帮助它们学会如何自主导航。然而,这个学习过程通常很缓慢且困难,尤其是当机器需要相互协作而不发生碰撞时。
延安大学的一个研究小组开发了一种新方法,旨在让多架无人机在三维空间中的学习过程更快、更可靠。他们结合了两种现有的理念:一种是让多台机器在互相观察的同时共同学习的方法,以及一种利用隐形力量引导运动的经典导航概念。在他们的方法中,他们创建了一个系统,使无人机能够获得持续的反馈,而不是仅仅在飞行结束时收到一个单一的“做得好”或“做得差”的信号。这种持续的反馈就像一种温柔的、连续的推动,在每一时刻都告诉无人机它们距离目标有多近,以及距离障碍物有多远。这有助于无人机比以前更快地学习。
研究人员在涉及三架无人机的计算机模拟中测试了他们的方法。无人机起始于一个 10 公里 × 10 公里 × 10 公里的空间内的不同位置。它们的目标是飞向位于坐标 (7, 4, 1) 公里处的特定汇合点,同时避开两个大型球形障碍物和一个高大的圆柱形障碍物。团队将他们的新方法与另外两种常见方法进行了对比。其中一种对比方法中的无人机在完全不共享信息的情况下进行独立学习,而另一种则允许它们共同学习,但没有使用这种特殊的连续反馈系统。结果显示,使用新方法的无人机以最快速度学习到了最佳策略。它们成功到达了目标并避开了所有障碍物,而那些独立学习的无人机在多次尝试中都未能避免碰撞。
在观察飞行效率时,新方法也产生了更短的总飞行距离。使用该新方法的无人机小组完成任务的总飞行距离为 24.7056 公里。相比之下,使用标准协作学习方法的无人机小组飞行距离较长,为 25.9426 公里。而那些在没有协作情况下学习的无人机则完全未能安全完成任务。研究人员发现,通过向无人机提供关于其进度和安全性的稳定信息流,系统可以更快地找到更好的路径。他们还将训练结构化为两个层面:一层专注于规划整体路线,另一层专注于执行具体的动作,这有助于无人机更有效地学习这项复杂的任务。
这项工作表明,通过改进机器在训练期间接收反馈的方式,我们可以帮助它们更快地解决复杂的导航问题。该研究并未在真实的物理世界中测试这些无人机,但模拟实验为该方法在受控条件下的表现提供了清晰的图景。研究结果表明,对于自主车辆群体要在拥挤的三维空间中安全协作,它们需要一种能够持续理解自身进度的方式,而不是等到任务结束才去了解是否成功。新方法提供了一种实现这种理解的方式,从而带来了更安全、更高效的飞行。
技术摘要:基于 APF-MADDPG 的多无人机 3D 路径规划
1. 问题陈述
本文研究了未知环境下多无人机(Multi-UAV)3D 路径规划的挑战。该问题具有高维动作空间、严格的避障约束(包括无人机之间以及与障碍物之间的碰撞规避)以及 NP-hard 的计算特性。
识别出的具体挑战包括:
- 协作与个体性的平衡: 与侧重于个体最优性的单无人机规划不同,多无人机规划需要平衡协作、碰撞规避以及同时完成任务(聚合)的需求。
- 传统方法的局限性: 几何方法(如 Voronoi 图)难以应对动态变化;人工势场法(APF)容易陷入局部最优;而启发式算法(如遗传算法、粒子群优化算法 PSO)在高维空间中往往面临收敛缓慢或局部最优的问题。
- 现有强化学习方法的局限性: 虽然深度确定性策略梯度(DDPG)适用于单智能体,但它忽略了智能体之间的策略差异,从而导致碰撞。多智能体 DDPG(MADDPG)虽然解决了协作问题,但通常受到**稀疏奖励(Sparse Rewards)**的困扰,使得奖励函数的设计变得困难,且在复杂环境中的收敛速度较慢。
2. 方法论
作者提出了一种新型算法 APF-MADDPG,该算法将基于人工势场法(APF)改进的奖励机制与多智能体深度确定性策略梯度(MADDPG)框架相结合。
2.1 问题建模
- 任务模型: 定义为一个聚合任务,其中 N 架无人机从分散的位置出发,必须在避开威胁区、禁飞区和障碍物的同时,同时到达一个共同的目标区域。
- 运动模型: 使用 3D 运动学模型,无人机控制线性加速度、俯仰角加速度和偏航角加速度。对速度、加速度和角度施加约束。
- 障碍物模型: 障碍物被建模为由几何参数定义的凸体(球体或圆柱体)。
- 博弈论公式化: 该问题被表述为一个部分可观测马尔可夫博弈(POMG)。
- 状态空间 (Si): 包括位置、速度、俯仰角和偏航角。
- 动作空间 (Ai): 线性加速度、俯仰角加速度和偏航角加速度。
- 观测空间 (oi): 包括无人机自身状态、其他无人机的相对状态以及障碍物的相对位置在内的局部观测。
2.2 核心算法:APF-MADDPG
该算法采用分布式执行与集中式训练框架。
- 分层训练机制: 引入了一个两层结构:
- 路径规划层: 每架无人机拥有一个独立的 Actor-Critic 网络。Actor 根据局部观测生成带有探索噪声的动作。
- 动作执行层: 无人机在环境中执行动作,生成新的观测值和奖励。
- 稠密奖励函数(核心创新): 为了克服稀疏奖励问题,作者设计了一个基于 APF 原理的复合奖励函数 (Rsum):
- 引力 (Rut): 利用基于欧几里得距离的指数衰减函数,鼓励向目标移动。
- 斥力 (Ruu): 通过惩罚无人机之间的接近程度来防止碰撞。
- 障碍物斥力 (Ruo): 使用指数函数惩罚与障碍物的接近程度。
- 趋近奖励 (Rdepart): 通过计算前一时刻与当前时刻到目标的距离差(d(plast,ptarget)−d(pnow,ptarget))来奖励向目标的进展。该机制旨在解决 APF 中目标不可达的问题,并防止智能体在目标附近徘徊以获取最大奖励而不真正到达目标。
- 总奖励: Rsum=w1Rut+w2Ruu+w3Ruo+w4Rdepart。
2.3 训练过程
算法采用标准的 MADDPG 更新规则,并使用目标网络以保证稳定性。
- Critic 更新: 最小化预测 Q 值与目标值 (yi) 之间的损失,其中 yi 结合了即时奖励和来自目标网络的折扣未来 Q 值。
- Actor 更新: 使用策略梯度最大化期望回报。
- 软更新(Soft Updates): 目标网络参数通过软更新 (τ≪1) 进行更新,以确保训练的稳定性。
3. 主要贡献
本文明确提出了两项主要贡献:
- 稠密奖励函数: 将基于 APF 的稠密奖励函数集成到 MADDPG 框架中。这解决了传统多智能体强化学习在路径规划中存在的奖励稀疏和收敛慢的问题。
- 分层训练机制: 建立了由路径规划层和动作执行层组成的层次化深度强化学习结构,以高效训练最优策略。
4. 实验结果
所提方法在包含三架无人机和三个障碍物(两个球体,一个圆柱体)的 3D 模拟环境(10 km × 10 km × 10 km)中进行了评估。将其与使用传统稀疏奖励的 MADDPG 以及 ILDDPG(独立学习者 DDPG)进行了对比。
- 收敛速度: 回报曲线(图 4)表明,APF-MADDPG 的收敛速度明显快于 MADDPG 和 ILDDPG。
- 策略质量:
- ILDDPG: 在模拟中未能避开障碍物(无人机 1 和 2 发生了碰撞),因此不适用于此类多智能体场景。
- MADDPG: 成功避开了障碍物,但导致总路径长度较长。
- APF-MADDPG: 成功避开了所有障碍物,并实现了最短的总路径长度。
- 路径长度对比:
- MADDPG 总长度:25.9426 km
- APF-MADDPG 总长度:24.7056 km
- APF-MADDPG 算法相比标准 MADDPG 缩短了总路径长度。
5. 意义与结论
论文得出结论,APF-MADDPG 在以下方面优于 ILDDPG 和标准 MADDPG:
- 策略学习效率: 更快地收敛至最优策略。
- 路径规划最优性: 生成更短、更高效的路径。
- 安全性: 有效地在 3D 环境中规避与障碍物及其他无人机的碰撞。
作者断言,结合基于 APF 的稠密奖励和分层训练机制,有效地解决了多无人机 3D 路径规划中奖励稀疏和局部最优的问题,为未知环境下的协作任务提供了鲁棒的解决方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。