← 最新论文
💻 computer science

Multi-UAV Path Planning in 3D based on APF-MADDPG

本文提出了一种分层深度强化学习框架,该框架将改进的基于人工势场法的稠密奖励函数与多智能体深度确定性策略梯度(MADDPG)算法相结合,旨在实现多无人机在具有复杂障碍物的未知环境中的高效且最优的3D路径规划。

原作者: Ming Bai, Yan Chen, Yi Liu

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ming Bai, Yan Chen, Yi Liu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,天空中布满了小型自主飞行器,每一架都承担着从不同起点飞向同一个汇合点的任务。它们的使命不仅是到达那里,还要在同一时间抵达,同时还要穿梭在一个可能充满隐形墙壁、危险区域和其他移动飞行器的三维世界中。这就是多无人机路径规划的挑战。几十年来,工程师们一直试图利用基于几何规则或简单试错的方法来解决这个问题,但当环境变得过于复杂或发生意外变化时,这些方法往往会陷入僵局或失败。近年来,一种不同的方法脱颖而出:教这些机器通过实践来学习。通过让它们在模拟世界中进行交互,并对它们的正确决策给予奖励,研究人员可以帮助它们学会如何自主导航。然而,这个学习过程通常很缓慢且困难,尤其是当机器需要相互协作而不发生碰撞时。

延安大学的一个研究小组开发了一种新方法,旨在让多架无人机在三维空间中的学习过程更快、更可靠。他们结合了两种现有的理念:一种是让多台机器在互相观察的同时共同学习的方法,以及一种利用隐形力量引导运动的经典导航概念。在他们的方法中,他们创建了一个系统,使无人机能够获得持续的反馈,而不是仅仅在飞行结束时收到一个单一的“做得好”或“做得差”的信号。这种持续的反馈就像一种温柔的、连续的推动,在每一时刻都告诉无人机它们距离目标有多近,以及距离障碍物有多远。这有助于无人机比以前更快地学习。

研究人员在涉及三架无人机的计算机模拟中测试了他们的方法。无人机起始于一个 10 公里 × 10 公里 × 10 公里的空间内的不同位置。它们的目标是飞向位于坐标 (7, 4, 1) 公里处的特定汇合点,同时避开两个大型球形障碍物和一个高大的圆柱形障碍物。团队将他们的新方法与另外两种常见方法进行了对比。其中一种对比方法中的无人机在完全不共享信息的情况下进行独立学习,而另一种则允许它们共同学习,但没有使用这种特殊的连续反馈系统。结果显示,使用新方法的无人机以最快速度学习到了最佳策略。它们成功到达了目标并避开了所有障碍物,而那些独立学习的无人机在多次尝试中都未能避免碰撞。

在观察飞行效率时,新方法也产生了更短的总飞行距离。使用该新方法的无人机小组完成任务的总飞行距离为 24.7056 公里。相比之下,使用标准协作学习方法的无人机小组飞行距离较长,为 25.9426 公里。而那些在没有协作情况下学习的无人机则完全未能安全完成任务。研究人员发现,通过向无人机提供关于其进度和安全性的稳定信息流,系统可以更快地找到更好的路径。他们还将训练结构化为两个层面:一层专注于规划整体路线,另一层专注于执行具体的动作,这有助于无人机更有效地学习这项复杂的任务。

这项工作表明,通过改进机器在训练期间接收反馈的方式,我们可以帮助它们更快地解决复杂的导航问题。该研究并未在真实的物理世界中测试这些无人机,但模拟实验为该方法在受控条件下的表现提供了清晰的图景。研究结果表明,对于自主车辆群体要在拥挤的三维空间中安全协作,它们需要一种能够持续理解自身进度的方式,而不是等到任务结束才去了解是否成功。新方法提供了一种实现这种理解的方式,从而带来了更安全、更高效的飞行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →