← 最新论文
💻 computer science

RL-Assisted A-Teams for Adaptive Algorithm Selection in UGV-UAV Route Optimization

本文提出了一种新型的强化学习辅助 A-Teams 超启发式框架,该框架显著加速了协同无人机-无人车(UAV-UGV)系统的实时路径优化,在有效适应动态环境变化的同时,比现有方法快 30–70%,并提供近优解。

原作者: Subramanian Ramasamy, Md Safwan Mondal, James D. Humann, James M. Dotterweich, Pranav Bhounsule

发布于 2026-09-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Subramanian Ramasamy, Md Safwan Mondal, James D. Humann, James M. Dotterweich, Pranav Bhounsule

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:小型电池驱动的无人机是监视团队的眼睛,在高空飞行以监视广袤的景观,而坚固的地面车辆则是它们的移动生命线。无人机非常灵活且视野开阔,但受限于一个简单的物理极限:它们的电池电量消耗很快。相比之下,地面车辆携带的能量更多,但移动速度较慢,且无法到达高处。当这两种机器协同工作时,地面车辆可以作为一个移动充电站,让无人机能够降落、充电并再次起飞以继续执行任务。这种伙伴关系将空中监视的范围扩展到了单架无人机无法独立实现的程度。然而,协调它们的运动是一个极其复杂的谜题。地面车辆必须决定行驶路径,而无人机必须决定飞行路径,同时还要确保在电量耗尽之前在正确的时间和地点汇合。如果计划的计算过程太慢,团队就无法对环境变化做出反应,例如突然需要监视的新区域或被封锁的道路。

伊利诺伊大学芝加哥分校和 DEVCOM 美国陆军研究实验室的研究人员开发了一种解决这一协调谜题的新方法,该方法使系统能够思考得更快并进行实时适应。他们没有依赖一套单一、僵化的规则来规划路径,而是创建了一个智能系统,该系统可以学习如何为当前的任务选择最佳的规划工具。将规划过程想象成一个包含不同方法的工具箱,有些方法擅长寻找宏观路径,而另一些则擅长精细调整特定细节。对于过去的每一个问题,从工具箱中选择工具的过程都是由预定义的策略支配的,而不是以智能的方式演进,这浪费了时间。现在,这个新系统使用一个通过强化学习训练出的学习代理(learning agent)来充当监督者。这个监督者观察规划进展情况,并决定在每一时刻使用哪种特定的工具。它学会了跳过那些没有帮助的工具,转而专注于那些能让计划变得更好的工具,从而有效地教会计算机如何在不牺牲路径质量的前提下提高效率。

研究团队通过模拟任务测试了这种方法,在这些任务中,一辆地面车辆和一到两架无人机需要监测一个广阔的区域超过两小时。他们将这种基于学习的新系统与另外三种常见方法进行了比较:一种是模仿自然选择来寻找解决方案的标准遗传算法;一种是同时使用所有工具的传统多智能体框架;以及一个包含了用于预测哪些计划可能失败的预测器的变体框架。在需要访问许多点的场景中,新系统表现出了显著的速度优势。它找到的路径与其它方法一样好,甚至有时更好,但完成计算的时间减少了约 30% 到 70%。例如,在一次具有高密度任务点的测试中,新系统仅用约 12 分钟就完成了计算,而遗传算法则需要近 40 分钟才能达到类似的结果。这种速度至关重要,因为这意味着如果情况发生变化,例如出现意外的检查点,团队可以快速重新规划路径。

为了证明该系统能够应对现实世界的条件,研究人员将其应用于一个涉及芝加哥附近桥梁网络巡检的案例研究。任务包括地面车辆沿着桥梁行驶,同时无人机在上方飞行以检查结构问题。模拟运行了 150 分钟,期间系统必须考虑到无人机有限的电池寿命以及与地面车辆会合充电的需求。结果显示,使用两架无人机配合一辆地面车辆比仅使用一机一车的效率更高,因为额外的无人机让团队能够更频繁地访问检查点。该系统能够适应动态变化;当任务期间随机引入新的检查点时,学习代理在大约三分钟内就重新计算了路径。这种重新规划的时间完全处于无人机的充电周期窗口内,证明了该系统可以在不迷失方向的情况下处理突发事件。

这项研究强调,高效的关键在于算法的智能选择。学习代理不仅仅是随机挑选工具;它会观察优化的当前状态(例如上一步计划改进了多少),并选择能提供速度与改进之间最佳平衡的行动。如果局部搜索工具在优化当前路径方面做得很好,代理可能会继续使用它。如果计划陷入停滞,代理可能会切换到全局搜索工具以探索新的可能性。这种动态决策机制使系统能够避免在没有贡献的工具上浪费时间。虽然该方法依赖于模拟,并且在无需重新训练即可推广到完全不同类型的问题方面存在局限性,但其结果为自主团队提供了一条充满前景的路径。通过教机器如何选择自己的策略,研究人员正致力于实现一个未来,即机器人团队能够在复杂、多变的环境中独立运行,从而确保基础设施监测和灾难响应等任务的安全与高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →