MDGAM-Based Cooperative Task Scheduling for Communication-Constrained Distributed Multi-Agent Systems
本文提出了一种用于通信受限的分布式多机器人任务分配的神经调度框架,该框架结合了用于联合决策与消息生成的多解码器图注意力模型(MDGAM)以及一种无评论员的组相对多智能体策略梯度(GRMAPG)算法,以提高训练效率并超越现有的启发式和基于学习的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个繁忙的城市,成千上万个微小的自主机器人——比如送货无人机或自动驾驶汽车——需要协同工作来完成任务。它们并不是由某个塔楼里的超级大脑控制的;相反,它们必须学会自我决策,只能与周围能听到的邻居进行交流。这就像是在组织一场大规模、混乱的寻宝游戏,每个玩家只能看到周围几英尺范围内的东西,只能向身边的朋友低声耳语,并且必须决定去抓取哪些线索,同时又不至于互相碰撞或浪费时间。如果协调得不好,它们可能会全都涌向同一个线索,或者完全错过重要的线索。科学家们一直试图教这些机器人如何成为更好的队友,但现有的方法往往依赖于僵化的、预先写好的规则,这些规则在复杂情况发生时会失效,或者假设机器人能看到整张地图,而这在现实世界中并不现实。
这篇论文介绍了一种巧妙的新方法,旨在教导这些机器人团队如何在无法看到全局且只能与少数朋友交流的情况下进行协作。作者 Licheng Wang、Mingtao Huang 和 Yuan Shen 提出了一种名为 MDGAM(多解码器图注意力模型)的系统。你可以把它想象成给每个机器人脑子里装了一个超级聪明的“队长”。这位队长不仅观察地图,还观察事物之间的“关系”。它理解两个任务之间的距离与任务本身一样重要。不同于那些可能只会大喊“我要那个任务!”然后等待投票的旧方法,这个新系统让机器人能够向邻居传递秘密信息来协调行动,同时根据它们实际能看到的内容做出决策。
为了训练这些机器人队长,作者发明了一种新的学习技巧,称为 GRMAPG。通常,教导一个机器人团队需要一个“评论家”——一个观察整个游戏并告诉机器人做得好不好的老师。但在分布式系统中,没有单个机器人能看到整个游戏过程,因此构建这样一个老师非常困难。作者的解决方案非常精妙:他们让机器人通过并行的方式进行“自我博弈”。他们提取出一组完全相同的场景,让机器人去解决这些场景,然后比较结果。如果一组机器人表现得比平均水平更好,它们就会得到一个“击掌鼓励”(奖励提升);如果表现较差,则会受到轻微的引导去尝试不同的做法。通过这种方式,机器人无需中央指挥官的指导就能学会如何协作。
实验结果非常令人振奋。当他们在不同规模的问题上测试这种新方法时——从 4 个机器人处理 50 个任务的小规模群体,到 10 个机器人处理 150 个任务的大规模群体——该方法始终优于旧有的基于规则的方法和其他基于学习的方法。例如,在一个拥有 100 个任务和 7 个机器人的中等规模测试中,新方法完成的任务量比表现最好的启发式方法(称为 PI-maxAss)多出约 4.13%,比另一种学习方法(CAM)多出约 3.74%。更令人印象深刻的是,新方法的速度快得多。虽然旧方法在处理大规模实例(如 1,000 个实例)时需要数小时(如 49 小时 2 分钟),但新方法仅需 31 分钟 7 秒。此外,它所需的“耳语”(消息传递)也更少,显著降低了通信成本。
论文还检查了这些智能机器人处理变化的能力。如果任务数量比训练时更多或更少怎么办?或者如果机器人的交谈距离变长或变短了怎么办?测试表明,该系统具有很强的灵活性。它在处理任务数量的变化时,性能几乎没有下降(差异小于 0.7%)。只要差异不是特别巨大,它也能很好地处理机器人数量的变化。然而,作者指出,如果机器人在一个非常严格的环境(通信极其受限)中接受训练,然后在非常宽松的环境(通信非常容易)中进行测试,或者反之亦然,它们的表现就不会像训练与测试条件匹配时那样出色。这表明,虽然该系统具有鲁棒性,但它在训练环境与所面临的现实世界环境较为相似时表现得最好。
简而言之,这篇论文表明,通过赋予机器人理解自身与任务及彼此之间关系的能力,并让它们通过同行比较而非中央教师进行学习,我们可以创造出在混乱的现实世界中更快、更聪明、效率更高的机器人团队。作者总结道,这种方法是应急响应等领域的有力进展,在这些领域,机器人需要在没有中央指挥中心的情况下快速协作,尽管他们也承认,对于更加动态和不可预测的环境,仍有许多工作要做。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。