← 最新论文
💻 computer science

Learning Communication-Conditioned Generative Policies for Decentralized Multi-Agent Collision Avoidance

本文提出了一种基于流匹配策略(flow-matching policies)的去中心化、通信条件化生成框架,该框架利用特权离线数据进行训练,通过学习潜在意图交换来实现多智能体避障,在无需中心化规划的情况下,在模拟和真实场景中均实现了专家级性能和鲁棒泛化。

原作者: Prajwal Koirala, Mark Campbell

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Prajwal Koirala, Mark Campbell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在机器与人共同移动的拥挤空间里——无论是繁忙的仓库地面、城市街道,还是头顶的天空——安全取决于一个简单却困难的真理:每一个移动的物体都必须猜测其他物体下一步会做什么。几十年来,工程师们一直试图通过编写关于机器人如何反应的严格规则来解决这个问题,就像汽车的交通法规一样。当每个人都遵循相同的剧本且环境可预测时,这些规则运作良好。但在现实世界中,人群是混乱的,机器人往往无法看到周围的一切。它们可能会被墙壁挡住,或者它们的传感器可能无法发现快速移动的同伴。当机器人无法看到全貌时,它必须依赖自己有限的视野,这使得在没有中央计算机指挥所有人的情况下,很难避免碰撞。这种让许多独立的机器在没有中间“老板”的情况下安全协同移动的挑战,是机器人学中的一个基本问题。

康奈尔大学的一个研究小组开发了一种让这些机器学习如何在人群中导航的新方法。他们没有编程死板的规则,而是通过观察一个能够看到一切的“特权”专家,教会了一组机器人从经验中学习。其核心创新在于,机器人学会了相互交流,但不是通过语言或标准的无线电信号。相反,它们学会了交换能够总结自身意图的不可见、抽象信息。通过将这些隐藏的消息与它们能看到的局部信息相结合,机器人学会了预测他人的移动方式,并调整自己的路径以避免碰撞。结果是一个每个机器人都在独立行动,却又能与群体和谐共处的系统,即使它们之间的连接中断或存在噪声也是如此。

研究人员首先创建了一个充满四个机器人的数字训练场。他们让一个强大的计算机程序在模拟空间内进行导航,该程序可以获取每个机器人的精确位置和速度。这个“专家”从不发生碰撞,因为它预知了每个智能体的未来。研究人员随后要求他们的新型、更简单的机器人向这位专家学习其行为。然而,这里有一个限制:新的机器人不允许看到整个世界。它们只能看到自己的位置和最近的邻居,就像真实的机器人在黑暗或拥挤的房间里所看到的情况一样。为了弥补这一差距,研究人员给了机器人一种向彼此发送简短、压缩信号的方式。这些信号并非预先编程的;机器人必须自己摸索出哪些信息对于分享以避免碰撞是有用的。

学习过程就像一场关于理解与行动的两步舞曲。首先,机器人学会将它们的局部观测结果压缩成一条微小的消息,捕捉它们的“意图”——本质上就是它们下一步计划做什么。然后,它们将这些消息分享给附近的机器人。第二,每个机器人利用接收到的消息结合自身的局部视角,生成一个简短的移动计划。机器人并不是决定一个单一的转向或速度,而是想象未来几秒钟内的一系列动作。然后,它执行序列中的第一步动作,并立即根据新信息开始规划接下来的几秒钟。这种持续的循环使机器人能够保持灵活性,能够对人群的变化做出即时反应。

这种方法之所以特别聪明,是因为机器人学习交流的方式。研究人员并没有告诉它们要说什么。相反,机器人发现,为了避免碰撞,它们需要分享关于未来路径的某种特定隐藏信息。系统在训练时也设定为:即使没有这些消息,机器人也能仅凭自身的局部观测进行功能运作。这种设计意味着,如果通信链路失效,机器人不会陷入停滞或发生碰撞;它们只会回归到独立行动的状态,依靠自己的计划。研究人员发现,该系统具有极强的鲁棒性。即使在模拟场景中,当机器人失去彼此交谈的能力长达75%的时间时,它们仍然能够实现目标而不发生碰撞。机器人只是依靠前一刻制定的计划,保持移动的平滑与安全。

团队在包含四、六、八个机器人的模拟实验中测试了这种方法。令人惊讶的是,尽管他们仅在四台机器人的分组中进行了训练,但当增加机器人数量时,系统依然表现得同样出色,无需额外的训练。这表明机器人学习到的是一种通用的群体导航原则,而非仅仅记住了针对四个智能体的特定模式。在模拟中,机器人在四个智能体的协作场景下实现了接近97%的成功率,并且在群体规模翻倍时仍保持较高的成功率。此外,当部分机器人被设定为“自私”并忽略其他机器人时,它们也表现良好,这表明该系统可以处理协作与非协作行为混合的情况。

为了证明这不仅仅是计算机技巧,研究人员将完全在数字世界中训练的软件安装到了实验室里的四台小型物理机器人上。他们没有对代码进行任何微调,也没有针对现实世界重新训练机器人。这些配备了自有传感器和处理器的物理机器人必须在狭窄的空间内交换位置,并彼此穿过路径。尽管存在现实世界的噪声和缺陷,机器人仍成功完成了任务,既避开了彼此,又到达了目的地。这种“零样本迁移”(zero-shot transfer)——即系统在模拟训练后能立即在现实世界中运行——是向前迈出的重要一步。它证明了机器人真正学习到了安全交互的底层逻辑,而不仅仅是数字环境的具体细节。

研究还揭示了这种学习方法的一个独特特征:控制协调程度的能力。由于机器人学习如何基于自身观测与来自他人的消息的结合来生成运动,研究人员可以通过调节一个简单的旋钮,来控制机器人给予群体信号的权重。通过旋转旋钮,他们可以让机器人完全独立行动(忽略彼此),或者进行高度协调的移动(精准地在彼此间穿梭)。这种灵活性意味着系统可以适应不同的情况,从一个机器人可以自由移动的安静房间,到一个需要持续通信的混乱人群。

研究人员认为,这种方法为自主系统提供了一条新路径。传统方法通常依赖复杂的、手工编写的规则,或者需要一台中央计算机来管理交通,这往往是脆弱且缓慢的。通过使用一种能够预测动作序列并利用学习到的抽象信号进行通信的生成模型,机器人变得更像是一群鸟或一群鱼,复杂的群体行为从简单的局部交互中涌现出来。这项工作表明,机器可以在不需要共同语言或中央大脑的情况下,学习理解彼此的意图,为在我们共享的空间中部署更安全、更高效的机器人集群铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →