← 最新论文
💻 computer science

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

本文提出了一种相位分解的强化学习框架,该框架通过将任务分解为经过优化的阶段,并结合集中式训练与具备安全性感知能力的同步机制,使模块化、可重构的机器人系统能够可靠地执行分布式多机器人月球货物运输任务,并通过在 JAXA 测试设施进行的仿真及真实世界实验进行了验证。

原作者: Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用两个截然不同的机器人,将一架巨大且脆弱的钢琴从崎岖不平、布满沙子的地面上搬运走。一个机器人是一个坚固的四轮小车,另一个则是一个长而灵活的机械臂。它们在物理上与钢琴相连,构成了一个整体团队。

这个问题在于移动一个沉重的共享物体是非常棘手的。如果小车移动太快,而机械臂还在抬升,钢琴可能会倾斜;如果机械臂用力过猛,而小车正在转向,连接处可能会断裂。在月球上进行这项任务会带来更多麻烦:地面凹凸不平,机器人可能会陷入沙地,而且由于信号延迟,它们无法与人类控制员进行即时通信。

本文介绍了一种用于这些机器人的新“大脑”,以解决这一问题。研究人员并没有尝试教机器人一套涵盖整个工作的庞大且复杂的规则,而是将任务分解成了三个简单的、截然不同的章节。他们称之为相位分解强化学习(Phase-Decomposed Reinforcement Learning)。

以下是其工作原理,使用了简单的类比:

1. 将工作分解为三个章节

把这次任务想象成一场分为三个幕次的戏剧。机器人不会试图一口气演完整场戏,而是专注于一个场景一个场景地进行。

  • 第一幕:抬升。 机器人必须轻轻地将货物从地面抬起。其“大脑”教它们如何均匀地抬升,以免货物倾斜或摇晃。这就像两个人试图抬起一个重箱子;如果一个人抬得比另一个人快,箱子就会旋转。这里的目标是纯粹的平衡。
  • 第二幕:移动。 一旦货物处于空中,机器人就会切换模式。现在,它们只需要平稳地向前行驶,不要让货物剧烈晃动。这就像端着一盘满杯咖啡走路;你关注的是步伐稳健,而不是如何抬起。
  • 第三幕:放置。 最后,它们需要将货物轻轻地放下。这需要一种“轻柔的触感”,在撞击前减速,以免货物坠落。

2. “导演”与“演员”

研究人员使用了一种被称为**中心化训练、去中心化执行(Centralized Training with Decentralized Execution)**的巧妙训练方法。

  • 中心化训练(排练): 想象一位在电影制片厂里的导演,他能看到全局。在“排练”(发生在计算机模拟中)期间,导演同时观察两个机器人和货物。导演会告诉它们:“你移动得太快了!”或者“你倾斜得太多了!”这有助于机器人快速且安全地学习完美的编舞。
  • 去中心化执行(正式演出): 当真正的表演开始时(在实际硬件上),不再有导演在旁观看。每个机器人都必须独立行动,仅依靠自身的传感器(如自己的轮子和关节)以及它对货物位置的感知。然而,因为它们已经一起完成了完美的排练,所以它们知道如何在不需要不断交流的情况下实现精确协作。

3. 安全“交通警察”

即使经过良好的训练,现实生活依然是混乱的。轮子会在沙地上打滑,电机也会有延迟。为了防止机器人发生碰撞,系统配备了一个同步层(Synchronization Layer)。

你可以把它想象成一名严格的交通警察。即使机器人 A 想快速前进,交通警察也会检查机器人 B。如果机器人 B 掉队了,警察会说:“等一下!我们要同步移动。”它会强制较快的机器人等待或减速,从而使整个团队保持同步。这防止了可能损坏货物或机器人的“拉锯战”。

4. 结果

团队通过两种方式测试了该系统:

  1. 在模拟中: 他们在模拟月球环境的计算机世界中运行了数千次虚拟试验。机器人学会了完美地抬升、移动和放置货物。
  2. 在现实世界中: 他们将机器人带到了日本一个看起来像月球的设施(一个多沙、不平整的测试场)。他们使用不同的重物(雪橇、一个箱子,以及一个装有砖块的箱子)进行了测试。

结果:
机器人在所有三个阶段都成功移动了货物。它们能够处理不同的重量和复杂的沙地环境,且没有导致货物掉落或倾斜。

为什么这很重要(根据论文所述):
研究人员曾尝试训练机器人使用一个单一的“单体式(monolithic)”大脑来完成整个工作(抬升、移动和放置)。那次尝试失败了;机器人无法学习到稳定的策略,并且不断发生碰撞。通过将任务分解为不同阶段并使用“交通警察”进行同步,他们证明了通过教机器人专注于一个步骤,可以解决月球上复杂的协作任务,就像人类做事一样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →