← 最新论文
💻 computer science

A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer

本文提出了一种通过强化学习从头开始训练单一扩散策略的框架,该框架通过逆向课程生成和以目标为中心的表示进行增强,从而成功解决了稀疏奖励模拟中的多任务方块推移问题,并实现了向具有不同条件的真实世界环境的零样本迁移。

原作者: Haitong Ma, Haldun Balim, Yang Hu, Bo Dai, Na Li

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Haitong Ma, Haldun Balim, Yang Hu, Bo Dai, Na Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机械臂将一个方块推过桌面到一个特定的位置。现在,想象一下这个方块并不只是一个正方形;有时它是一个“T”形、“C”形、“L”形,甚至是某种你从未见过的奇怪的“I”形。桌面也可能是粘性的、滑溜的,或者介于两者之间。目标点也可能在一个全新的地方。

这篇论文是关于如何教机器人掌握这些混乱且多变的情景,而不需要人类每次都手把手地指导它具体该怎么做。

核心理念:一个大脑,多种形状

通常,当机器人学习执行任务时,它们使用一种叫做“行为克隆”(Behavior Cloning)的方法。这就像是一个学生在抄袭老师的作业。机器人观看成千上索专家推方块的视频,并试图模仿他们。但问题在于,如果你想让机器人处理每一种可能的形状和目标,你就需要为每一种组合都准备一个视频库。这显然是不可能的。

作者认为,这种“模仿”方法过于脆弱。如果你稍后想教机器人一个新任务,它往往会忘记如何做旧任务(这被称为“灾难性遗忘”问题)。

相反,这篇论文建议采用一种不同的方法:强化学习(RL)。想象一下机器人就像一个学走路的幼儿。它不看视频;它只是尝试、摔倒,当它接近目标时得到一点点“做得好”的奖励,然后再次尝试。论文表明,通过使用一种被称为**扩散策略(Diffusion Policy)**的特殊“大脑”,机器人可以仅通过试错法,从零开始解决许多不同的方块推送谜题。

秘诀:“重加权”的大脑

他们发现的核心在于一种训练这种扩散策略的新方法。在人工智能领域,一个“扩散策略”就像一位大师级的艺术家,他从满是静态噪声的画布开始,慢慢将其清理,直到出现一幅完美的画作。通常,这些艺术家是通过观察画廊里的完美画作(专家数据)来进行训练的。

作者发现了一种无需画廊即可训练这位艺术家的方法。他们创建了一个简单的规则:“如果一个动作看起来能让你获得高分,就让它更有可能发生。”他们通过根据动作表现出的优劣添加一个特殊的“权重”来实现这一点。这就像是给了机器人一个神奇的指南针,即使在黑暗中徘徊,它也能指向成功。

他们将其与传统的“高斯”(Gaussian)策略(类似于那些只猜测平均、稳妥动作的机器人)进行了对比。结果如何?

  • 旧方法(高斯): 在模拟中,标准算法(如 SAC、PPO 和 TD3)大多失败了。它们要么卡住了,要么放弃了。其中一种算法 SAC 设法完成了任务约 66.3% 的次数,但它耗时较长且表现不稳定。
  • 新方法(ESM): 作者提出的新方法 ESM 在模拟中 100% 地完成了任务。更棒的是,它平均仅用了 21.1 步 就完成了工作,而次优的方法则需要近 119 步。

“零样本”魔力

这是最令人兴奋的部分。机器人的整个训练过程都在计算机模拟器内完成。它从未见过真实的方块、真实的桌面或真实的机械臂。然后,作者将这个数字大脑直接接入实验室中的真实机器人。

他们没有重新训练它,没有进行微调,只是直接开启了它。这被称为 零样本模拟到现实迁移(Zero-Shot Sim-to-Real Transfer)。

他们测试了机器人应对以下情况的能力:

  • 不同的摩擦力: 他们将方块放在粘性的地垫和光滑的羊皮纸上。
  • 不同的重量: 他们使用了一个只有 1 厘米 厚的方块(原有的 4 厘米 厚度的四分之一)。
  • 不同的形状: 他们在模拟器中学到的形状以及一个从未见过的全新“I 形”方块上测试了机器人。

结果如下:

  • 在真实世界的桌面上,新方法(ESM)在 T 形、C 形和 L 形方块的 3 次测试中全部成功(3 出 3)。
  • 旧方法(SAC)在 T 形方块上完全失败(0 出 3),并在其他形状上也表现挣扎。
  • 甚至对于那个机器人从未见过的全新“I 形”方块,新方法在模拟中仍有 61% 的成功率,展示了其泛化能力。

什么行不通(以及他们排除了什么)

论文非常明确地指出了哪些方法对于这项特定工作效果不佳。

  • 仅仅复制专家(行为克隆): 作者认为,依赖大规模专家演示数据集是一个瓶颈。很难为每种可能的形状和目标收集到足够的数据。
  • 使用简单猜测的标准强化学习: 他们展示了使用“高斯”策略(假设答案通常只是一个简单的平均值)的标准算法无法处理具有不同形状方块的复杂推送任务。它们甚至无法在模拟中学会这项任务,更不用说迁移到现实世界了。
  • 缺乏计划的学习: 当他们移除特殊的“课程”(一种从简单目标开始并逐渐变难的训练进度)或特殊的方块位置描述方式时,机器人的表现显著下降。这证明了机器人确实需要这些特定的训练技巧才能成功。

他们有多确定?

作者对他们在模拟中的结果非常有信心,他们在模拟中运行了 400 万次 交互来训练机器人。他们以极高的精度测量了成功率和步数。

在现实世界中,他们在不同条件下测试了机器人的 36 个特定任务。他们不仅说“它成功了”,还测量了方块移动的距离和所用的步数。他们发现虽然现实世界很混乱,但机器人的表现依然保持稳健。然而,他们也承认,这种“零样本”魔力可能并不适用于每种类型的机器人任务,尤其是比“在平坦桌面上推方块”要复杂得多的任务。对于这些更难的任务,他们建议可能需要更多的工作来弥合计算机与现实之间的差距。

总结

这篇论文表明,你不需要一个专家视频库来教机器人复杂的、多任务的技能。通过使用一种通过新的、简单的奖励系统训练的智能且灵活的“扩散策略”,机器人可以学会推送各种形状和大小的方块,无论是在光滑还是粘稠的表面上,甚至可以处理它从未见过的目标——而这一切在准备好进入现实世界之前,都无需离开计算机模拟环境。这是迈向能够真正适应我们混乱多变的现实世界的机器人的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →