← 最新论文
💻 computer science

Continual Domain Randomization

本文提出了一种名为持续域随机化(CDR)的新方法,该方法将域随机化与持续学习相结合,通过在仿真参数的子集上顺序训练强化学习策略,从而克服同时随机化的次优性,并在机器人任务中实现鲁棒的仿真到现实迁移。

原作者: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人拿起一个杯子。通常最聪明的方法是让机器人在计算机模拟中先练习数百万次,这样就不会弄坏真实的机器人或伤害任何人。但问题在于:计算机模拟永远无法与真实世界完全一致。真实的机器人可能稍重一些,电机可能稍慢一些,或者传感器可能有点“噪声”。这种差异被称为“现实差距”。如果你在完美的模拟中训练机器人,当你把它放到现实世界中时,它往往会惨败,因为它学会了依赖模拟的完美性。

为了解决这个问题,科学家们使用了一种称为域随机化(Domain Randomization)的技巧。他们不是试图让模拟变得完美,而是故意把它弄乱。他们在一次运行中让机器人变重,下一次变轻,添加虚假的传感器噪声,或延迟控制。其理念是:如果机器人学会处理所有这些“混乱”的版本,它就足以应对现实世界,因为现实世界只是另一种“混乱”的版本。

旧方法的缺陷
传统方法就像试图在第一天就跳进充满强流、巨浪和冰冷海水的暴风雨海洋中学习游泳。这太难了!机器人会感到不知所措、困惑,并学会糟糕的策略(或者根本无法学会任何东西),因为任务过于困难。

新解决方案:持续域随机化(CDR)
本文的作者提出了一种更聪明的学习方法,称为持续域随机化(Continual Domain Randomization, CDR)。这就像学习开车:

  1. 从简单开始:首先,你在一个空旷、完美的停车场学习驾驶,没有风,没有其他车辆,轮胎也完美无缺。你掌握了基础知识。
  2. 一次增加一个挑战:一旦你擅长于此,不要突然把你扔进飓风里。相反,你只添加一个新挑战。也许你在雨中驾驶。一旦你掌握了雨中驾驶,就添加风。一旦你掌握了风,就添加繁忙的交通。
  3. 记住所有内容:棘手的部分是,当你学会在雨中驾驶时,你不应该忘记如何在干燥的路面上驾驶。这就是“持续学习”部分发挥作用的地方。机器人使用一种特殊的记忆技术(称为弹性权重巩固,Elastic Weight Consolidation),它充当“安全网”。它允许机器人学习新技能(如处理雨水),而不会“忘记”旧技能(在干燥路面上驾驶)。

他们如何测试
研究人员在两项任务上测试了这一想法:

  • 到达:机械臂尝试触摸特定点。
  • 抓取:一项更复杂的任务,机械臂必须找到一个盒子,完美对齐其夹爪,并将其拿起。

他们将这种“循序渐进”的方法(CDR)与另外两种方法进行了比较:

  • “完美”模拟器:仅在干净、完美的世界中训练(这在现实中会失败)。
  • “混乱”模拟器:将所有问题(雨、风、交通)同时抛给机器人。
  • “健忘”方法:逐个添加问题,但不使用记忆安全网(因此机器人会忘记之前的步骤)。

结果
结果令人印象深刻:

  • 使用CDR训练的机器人在模拟中有效地学习了。
  • 当他们把机器人移到现实世界时,其表现优于或等同于在“混乱”模式下训练的机器人。
  • 至关重要的是,CDR 更加稳定。无论他们以何种顺序添加挑战(先雨还是先风),机器人仍然能很好地学习。然而,“健忘”方法在挑战顺序改变时则显得吃力。

简而言之
这篇论文表明,与其一次性让机器人淹没在随机变量的海洋中,不如循序渐进地教导它,一次增加一个难度,同时确保它能记住如何处理之前的那些。这创造了一个机器人,它准备好应对混乱、不可预测的现实世界,而无需在训练期间在现实世界中进行测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →