← 最新论文
🤖 AI

What Matters for Simulation to Online Reinforcement Learning on Real Robots

通过一项涉及三种机器人平台、包含100次真实世界训练运行的大规模实证研究,本文确定了能够使物理机器人实现稳定在线强化学习的特定且鲁棒的设计选择,同时揭示了某些广泛使用的默认设置其实并无实效。

原作者: Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

发布于 2026-07-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下教机器人走路、拿起杯子或驾驶汽车。长期以来,科学家们一直试图通过让机器人在一个完美的数字模拟世界——即视频游戏世界中进行数百万次的练习来完成这项任务。这就像飞行员在飞行模拟器中训练一样:安全、快速且廉价。但问题在于,现实世界是混乱的。地板并不完全平整,轮胎会发生计算机未曾预见的打滑,摄像机看到的景象也与数字渲染器不同。当你把一个在完美游戏中训练出的机器人放到真实的地面上时,它往往会绊倒、掉落物品或发生碰撞。这种“完美的”游戏与“混乱的”现实之间的差距,是机器人领域最大的障碍。

为了解决这个问题,研究人员使用了一种被称为“强化学习”(Reinforcement Learning, RL)的技术。把强化学习想象成一个非常执着的学生,通过试错来学习。机器人尝试一个动作,获得一个“奖励”(比如成功得分)或“惩罚”(比如发生碰撞),然后调整自己的大脑以在下次做得更好。核心问题在于:我们能否让机器人在实际移动的过程中——而不仅仅是在游戏中——进行学习?这被称为“在线学习”(online learning)。这是梦寐以求的终极目标,因为它意味着机器人可以即时适应新情况,就像人类在光滑路面上练习后,转而在颠簸的小路上学习骑自行车一样。但直到现在,通过真实的硬件以这种方式教导机器人一直存在风险、不稳定,且往往既浪费时间又浪费金钱。

这篇由苏黎世联邦理工学院(ETH Zurich)和 Google DeepMind 的研究人员撰写的论文提出了一个非常实际的问题:“如果我们已经拥有了一个在模拟器中学习过的机器人,我们需要调整哪些特定的设置,才能让它在现实世界中安全且成功地学习?”他们并没有发明一种全新的、神奇的算法。相反,他们扮演了机械师的角色,利用标准的、现成的学习工具,在三种截然不同的机器人上进行了超过 100 次不同的训练运行:一个机械臂(Franka Emika Panda)、一个四足狗机器人(Unitree Go1)以及一辆遥控赛车。

他们发现,这些学习机器人的常规“默认”设置在从模拟过渡到现实时实际上是危险的。如果你只是把一个在模拟器中训练好的大脑接入真实的机器人并立即开始学习,机器人往往会忘记它所知道的一切,并陷入混乱。作者发现,这是因为机器人的“评论家”(critic,即判断一个动作好坏的部分)会对物理规律的突然变化感到困惑。为了阻止这种情况,他们开发了一个简单且可靠的方案。

首先,他们发现必须保留一份包含旧模拟器数据的“记忆”,并将其与新的现实世界数据混合在一起。这就像在做作业时把教科书开着一样;如果你在开始学习的瞬间就把教科书扔了,你可能会忘记基本规则。其次,他们发现机器人需要一个“热身”阶段,即在被允许改变想法之前,先用它旧的模拟器大脑进行几次练习。最后,也是最重要的一点,他们发现机器人的“大脑”(决定做什么的部分)更新的速度需要比它的“判断”(从错误中学习的部分)慢得多。如果大脑改变得太快,它会被混乱的现实世界搞糊涂。通过放慢大脑的更新速度并保持判断的稳定,机器人可以在短短几分钟的现实世界训练中,学会抓取方块、行走而不摔倒,并高精度地停好赛车。

这篇论文表明,通过这些特定的、细致的调整,标准的学习方法可以在真实硬件上可靠地运行。他们不仅仅是在模拟,而是直接在实际机器上运行,证明了要让机器人在现实世界中学习,你不需要全新的超级算法——你只需要更聪明地处理数据喂送的方式,以及控制它们改变想法的速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →