SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions
SafeExplorer 为物理机器人上的强化学习引入了一种无偏策略梯度方法,该方法消除了由确定性恢复干预引起的偏差,在显著减少训练期间跌落次数的同时,与标准 PPO 相比保持或提高了最终性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一只机器狗如何奔跑。你想让它通过实践来学习,但有一个难点:如果机器狗在现实世界中摔倒,可能会折断腿或撞到墙壁。你不能像在电子游戏中那样直接按下“重置”键。每一次摔倒都会消耗金钱和时间。
为了防止机器人损坏,你聘请了一位“安全教练”。这位教练观察着机器人的奔跑过程。一旦机器人开始摇晃或踏出安全区域,教练就会接管控制权,引导机器人回到站立状态,然后让它再次尝试。这挽救了机器人免于坠毁,但也产生了一个隐蔽的问题,影响了学习算法。
问题:“幽灵”老师
机器人的大脑(AI)认为它正在从自己的错误中学习。但因为安全教练经常介入,机器人实际上是在从自己的动作和教练的动作混合学习。这就像一个学生试图学习数学,但每当学生遇到困难时,老师就会在一旁低声提示答案。如果学生稍后尝试独立解决问题,他们可能会感到困惑,因为他们从未真正练习过那些困难的部分。
更糟糕的是,如果安全教练是一个僵化的、基于规则的系统(比如一个总是执行相同操作来修复跌倒的计算机程序),那么用于解决这种困惑的标准数学技巧就会失效。这些技巧会尝试除以零,这在数学上是行不通的。
解决方案:SafeExplorer
研究人员开发了一种新的学习方法,名为 SafeExplorer。把它想象成一个非常聪明的学生,它知道什么时候该忽略老师的低声提示。
它是这样工作的,运用了三个巧妙的技巧:
“遮罩式”记分卡:
通常,当机器人学习时,它会观察自己所走的每一步。SafeExplorer 会给教练接管的步骤加上一个“遮罩”。它会说:“我们只从你采取的步骤中学习。”在计算如何改进时,它完全忽略教练的行为。这解决了数学问题,即使教练是一个没有“概率”概念的僵化程序,也不需要知道教练的具体思考方式。跌倒时的“水晶球”:
当机器人在安全区域内时,它必须预测下一步会发生什么。但当安全教练介入时,路径往往是可预测的(尤其是当教练是一个僵化的程序时)。SafeExplorer 使用一个“水晶球”(闭式数学公式)来准确预知在这些教练主导的时刻会获得什么样的奖励。它不需要通过试错来猜测或学习这些特定步骤,它只需知道答案,这使得学习过程更快。“仅限成功”的模仿者:
有时,安全教练试图修复一次跌倒,但失败了,机器人仍然摔倒。SafeExplorer 有一条规则:“只有当教练成功救场时,才去模仿教练。”如果教练试图修复一次摇晃但机器人仍然摔倒,机器人就会忽略这次尝试。它只从教练成功的挽救中学习。这防止了机器人从并不完美的教练那里学到坏习惯。
结果:更少的跌倒,更好的奔跑
团队在三种不同的机器人场景下测试了它:一只快速的猎豹型机器人、一只四足蚁型机器人,以及一台名为 Unitree Go1 的真实四足机器人。
- 在猎豹机器人身上: 与标准方法相比,SafeExplorer 在训练期间减少了 233 倍的跌倒次数。
- 在蚂蚁机器人身上: 它减少了 48 倍的跌倒。
- 在 Go1 机器人身上: 它减少了 26 倍的跌倒。
在所有案例中,机器人都学会了像以前的方法一样奔跑(甚至更好),但它是以极少的碰撞次数完成的。
“不可靠教练”测试
最令人印象深刻的部分发生在“蚂蚁”机器人身上。在这个场景中,安全教练的表现其实很差——它经常无法救回机器人。依赖教练的标准方法完全失败了,导致了数千次碰撞。然而,SafeExplorer 是唯一成功的方法。因为它只在教练真正成功时才进行模仿,所以它学会了避开教练会失败的情况,最终学会了在不需要教练的情况下自主奔跑。
这意味着什么
这并不是一个能让机器人永不摔倒的魔杖。它是一种更聪明的训练方式,让机器人在学习过程中摔得更少。研究人员表明,通过诚实地对待谁在控制(是机器人还是教练),并且只向成功的挽救学习,你就可以在真实的硬件上训练机器人而不损坏它们。
该论文在数学上证明了这种方法是无偏的(不会误导机器人),并通过模拟展示了其效果极其出色。它表明,对于需要在真实硬件上学习的机器人来说,忽略安全干预带来的“噪声”是保持安全和快速学习的关键。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。