Stubborn: A Streamlined and Unified Reinforcement Learning Framework for Robust Motion Tracking and Fall Recovery for Humanoids
本文提出了“Stubborn”,这是一个统一的强化学习框架,通过采用偏航对齐表示、一种旨在鼓励在不稳定状态下进行探索的基于伯努利分布的概率终止机制,以及一种旨在提高训练效率的自适应采样策略,将鲁棒运动追踪与人形机器人跌倒恢复集成在一起。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下正在教一个机器人跳舞。通常情况下,如果机器人绊倒并摔倒了,老师(计算机程序)会立即停止课程,说“游戏结束”,并将机器人重置到起始位置。机器人永远没有机会学习如何爬起来,因为它从未被允许在地上停留足够长的时间来摸索方法。
这篇论文介绍了一种名为 Stubborn 的新系统,它改变了这种方法。Stubborn 不会在机器人踉跄时放弃,而是教机器人变得“固执”——即使在摔倒后,也要坚持尝试重新站起来,同时学习完美地跳舞。
以下是其工作原理的拆解,通过简单的概念进行说明:
1. “以头为先”的视角(偏航角对齐追踪)
想象你正在试图跟随一位舞伴。如果你感到头晕并失去了对“北”方的感知,你可能会试图转动整个身体来纠正方向,从而浪费能量并搞乱你的舞步。
Stubborn 教会机器人忽略“北”的方向,而只关注自己的身体和地面。它将视角与自己的头部(偏航角/yaw)对齐。这样一来,如果机器人被推搡或旋转,它不会因为弄不清自己在房间里的位置而惊慌失措;它只需专注于保持平衡并相对于自身进行舞蹈动作。这使得机器人不太容易产生“晕眩感”。
2. “也许,也许不”规则(概率性终止)
在旧的训练方法中,如果机器人犯了大错(比如摔倒),训练课程会立即结束。这就像一名学生数学考试不及格,老师在他们尝试解决问题之前就立刻把他们赶出了教室。
Stubborn 使用了一个聪明的技巧,叫做概率性终止(Probabilistic Termination)。当机器人犯了大错时,程序不会立即结束课程,而是投掷一枚虚拟硬币。
- 正面: 课程结束。
- 反面: 课程继续!
这给了机器人一个“宽限期”,让它留在地上进行尝试。它学到了即使摔倒了,它也有机会弄清楚如何重新站立。因为机器人不会立即受到“游戏结束”的惩罚,它自然而然地发现了如何在没有专门老师指导如何站立的情况下,自行恢复平衡。
3. “专注于难点”策略(自适应采样)
想象你正在练习一段钢琴曲。你完美地演奏了简单的部分,但总是在一个特定的、困难的和弦上出错。普通的老师可能会让你每次都从头到尾完整地演奏整首歌,导致你练习那个难点的时间非常少。
Stubborn 就像一位聪明的教练,观察你的演奏。如果它看到你在那个困难的和弦上踉跄,它会说:“好吧,让我们就在那个难点之前的时刻重新开始。”它改变了概率,让机器人把更多时间花在练习那些困难、摇晃的时刻,而不是那些轻松、流畅的部分。这使得机器人的学习速度更快,因为它将精力精准地集中在需要的地方。
4. 结果:一个机器人,两种技能
最棒的部分是,Stubborn 不需要两个不同的老师——一个教跳舞,一个教摔倒。它使用同一个大脑(单一策略)来完成这两件事。
- 它学会了追踪复杂、快速的动作(如舞蹈或武术)。
- 它学会了从强力的推搡或摔倒中恢复。
研究人员在真实机器人(Unitree G1)和计算机模拟中测试了 Stubborn。结果显示,与其它方法相比,Stubborn 在追踪动作方面表现更好,且在从摔倒中恢复的能力上也出色得多。它不仅能在摔倒中生存下来,还学会了如何站起来并继续跳舞,而这一切都不需要专门针对恢复过程的指令。
简而言之: Stubborn 是一种拒绝让机器人在跌倒时放弃的训练方法。通过让机器人在“混乱”的时刻多停留一会儿,并把练习重点放在最难的部分,它创造出了一个既是优秀的舞者,又是顽强的生存者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。