Constrained Whole-Body Tracking for Humanoid Robots
本文介绍了 ConstrainedMimic,这是一个实时、可微的控制框架,它将操作空间控制(operational space control)与控制屏障函数(control barrier functions)集成到强化学习策略中,旨在为人形机器人强制执行任意的安全约束——例如碰撞规避和关节限制——且不会显著损害其跟踪性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一个人形机器人就像一位才华横溢、动作敏捷的舞者,通过试错(一个被称为强化学习的过程)学会了模仿人类的动作。这位舞者动作极快,能做后空翻或复杂的遥操作任务。然而,问题在于,这位舞者因为太渴望移动,可能会不小心被自己的脚绊倒、撞到桌子,或者扭伤关节导致损坏。他们学会了跳舞,但并没有学会“不要撞到东西”或“保持平衡”的规则。
这篇论文介绍了一个名为 ConstrainedMimic 的新系统。你可以把它想象成站在舞者身旁的一位极其警觉的安全教练。这位教练并不教舞者新的舞步,而是实时观察舞者的每一个动作,并在必要时轻轻地引导舞者的肢体,使其保持安全,同时又不会破坏舞蹈的韵律。
以下是该系统的工作原理,通过简单的概念进行分解:
1. 应用安全教练的两个位置
论文解释说,你可以将这种安全检查应用于机器人“大脑”的两个不同点:
- 输入端(计划): 在舞者开始移动之前,教练会查看“剧本”(来自人类或计算机的运动计划)。如果剧本说:“以一种会撞到自己脸的方式交叉双臂”,教练会在舞者看到剧本之前对其进行修改。这被称为约束重定向(Constressed Retargeting)。
- 输出端(动作): 有时剧本本身没问题,但舞者因为过于兴奋而动作过快,导致动作过冲并撞到物体。在这种情况下,教练会在舞者即将移动时,对实际的肌肉指令施加一个“刹车”或“转向修正”。这被称为动态安全过滤器(Dynamic Safety Filter)。
2. “隐形墙”类比
该教练背后的核心技术是被称为**控制障碍函数(Control Barrier Functions, CBFs)**的技术。
想象机器人正在走过一个充满隐形橡胶墙的房间:
- 碰撞规避: 如果机器人离桌子(或它自己的手臂)太近,橡胶墙就会产生推力。教练会计算出精确的推力大小,既能让机器人不接触桌子,又不会推得过头。
- 关节限制: 想象机器人的肘部有一根橡皮筋,防止它向后弯曲过度。教练确保机器人永远不会把这根橡皮筋拉紧到足以使其断裂的程度。
- 平衡(质心): 想象机器人站在一个微小的隐形平台(它的脚)上。如果机器人倾斜得太厉害,导致其“重心”开始偏离平台边缘,教练会立即将机器人的重量移回中心,以免其摔倒。
3. 为什么仅有一种检查是不够的
论文在模拟机器人(Unitree G1)上进行了测试,并发现了一些有趣的现象:
- “剧本”是不够的: 即使你给机器人一个“安全”的计划,由于它移动速度过快,机器人仍可能发生过冲并发生碰撞。这就像给司机一张安全路线图;如果他们开得太快,仍然可能会错过转弯。
- “动作”检查至关重要: 你需要教练来检查实际的动作(输出),以捕捉这些过冲行为。
- 最佳组合: 最安全的方法是使用两种检查。既修改计划,又修正动作。这就像拥有一个副驾驶,他既能修正地图,又能在司机转向时抓紧方向盘。
4. “最小干预”原则
该系统的一个关键特征是它的最小侵入性。
想象机器人正在尝试完成一项精细的任务,比如穿针引线。如果触发了安全约束(例如避免碰撞),教练并不会完全停止机器人的动作。相反,它会对动作进行最小幅度的调整,以确保安全,同时让机器人完成任务。它尽可能地尊重机器人的原始目标。
5. 速度与实际应用
该系统运行速度极快。它可以在标准计算机芯片(CPU、GPU 甚至 TPU)上以每秒 300 到 500 次的速度运行。
- 为什么速度很重要: 如果教练反应迟钝,机器人在教练做出反应之前可能就已经撞上了。因为这个系统如此之快,它可以捕捉到瞬间发生的错误,使其足以用于现实世界的应用。
结果总结
研究人员在模拟场景中测试了系统,包括:
- 自我碰撞: 机器人试图交叉双臂并撞到自己的脸。
- “横劈”动作: 一只人手快速向机器人的脸部移动(这是一个机器人未经过训练的场景)。
- 平衡: 机器人倾斜得太厉害以至于会摔倒。
研究结果非常明确:
- 没有教练,机器人经常发生碰撞或违反安全规则。
- 仅使用“计划”检查,效果有所改善,但由于速度原因仍会发生碰撞。
- 仅使用“动作”检查,虽然非常安全,但有时过于谨慎。
- 使用两者结合,机器人在几乎所有的测试中都保持了安全,既避免了碰撞又保持了平衡,同时仍能完成任务。
简而言之,ConstrainedMimic 提供了一种方法,可以将一个超敏捷、基于学习的机器人瞬间赋予一种它无法自行学习的“安全本能”,确保它不会伤害自己或他人,且无需重新训练机器人或显著降低其速度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。