想象一个这样的世界:机器人不再是仅仅遵循严格脚本的笨重机器,而是能够穿梭于拥挤人群、躲避突然的推搡,并在不倒下保持平衡的敏捷伙伴。这就是“类人”机器人学的梦想——创造外观和动作都像人类一样的机器,以协助处理日常任务。但教机器人走路却出奇地难。与轮式机器人不同,直立双腿的机器人一直在与重力作斗争。如果你推它一下,它必须立即做出反应,通过转移重心和调整脚步来保持直立。长期以来,科学家们通过向机器人展示人类运动的视频并告诉它们,“完全模仿这些姿势”来教它们走路。但问题在于:如果机器人试图模仿特定的姿势,而受到推搡时,它可能会感到困惑,因为“完美的姿势”已不再符合现实。这就像是在有人不断改变节奏时试图跟着音乐跳舞;如果你只专注于完成精确的舞步,你就会踉跄跌倒。为了解决这个问题,研究人员现在开始关注那些看不见的力量——即动量和平衡的物理学原理——而不仅仅是可见的舞蹈动作。
本文介绍了一种名为“对抗动力学先验”(Adversarial Dynamics Priors, ADP)的新方法,这是一种巧妙的方法,旨在教类人机器人如何在不需要死记硬背每一个步骤的情况下,从碰撞和推搡中恢复。ADP 并不是强迫机器人模仿人类关节(如膝盖或肘部)的具体位置,而是教机器人去模仿物理性的“感觉”。你可以这样理解:当你走路时有人推你,你不会想“我需要将左膝移动15度”。相反,你的身体会本能地做出反应,通过移动重心并将脚更用力地踩向地面来防止摔倒。ADP 训练机器人去理解这些无形的力量——它的重量如何移动、它的脚对地面施加了多少压力,以及它的旋转动量如何变化。
研究人员利用计算机模拟创建了一个基于物理学的完美行走模式“库”。然后,他们训练了一个机器人 AI 进行行走,同时由一个“判别器”(一种智能裁判)检查机器人的无形物理特性是否与该库相匹配。如果机器人在受到推搡后开始摇晃或重心移动异常,裁判就会给它一个“差评”,迫使机器人学会如何立即自我纠正。结果令人印象深刻:在模拟实验中,使用 ADP 训练的机器人在受到突然推搡后的恢复速度比旧方法快了 47.9%,且在追踪速度方面的错误减少了 35.4%。论文表明,通过关注这些动态力量而非仅仅模仿姿势,机器人可以变得更加具有韧性,即使在周围环境变得混乱时也能保持站立。虽然这些测试是在虚拟世界中进行的,但团队也在硬件测试平台上展示了一个真实的机器人成功从推搡中恢复,这暗示了这种“物理优先”的方法很快就能帮助现实世界的机器人在不可预测的人类环境中穿行。
技术摘要:用于物理驱动类人机器人运动的对抗动力学先验 (Adversarial Dynamics Priors, ADP)
问题陈述
由于高自由度、欠驱动浮动基座动力学以及通过间歇性接触维持平衡的必要性,类人机器人的运动控制仍然比四足机器人控制更具挑战性。虽然基于学习的控制在利用运动数据集生成自然动作方面取得了成功,但现有方法在扰动韧性方面面临局限。
- 显式追踪 (Explicit Tracking): 诸如 DeepMimic 之类的方法依赖于追踪参考姿态和相位。虽然这些方法在生成自然运动方面非常有效,但在外部扰动将机器人推离参考轨迹时缺乏灵活性。
- 运动学先验 (Kinematic Priors): 对抗运动先验 (AMP) 通过匹配运动风格分布(关节姿态、速度、末端执行器状态)而非显式追踪来提高灵活性。然而,AMP 并没有直接对动力学层面的特征(如质心 CoM 运动、质心动量、接触力及接触状态)进行正则化,而这些特征对于在受到推搡后实现有效的平衡恢复至关重要。因此,AMP 可能会恢复可见的姿态,却留下欠阻尼的旋转动力学,或无法正确调节接触力。
方法论:对抗动力学先验 (ADP)
作者提出了 ADP,这是一个通过将运动风格特征从运动学特征替换为选定的动力学特征作为对抗正则化的目标来构建的框架。该方法无需对参考姿态或相位进行显式运动追踪。
参考数据集构建 (Ddyn):
- 作者并非使用完整的全身运动捕捉数据,而是使用基于单刚体动力学 (SRBD) 的轨迹优化 (TO) 来生成参考数据集。
- 该 TO 问题旨在最小化与指令速度的偏差,同时在满足 SRBD 一致性、接触激活和摩擦锥约束的前提下,惩罚过大的质心角动量和接触力。
- 这一过程产生了符合 SRBD 层级动力学的物理驱动运动轨迹(行走、奔跑、转向、侧步)。通过这些轨迹,可以提取动力学量(CoM 运动、质心动量、接触力、接触指示器)以形成参考分布。
动力学特征表示:
- ADP 定义了一个包含朝向坐标系下的 CoM 速度、质心角动量、平面角动量变化率、归一化足部接触力和二进制接触指示器的时刻级动力学特征向量 zt。
- 为了处理变化的指令,判别器的输入会以速度指令和瞬时追踪误差为条件,从而使参考分布与当前任务对齐。
- 至关重要的是,该方法使用动力学特征的时间窗口 (Ξt) 而非单个时间步。这使得判别器能够捕捉对于恢复至关重要的时序模式,例如接触切换、力调制和动量恢复。
对抗训练:
- 训练一个判别器,用于区分从 SRBD 衍生的参考数据集 (Ddyn) 中采样的窗口与策略展开生成的窗口 (Ξtπ)。
- 策略使用近端策略优化 (PPO) 进行优化,其总奖励由以下部分组成:
- rtG:任务奖励(运动)。
- rtD:对抗动力学先验奖励,源自判别器的输出。该奖励鼓励策略诱导的动力学特征保持在参考分布附近。
- rtR:正则化项。
- 策略通过保持其动力学特征处于参考分布的支持集内来学习从扰动中恢复,而不会被强迫去追踪特定的关节姿态。
核心贡献
- 对抗动力学先验 (ADP): 引入了一种使用动力学特征(CoM、动量、接触力)进行对抗正则化的方法,取代了运动学特征,消除了对参考姿态或相位追踪的需求。
- 扰动敏感的动力学表示: 提供了一种时序动力学特征的公式化表达,能够比关节级运动学特征更直接、更快速地暴露受推搡后的瞬态过程(在动量和接触力方面)。
- 扰动恢复评估: 通过全面的仿真和硬件验证,证明了 ADP 在类人机器人扰动恢复方面优于 Vanilla RL、AMP 以及直接的动力学特征匹配基线。
实验结果
作者在 29 自由度的类人机器人(Unitree G1)上进行了仿真评估,并提供了定性的硬件演示。评估将 ADP 与 Vanilla RL、AMP 以及“动力学奖励”基线(使用点对点特征匹配)进行了对比。
- 扰动恢复: 在外部速度脉冲(高达 4.5 m/s)下,ADP 实现的 80% 成功脉冲阈值 (J80) 为 115.5 N·s,比最强的基线(AMP,99.0 N·s)提升了 16.7%。
- 恢复指标: 与 AMP 相比,ADP 将平均恢复时间减少了 47.9%(从 4.76s 降至 2.48s),并将速度追踪误差降低了 35.4%(从 1.30 m/s 降至 0.84 m/s)。
- 表示敏感性: 分析表明,所提出的动力学表示在冲击发生 20 ms 后即可检测到扰动引起的瞬态(达到基线偏差的 6.0 倍),而运动学表示则需要 160 ms(达到 4.3 倍偏差)。
- 消融实验:
- 去除质心角动量使成功率降至 45.3%。
- 去除接触指示器(二进制接触状态)导致性能下降最为显著,成功率降至 30.5%,且恢复时间增加至 8.82s,凸显了接触时序对对齐的重要性。
- 研究发现时间窗口长度 K=8 是最优的,它在时序上下文需求(接触切换)与训练稳定性之间取得了平衡。
意义与主张
论文声称 ADP 通过在动力学层面进行正则化,成功解决了运动学先验在扰动恢复方面的局限性。通过利用基于 SRBD 衍生的轨迹作为动力学特征的参考分布,该方法鼓励策略学习物理上具有基础(符合动量和接触约束)的恢复行为,而不会受到显式运动追踪的僵化限制。
作者指出,虽然 ADP 提高了鲁棒性,但它并未显式强制执行关节级的运动自然度。他们建议未来的工作可以将动力学先验与运动学先验结合,以同时实现鲁棒性和自然度。此外,论文承认为了公平起见,与 AMP 的比较使用了相同的基于 TO 衍生的参考源,而非高质量的基于运动捕捉的 AMP 基线,因此关于 TO 衍生先验与基于动捕先验之间差距的表征留待未来研究。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。