想象一下,你想教机器人跳舞或表演武术。最简单的方法是给它看一段人类做该动作的视频。但问题在于:人类和机器人的构造截然不同。人类拥有灵活的脊柱和柔软的关节;而机器人则由刚性金属杆和电机组成。如果你只是告诉机器人“完全复制人类的臂部位置”,它可能会试图扭曲其金属躯体,导致损坏、摔倒,或者因电机力量不足而根本无法完成动作。
本文介绍了一种名为**直接动态重定向(Direct Dynamic Retargeting, DDR)**的新方法,以解决这一“翻译”难题。其工作原理可拆解为以下简单概念:
问题所在:“糟糕的翻译者”
目前,大多数机器人采用两步流程从视频中学习,作者将其比作一位在句子中间卡住的翻译者。
- 第一步(几何步骤): 系统首先观察人类视频,并询问:“机器人能在物理上做出的、最接近人类手臂和腿部位置的动作姿态是什么?”它忽略了机器人是否真的能在那种姿态下保持平衡。这就像要求人类单腿站立并手持重物,却只检查其腿部是否处于正确形状,而不考虑其是否会摔倒。
- 第二步(物理步骤): 随后,第二个系统试图修正第一步的结果。它将该“近乎正确”的姿态纳入计算机模拟中,尝试使其在物理上可行。
缺陷: 作者指出,第一步造成了“偏差”。由于机器人在第一步中被强制塑造成特定形状,第二步便陷入困境。它无法找到最佳的运动方式,因为它被困在试图修正一个原本就错误的形状上。这就像试图画一个完美的圆,却从方形轮廓开始;无论多么努力地平滑边缘,它永远无法成为一个真正的圆。
解决方案:“直接架构师”
作者的新方法DDR完全跳过了中间环节。
它不再询问“机器人最接近人类的姿态是什么?”然后再进行修正,而是提出一个不同的问题:“机器人如何运动,既能看起来像人类,又能遵循物理定律?”
- 类比: 想象你是一位建筑师,试图建造一座外观酷似著名悬索桥的桥梁,但使用不同的材料(以钢代石)。
- 旧方法: 你完全复制石桥的形状,然后尝试用钢材加固它。结果可能摇晃不稳,或需要不可能实现的支撑。
- DDR 方法: 你审视石桥的功能(它如何跨越间隙),并从头设计一座钢桥,以实现相同的效果,同时确保其完全符合钢材的物理特性。你并不强迫钢材看起来像石头;而是让钢材的物理特性引导设计,同时保持整体外观。
实际运作方式
该系统在物理模拟器中使用一个“智能猜测器”(基于采样的求解器)。它并非仅计算一条路径,而是尝试成千上万种机器人可能的运动方式。它保留那些满足以下条件的方案:
- 看起来像视频中的人类;
- 不会摔倒;
- 不会损坏机器人电机;
- 使机器人双脚稳固地踩在地面上(无滑动)。
实验结果
团队在真实机器人(Unitree H1-2)上测试了该方法,并与旧方法进行了比较。
- 更少摔倒: 旧方法生成的指令常导致机器人摔倒或脚部滑动。而 DDR 生成的指令在 99% 的情况下物理上是安全的。
- 更高精度: 由于 DDR 不再被困于修正“错误”的起始形状,机器人能够更紧密地跟踪人类动作。
- 更快学习: 当使用这些新指令通过人工智能(强化学习)训练机器人时,机器人学习速度更快,表现优于使用旧指令时的情况。
- 现实世界成功: 他们成功部署机器人在现实世界中执行复杂动作,如“手枪深蹲”(单腿站立下蹲)和“功夫”姿势,而无需为每个特定动作手动调整代码。
总结
简而言之,本文指出:不要试图强迫机器人完全复制人类的形状,然后再事后修正物理问题。 相反,应让机器人从一开始就动态地自行决定如何运动,仅将人类视频作为整体外观的参考。这将带来更安全、更精准且学习更快的机器人。
技术摘要:面向视频驱动的人形机器人模仿学习的直接动态重定向
问题陈述
模仿学习(IL)通过利用专家演示,为向人形机器人传授复杂技能提供了一条可扩展的途径。尽管近期进展使得从单目视频中提取人体姿态成为可能,但将这些人体运动转换到人形机器人上却面临一个根本性挑战:形态失配。人类与机器人在运动学(肢体比例、关节限制)和动力学(质量分布、惯量、驱动限制)方面存在显著差异。
当前最先进的方法通常依赖于两阶段流程:
- 几何重定向(GR): 使用逆运动学(IK)将人体关键点映射到机器人构型,忽略动力学约束。
- 间接动态重定向(IDR): 在物理仿真器中细化 GR 的输出,以确保动力学可行性。
作者指出了该范式的一个关键缺陷:GR 中的中间 IK 步骤引入了几何偏差。通过将搜索空间限制在运动学有效但动力学不可行的轨迹上,随后的 IDR 优化会偏离真正的动力学最优解。这导致次优的动力学行为、跟踪误差增加,以及下游强化学习(RL)智能体的学习效率降低。
方法论:直接动态重定向(DDR)
为了克服中间几何投影的局限性,作者提出了直接动态重定向(DDR),这是一个单阶段框架,能够直接从含噪视频数据中生成动力学可行的轨迹。
核心框架
- 公式化: 问题在任务空间(关键点轨迹)而非构型空间中进行公式化。目标是寻找控制序列 U,在满足轨迹必须位于可行性集 Fq0(机器人物理上可实现的轨迹)的约束下,最小化生成的机器人关键点轨迹与专家参考 xref 之间的距离。
- 优化求解器: 作者采用交叉熵方法(CEM),这是一种基于采样的模型预测控制(MPC)求解器。
- 与需要严格预定义接触序列的基于梯度的求解器(如 Crocoddyl)不同,CEM 基于采样的特性使其能够内在处理源自含噪视频数据的接触识别模糊性。
- 优化过程最小化一个增广距离度量,该度量包含空间跟踪项和相对形状匹配项(使用拉普拉斯矩阵),以在惩罚全局平移/旋转的同时,保留演示的局部结构形状。
- 输入数据: 该流程利用 VideoMimic 框架,通过 SMPL 模型从单目视频中提取人体关键点。参考信号包括躯干、肩膀、手和脚的轨迹。
模仿学习集成
一旦离线生成高保真、动力学可行的参考轨迹,它们就会被提炼为闭环 RL 策略。
- 策略训练: 使用演员 - 评论家架构(通过 IsaacLab 中的
skrl 库实现的 PPO)求解约束马尔可夫决策过程(CMDP)。
- 奖励结构: 奖励函数遵循 DeepMimic 方法,惩罚关节位置、速度、根姿态和末端执行器位置的偏差,同时强制执行安全约束(关节限制、力矩、脚部打滑)。
- 目标: 生成的策略旨在鲁棒地跟踪 DDR 参考,从初始化变化和外部干扰中恢复,以促进从仿真到现实的迁移。
主要贡献
- 新颖框架: 提出 DDR,这是一个基于 CEM 的 MPC 框架,它绕过了 GR/IDR 流程中的中间几何偏差,直接从视频演示中生成动力学可行的人形轨迹。
- 定量优越性: 证明消除中间几何偏差显著提高了重定向精度。在物理一致性和演示跟踪方面,DDR 在多种敏捷运动中优于 GR 和 IDR 基线。
- 下游学习效率: 实验证据表明,为 RL 智能体提供物理可行的参考轨迹可加速训练收敛,并增强敏捷和平衡行为的最终执行效果。
- 现实世界验证: 成功部署于 Unitree H1-2 人形机器人,实现了复杂运动(深蹲、功夫、手枪深蹲、平衡)的零样本仿真到现实迁移,无需针对特定任务进行手动调整。
实验结果
作者使用包含五种敏捷运动(深蹲、功夫、单脚平衡、手枪深蹲、平衡杆)的数据集,将 DDR 与 GR 和 IDR 基线进行了评估。
- 物理可行性: 由于忽略了接触动力学,GR 产生了高比例的动力学不可行片段(例如,深蹲为 21.74%,单脚平衡为 28.38%)。DDR 和 IDR 实现了近乎完美的可行性(大多数任务为 0.00%)。
- 接触序列精度: 与真实值相比,DDR 始终产生最低的接触序列错误率。IDR 的表现不如 DDR,证实了 GR 初始化引入的运动学偏差阻碍了 IDR 找到最优接触阶段的能力。
- 成功率: 在随机试验中,DDR 的成功率显著高于 IDR。例如,在“平衡杆”任务中,IDR 的成功率为 0%,而 DDR 达到了 66.67%。这表明 GR 引起的漂移通常会将 IDR 求解器拉入不稳定区域。
- 跟踪精度: 虽然 GR 显示出较低的原生跟踪误差(通过忽略可行性),但 DDR 在保持物理有效性的同时实现了相当或更好的跟踪精度。IDR 的表现始终不如 DDR,进一步验证了几何偏差的负面影响。
- RL 收敛: 基于 DDR 参考轨迹训练的策略收敛更快,并实现了比基于 GR 或 IDR 参考轨迹训练的策略更高的最终累积奖励。例如,在“手枪深蹲”任务中,DDR 在 79.6k 步内达到最终奖励的 90%,而 GR 需要 128.4k 步,IDR 需要 93.5k 步。
意义与局限性
论文声称,DDR 通过解决当前重定向流程中固有的“几何偏差”,代表了显著的前进一步。通过在任务空间中直接优化并使用物理感知求解器,DDR 提供了更高保真的参考轨迹,这些轨迹直接转化为更鲁棒、更高效的模仿学习。
适度声明与局限性:
作者承认 DDR 并非没有局限性:
- 目标完全定义在任务空间,这可能导致在某些场景下出现病态解或收敛速度变慢。
- 性能仍然对任务空间权重和初始化敏感,目前这些参数需要手动调整。
- 该框架目前仅限于特定运动,需要进一步扩展以处理来自野外网络视频的大规模、多样化运动变量集。
总之,这项工作确立了绕过中间运动学投影可以生成物理可行的参考轨迹,这些轨迹在跟踪精度和下游 RL 训练方面均更优越,并通过在全身人形机器人上的严格仿真和现实世界部署得到了验证。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。