这篇论文介绍了一个名为 OmniTrack 的新系统,它的核心目标是让人形机器人(比如像人一样的机器人)能够像真人一样灵活、稳定地运动,无论是走路、跳舞,还是做高难度的空翻。
为了让你更容易理解,我们可以把机器人学习运动的过程想象成**“教一个刚出生的婴儿学走路”,而 OmniTrack 就是那位“超级耐心的教练”**。
1. 以前的问题:为什么机器人学不会?
想象一下,你想教机器人跳舞。你给它看一段人类跳舞的视频(参考动作)。
- 现实差距(Embodiment Gap): 人类有肌肉、骨骼和独特的身体比例,而机器人是金属做的,关节有限制,重心也不同。
- 数据噪音: 人类跳舞时,脚可能会轻微滑一下,或者身体悬空(比如跳起来)。如果直接把视频里的动作“复制”给机器人,机器人可能会因为试图模仿“脚悬空”而摔倒,或者因为试图模仿“脚滑”而打滑。
- 结果: 机器人陷入了两难:是死板地模仿视频(导致摔倒),还是为了站稳而放弃模仿(导致动作变形)?以前的方法很难平衡这两者,导致机器人学一会儿就“崩溃”了,或者只能学简单的动作。
2. OmniTrack 的解决方案:两步走的“超级教练”
OmniTrack 没有试图让机器人一次性解决所有问题,而是把过程分成了两个阶段,就像先让教练在脑子里“预演”,再让机器人“实战”。
第一阶段:在虚拟世界里“去伪存真”(物理一致性生成)
- 比喻: 想象教练(AI 策略)戴着一副**“上帝眼镜”**(拥有所有虚拟信息,比如全局位置、速度、接触点),在电脑模拟器里看人类跳舞的视频。
- 做了什么: 教练发现视频里有些动作机器人根本做不到(比如脚悬空、穿模)。于是,教练利用“上帝眼镜”的信息,重新编排了这些动作。它保留了舞蹈的风格和节奏,但把那些“不可能实现”的动作修正成了“符合物理定律”的动作。
- 例子: 如果视频里人跳起来脚离地 1 米,教练会算出机器人跳起来脚离地 0.8 米是安全的,并把这个修正后的动作记下来。
- 结果: 生成了一套**“完美且可行”**的参考动作库。这套动作既像人,又绝对符合机器人的物理极限。
第二阶段:在现实世界里“实战演练”(通用运动跟踪)
- 比喻: 现在,机器人上场了。但它没有“上帝眼镜”,它只能靠自己的传感器(就像人闭着眼睛只能靠感觉)。
- 做了什么: 机器人看着教练刚才生成的那套“完美参考动作”进行练习。
- 因为参考动作已经是“物理可行”的,机器人不需要再分心去纠结“这个动作会不会让我摔倒”。
- 它可以全心全意地学习**“如何精准地模仿”**。
- 结果: 机器人学会了在真实世界中,即使面对复杂的动作(如空翻、侧手翻)或突发的干扰(如被推了一下),也能稳稳地执行任务,甚至能连续运动好几个小时。
3. 这个系统有多厉害?(实际效果)
论文展示了 OmniTrack 在真实机器人(Unitree G1)上的惊人表现:
- 全能选手: 它不仅能走、跑、跳,还能做侧手翻、后空翻这种高难度杂技。
- 超长待机: 它可以连续稳定运行超过一个小时,不会像以前那样练几分钟就累趴下或摔倒。
- 实时遥控(Teleoperation): 这是最酷的部分。人类操作员可以通过 VR 眼镜或动作捕捉设备,实时指挥机器人。
- 即使操作员的手抖了、动作不连贯了,OmniTrack 的“第一阶段”会自动把这些**“抖动、不合理的指令”过滤并修正成“平滑、合理的动作”**,然后让机器人执行。
- 这就好比:你指挥一个笨拙的舞伴,他虽然动作有点乱,但你的“超级教练”会自动帮他调整步伐,让他跳出来的舞依然优雅流畅。
总结
OmniTrack 的核心思想是:
不要指望机器人一边学动作,一边还要自己解决“这个动作合不合理”的问题。
先把“合不合理”的问题在虚拟世界里彻底解决掉,生成一套完美的“标准答案”,然后再让机器人去背这道题。
这种方法让机器人从“笨拙的模仿者”变成了“灵活的表演者”,能够真正理解并执行人类复杂的动态指令,是迈向通用机器人控制的一大步。
OmniTrack 论文技术总结
1. 研究背景与问题定义 (Problem)
核心问题:
在人形机器人通用运动跟踪(General Motion Tracking)任务中,现有的方法面临一个根本性的矛盾:**跟踪保真度(Tracking Fidelity)与物理稳定性(Physical Stability)**之间的冲突。
具体挑战:
- 形态与动力学差异(Embodiment Gap): 人类演示数据(Motion Capture)与人形机器人在运动学、身体比例和自由度上存在显著差异。直接重定向(Retargeting)会导致参考运动中出现物理上不可行的伪影(Artifacts),如脚部穿透地面、身体悬浮(Floating)、脚底打滑(Foot Skating)以及质心运动不一致等。
策略学习的困境:* 现有的策略试图在部分可观测(Partial Observability)的设定下,同时学习“精确跟踪参考运动”和“维持机器人物理稳定”。由于参考运动本身包含物理错误,策略被迫在“盲目跟踪错误指令”和“保持平衡”之间进行隐式的、难以预测的权衡。
- 泛化能力受限: 这种内在冲突导致策略难以泛化到未见过的运动类型,特别是在高动态(如空翻)和丰富接触(Contact-rich)的场景下,极易发生动态失败。此外,在实时遥操作(Teleoperation)中,输入数据的噪声和抖动会进一步加剧不稳定性。
2. 方法论 (Methodology)
为了解决上述问题,作者提出了 OmniTrack,这是一个两阶段学习框架,其核心思想是显式地将“物理可行性”与“通用运动跟踪”解耦。
阶段一:物理运动生成 (Physical Motion Generation)
- 目标: 将原始的、包含物理伪影的参考运动转化为严格符合机器人动力学约束的物理可行运动轨迹。
- 实现方式:
- 在仿真环境中训练一个特权通用策略(Privileged Generalist Policy)。
- 输入: 包含完整的仿真状态信息(全局位置、速度、接触状态等),这些是真实机器人无法获取的“特权信息”。
- 过程: 利用物理模拟器进行轨迹展开(Trajectory Rollout)。策略利用完整的动力学知识,在保持原始运动风格的同时,修正所有物理不可行的伪影(如消除穿透和悬浮)。
- 输出: 生成高质量、动力学一致(Dynamics-consistent)的参考轨迹,作为阶段二的训练目标。此阶段不包含观测噪声和域随机化,以最大化重建保真度。
阶段二:通用运动跟踪 (General Motion Tracking)
- 目标: 训练一个能够在真实硬件上鲁棒执行多样化运动的通用控制策略。
- 实现方式:
- 输入: 仅使用真实机器人可用的本体感知信息(关节角度、速度、根节点姿态、角速度、上一时刻动作等),模拟真实部署时的部分可观测条件。
- 训练数据: 使用阶段一生成的“物理可行参考轨迹”作为目标,而非原始人类数据。
- 优势: 由于参考运动已经消除了物理冲突,策略无需再花费精力去补偿不可行的指令,可以专注于学习如何高效地跟踪运动以及进行 Sim-to-Real 迁移。
- 增强措施: 引入观测噪声、域随机化(摩擦、质心、IMU 偏移等)以及外部推力,以提高鲁棒性。
系统架构
该框架支持两种应用模式:
- 离线模式: 对运动片段进行物理过滤,生成高质量数据集。
- 在线遥操作模式: 将实时的人类运动指令(来自动捕或 VR)先通过阶段一模块在仿真中转化为物理可行轨迹,再输入阶段二策略控制真机,实现端到端的实时控制。
3. 关键贡献 (Key Contributions)
- 两阶段解耦框架: 提出了一种显式分离物理可行性与运动跟踪的架构。通过预先解决物理一致性问题,使得单一策略能够连续执行长达数小时的多样化运动(包括高动态动作),解决了长期存在的稳定性与跟踪精度冲突。
- 高质量物理一致数据集构建: 通过强化学习在仿真中生成去除了动态伪影的机器人运动数据,为通用人形机器人控制提供了一个标准化的、物理可信的基准(Benchmark)。
- 鲁棒的零样本 Sim-to-Real 迁移: 在 Unitree G1 人形机器人上验证了该方法,实现了从仿真到现实的零样本迁移。策略不仅能稳定执行行走、跑步,还能可靠地完成侧手翻、空翻等高难度杂技动作,并支持人类风格的动态实时遥操作。
4. 实验结果 (Results)
仿真环境表现
- 对比基线: 在 LAFAN1 和 AMASS 数据集上,OmniTrack 在跟踪成功率(SR)和平均关节位置误差(MPJPE)上均显著优于现有最先进方法(如 OmniH2O, ExBody2, BeyondMimic)。
- 高动态场景: 在高动态子集(High-dynamic subset)中,OmniTrack 的成功率达到 84.81%,远超 OmniH2O (48.32%) 和 ExBody2 (58.93%)。
- 可扩展性: 随着训练数据规模从 1/8 增加到全量,OmniTrack 的性能保持稳定(成功率约 92.6%),而基于原始数据的基线方法随着数据量增加,收敛变慢且成功率显著下降(从 95.1% 降至 88.2%)。
真实世界表现 (Real-World)
- 长时稳定性: 在 Unitree G1 机器人上实现了超过 1 小时的连续、稳定跟踪,涵盖行走、跳跃、舞蹈、武术、跌倒恢复等。
- 高动态能力: 成功执行了连续 17 次侧空翻 且未失败,展示了极强的动态控制能力。
- 遥操作鲁棒性: 在存在噪声、抖动和延迟的实时遥操作输入下(通过动捕系统和 VR 头显),机器人仍能生成平滑、符合物理规律且风格自然的运动,证明了系统对非结构化指令的强适应性。
- Sim-to-Real 对齐: 仿真与真机在关节位置、基座姿态和角速度上的跟踪误差高度一致,验证了域适应的有效性。
5. 意义与影响 (Significance)
- 范式转变: OmniTrack 证明了在人形机器人控制中,在策略学习之前显式解决物理可行性问题比让策略隐式学习去处理物理冲突更为有效。这为通用机器人控制提供了一个新的设计原则。
- 通用性突破: 该方法打破了以往策略在“静态/准静态”与“高动态”行为之间的权衡限制,使得单一策略能够同时掌握日常动作和极限运动。
- 实际应用价值: 实现了真正意义上的人形机器人实时遥操作,能够处理人类操作员的不完美输入,为未来人形机器人在复杂非结构化环境中的部署(如家庭服务、灾难救援)奠定了坚实的技术基础。
总结: OmniTrack 通过“先修正物理,再学习控制”的两阶段策略,成功解决了人形机器人运动跟踪中的核心痛点,实现了高保真、高稳定性且具备极强泛化能力的通用运动控制,并在真实机器人上验证了其卓越的动态性能和鲁棒性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。