✨ 要点🔬 技术摘要
想象一下,你有一位才华横溢的人类舞者,以及一个全新的机器人。这个机器人看起来有点像人,但手臂大小不同,腿部较短,关节弯曲方式也不同。你希望机器人能完美地模仿舞者的动作。
这就是名为 “Human2Humanoid” 的论文试图解决的问题。这就像是在试图教一个蹒跚学步的幼儿如何精准地模仿专业芭蕾舞演员跳舞,即便这个幼儿的身材比例不同,且膝盖的弯曲方式也不一样。
以下是该论文解决问题的方法,通过简单的语言进行解释:
核心难题:“苹果与橘子”的问题
通常情况下,要教会机器人运动,你需要一段人类做动作的视频,以及一段机器人做完全相同动作的视频。这被称为“配对数据”(paired data)。但获取这种数据极其困难、昂贵,而且往往是不可能的,因为如果你尝试让机器人模仿人类复杂的动作,它可能会摔倒。
作者说:“让我们跳过配对视频吧。”他们希望仅通过人类视频 和机器人视频 来教机器人,而无需看到它们同时运动。
解决方案:一个遵循三个特殊规则的“翻译官”
团队构建了一个智能 AI 系统(神经网络),它充当了人类世界与机器人世界之间的“翻译官”。为了确保翻译是有意义的,他们给这个 AI 设定了三个特殊规则:
1. “骨架地图”规则(拓扑结构)
类比: 想象你在绘制一张城市地图。如果你只是列出街道名称,你可能会迷路。但如果你了解城市的“形状”(河流在哪里,道路如何连接),即使街道名称改变,你也能进行导航。
论文的做法: 人类和机器人的“骨架”不同(关节数量不同、连接方式不同)。AI 使用了一个感知骨架的图网络(Skeleton-Aware Graph Network) 。它不是仅仅观察数字,而是理解身体的“形状”。它知道人类的手肘连接着肩膀和手腕,机器人的手臂也是如此,即便机器人的手臂较短。这有助于 AI 理解运动的“结构”,而不仅仅是原始数据。
2. “相对尺寸”规则(形态不变性)
类比: 如果一个巨人和一个侏儒都想伸手去够高架子上的饼干,他们都必须向上伸展手臂。如果你只是告诉侏儒“向 2 米高处伸手”,他会失败,因为他太小了。但如果你告诉他“尽可能达到你自身头部高度允许的高度”,他就能成功。
论文的做法: 人类和机器人的尺寸不同。如果 AI 试图匹配精确的坐标(例如:“将手移动到 X, Y, Z”),机器人会失败,因为它的手臂较短。相反,AI 使用了形态不变损失函数(Morphology-Invariant Loss) 。它观察手相对于身体起始姿态(“T 字形”姿态)移动了多少。它告诉机器人:“按照你身体长度的相同‘百分比’移动你的手,就像人类移动的那样。”这保持了动作的“含义”(如“向上伸手”),即使机器人身材矮小。
3. “别摔倒”规则(物理感知)
类比: 如果你告诉机器人走路,但没有告诉它要保持脚着地,它可能会开始在脚尖上“滑行”或像幽灵一样漂浮在空中。这在动画片里看起来很酷,但真实的机器人会摔坏。
论文的做法: AI 被迫遵循物理感知约束(Physics-Aware Constraints) 。它必须检查:
无滑行: 如果人类的脚踩在地上,机器人的脚也必须保持在地面上,不能滑动。
无漂浮: 当机器人应该接触地面时,它的脚不能悬浮在空中。
不损坏: 机器人的关节不能以会导致机器损坏的方式弯曲(比如膝盖向后弯曲)。 AI 会学习在生成违反这些规则的动作时“惩罚”自己。
结果:一个会跳舞的机器人
团队在名为 Unitree G1 的真实机器人上测试了该方法。他们输入了人类舞蹈动作(从未展示过人机配对的画面)。
结果: 机器人成功模仿了人类的动作。
对比: 他们将这种方法与旧有的方法(依赖复杂的数学方程来强行让机器人适配)进行了比较。新方法在以下方面表现更好:
追踪能力: 机器人能够实际跟随动作而不会摔倒。
真实感: 机器人不会出现脚部滑动或在空中漂浮的情况。
多样性: 它适用于跳跃、蹲下和转身等困难动作,而旧方法在这些动作中往往会失败或需要手动调整。
总结
这篇论文提出了一种新的方法,无需“训练伙伴”(配对数据),即可教会机器人像人类一样运动。它使用了一个聪明的翻译官,能够理解身体形状,尊重尺寸差异,并严格执行物理定律,以确保机器人不会摔倒或损坏自己。这就像是通过看人类跳舞的视频来教机器人跳舞,而机器人的大脑会自动计算如何调整其短小的腿部和僵硬的关节,从而在保持节奏的同时不至于绊倒。
技术摘要:Human2Humanoid
问题陈述
将人类动作重定向(Retargeting)至类人机器人是实现遥操作、模仿学习和人机交互的关键使能技术。然而,这项任务面临两个主要的耦合挑战:
形态差异(Morphological Discrepancies): 人类与机器人实体在骨骼拓扑、肢体比例和自由度(DoF)方面存在显著差异。当体型和关节结构差异巨大时,简单的几何对齐往往无法保持动作语义。
数据稀缺性(Data Scarcity): 高质量、同步的人类-机器人运动对难以获取,且难以跨不同的机器人实体进行扩展。
物理合理性(Physical Plausibility): 现有的非配对方法(通常来自计算机图形学领域)优先考虑视觉上的合理性,但未能确保生成可执行的关节空间轨迹、稳定的地面接触或符合机器人特定的运动学限制。这会导致诸如足部滑动(foot skating)、地面穿透和身体漂浮等伪影,使得动作无法在真实硬件上使用。
传统的基于优化的方法(例如逆运动学)具有可解释性,但对初始条件和参数调优非常敏感,在面对巨大的形态差异时,往往会产生语义失真的姿态。相反,监督学习方法需要极难获得的配对数据,而现有的无监督生成方法则缺乏机器人部署所需的物理约束。
方法论
本文提出了 Human2Humanoid ,一个旨在将人类动作无监督重定向至类人机器人的框架,该框架无需配对数据。该框架基于 CycleGAN 式架构,并集成了特定的机制来解决形态和物理问题。
1. 网络架构
感知骨骼的生成器(Skeleton-Aware Generators): 不同于将姿态视为平坦向量的方法,生成器采用了感知骨骼的图卷积网络(GCN) 。这些网络利用邻接矩阵显式地对骨骼运动的天然拓扑结构进行建模,捕捉局部关节相关性。该架构包括包含 SkeletonConv 层的编码器、潜在空间以及通过 Unpooling 操作恢复目标拓扑结构的解码器。
逐帧姿态判别器(Frame-wise Pose Discriminator): 判别器在逐帧基础上运行,在关节层面评估真实性,而非坍缩为单一的标量分数。它采用双分支方法:一个用于局部真实性的关节分支和一个用于姿态连贯性的全身分支,通过结合两者来独立地为每个关节评分。
2. 关键损失函数与约束
为了弥合领域差距并确保物理可行性,该框架引入了三个特定组件:
形态不变的末端执行器一致性损失 (L E E L_{EE} L E E ): 为了处理尺度不匹配问题(例如人类手臂与紧凑型机器人手臂),该方法避免对齐绝对笛卡尔坐标。相反,它将末端执行器的轨迹相对于每个实体的 T-pose 进行对齐。通过将相对于 T-pose 的位移按实体的体型比例进行归一化,该损失函数在不同形态下保留了运动语义。 L E E = E [ 1 T ∣ E ∣ ∑ t = 1 T ∑ k ∈ E ∥ F K k ( q B , t ) − F K k ( q B T p o s e ) S B − F K k ( q ^ A , t ) − F K k ( q A T p o s e ) S A ∥ 2 2 ] L_{EE} = \mathbb{E} \left[ \frac{1}{T|E|} \sum_{t=1}^{T} \sum_{k \in E} \left\| \frac{FK_k(q_B, t) - FK_k(q_B^{Tpose})}{S_B} - \frac{FK_k(\hat{q}_A, t) - FK_k(q_A^{Tpose})}{S_A} \right\|_2^2 \right] L E E = E T ∣ E ∣ 1 t = 1 ∑ T k ∈ E ∑ S B F K k ( q B , t ) − F K k ( q B T p ose ) − S A F K k ( q ^ A , t ) − F K k ( q A T p ose ) 2 2
物理感知可行性约束(Physics-Aware Feasibility Constraints): 在训练期间施加显式约束,以抑制无监督生成中常见的伪影:
足部接触约束 (L c o n L_{con} L co n ): 从源人类运动中推断接触状态(基于足部速度),并在预期接触时惩罚目标足部速度,从而抑制足部滑动。
足部高度约束 (L h e i L_{hei} L h e i ): 通过确保当源足部处于接触状态时,目标足部保持在其名义接地高度附近,来惩罚“漂浮”现象。
关节限制约束 (L l i m L_{lim} L l im ): 惩罚超过机器人机械极限([ q m i n , q m a x ] [q_{min}, q_{max}] [ q min , q ma x ] )的预测关节角度,以防止硬件损坏或紧急停机。
完整目标函数: 总生成器损失结合了标准的 CycleGAN 目标(对抗损失、循环一致性损失、恒等损失)以及提出的形态和物理损失: L G = λ G A N L G A N + λ c y c L c y c + λ i d t L i d t + λ E E L E E + λ c o n L c o n + λ h e i L h e i + λ l i m L l i m L_G = \lambda_{GAN}L_{GAN} + \lambda_{cyc}L_{cyc} + \lambda_{idt}L_{idt} + \lambda_{EE}L_{EE} + \lambda_{con}L_{con} + \lambda_{hei}L_{hei} + \lambda_{lim}L_{lim} L G = λ G A N L G A N + λ cy c L cy c + λ i d t L i d t + λ E E L E E + λ co n L co n + λ h e i L h e i + λ l im L l im
实验结果
该方法在 Unitree G1 类人机器人上进行了验证,使用了来自 Motion-X 数据集(人类)和 PHUMA 数据集(机器人)的非配对数据。
下游可控性: 通过在仿真中使用固定的跟踪策略进行评估。Human2Humanoid 取得了最高的成功率 (88.5%) 和最低的跟踪误差 (0.12) ,优于所有基线方法(包括基于优化的方法 PHC 和 GMR,以及工业参考标准)。
物理可行性: 该方法在抑制接触伪影方面表现出卓越的能力。它实现了最低的地面穿透深度 (0.05 cm) 和具有竞争力的足部滑动率 (4.7%),优于经常出现关节极限不连续或需要针对每个动作进行调优以避免抖动的优化基线方法。
消融研究: 移除形态不变损失 (L E E L_{EE} L E E ) 会显著降低跟踪成功率并增加误差,证实了其在保留语义方面的作用。移除物理约束 (L c o n , L h e i L_{con}, L_{hei} L co n , L h e i ) 则会增加足部滑动和地面穿透,验证了其对于物理合理性的必要性。
核心贡献
Human2Humanoid 框架: 一种针对异构类人机器人的无监督运动重定向框架,降低了对机器人特定配对数据的依赖。
形态不变的末端执行器一致性损失: 一种新颖的损失函数,通过对齐相对于各自实体 T-pose 归一化的末端执行器轨迹,在大幅尺度差异下保留运动语义。
物理感知的可行性约束: 将显式的接触、高度和关节限制约束集成到生成训练过程中,以减轻对部署至关重要的伪影,如足部滑动和地面穿透。
意义与主张
本文声称 Human2Humanoid 成功地在无需配对数据的情况下,架起了人类运动先验与可执行机器人行为之间的桥梁。通过将无监督学习与形态不变的语义对齐及显式物理先验相结合,该框架在语义保真度 (保留人类运动意图)与物理可执行性 (确保运动对机器人而言安全稳定)之间实现了稳健的平衡。
作者强调,虽然现有方法要么依赖于敏感的优化,要么需要昂贵的配对数据构建,但我们的方法提供了一种可扩展的解决方案,能够生成高质量、可跟踪的参考运动。结果表明,所提方法在处理“具身差异(embodiment gap)”方面特别有效,使类人机器人能够比目前的先进基线方法更可靠地复制复杂的人类动作。未来的工作重点在于将其推广到非类人机器人以及与全身控制策略的端到端耦合。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。