← 最新论文
💻 computer science

WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors

本文介绍了 WholeBodyWAM,这是一种人形机器人世界-动作模型(world-action model),它利用大规模异构运动语料库(UniMotion-4K)来预训练一个可迁移的运动先验,通过异步混合 Transformer 注意力机制(asymmetric Mixture-of-Transformers attention)与视频和动作专家相结合,显著提升了数据效率和下游操控性能。

原作者: Bowei Zhang, Qiyao Zhang, Shuanghao Bai, Xinhua Wang, Meng Li, Yilei Wang, Leiwang Zhang, Jian Tang, Lu Zhou, Lei Sun, Zhengping Che

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowei Zhang, Qiyao Zhang, Shuanghao Bai, Xinhua Wang, Meng Li, Yilei Wang, Leiwang Zhang, Jian Tang, Lu Zhou, Lei Sun, Zhengping Che

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

为了让机器人像人类一样运动,工程师们面临着一个根本性的问题:教机器协调其全身是极其困难的。人类在伸手拿杯子或走过房间时,并不会思考移动每一个单独的肌肉;身体作为一个单一、流畅的整体在运动。然而对于机器人来说,每一个关节和肢体都必须被分别指令,并且收集数百万小时的练习数据来教特定的机器人这项技能既缓慢、昂贵,且往往是不可能的。虽然科学家们已经构建了强大的模型来理解语言和观察世界,但这些系统往往难以预测机器人自身的身体在未来将如何运动,而是依赖于对正在发生的事情做出反应。这种局限性使得机器人难以执行需要提前规划的复杂任务,例如在不平整的地面上搬运重箱子,或者在捡起物体时下跪而不失去平衡。

一个研究团队通过教机器人从互联网上丰富的免费人类运动库中学习,而不是仅仅依赖于来自机器人自身的昂贵演示,解决了这一挑战。他们创建了一个名为 WHOLEBODYWAM 的新系统,该系统充当机器人的预测引擎。这个系统不仅仅是观看视频并猜测下一步要做什么,它学习的是身体随时间运动的底层物理规律。它是在一个名为 UniMotion-4K 的大规模运动数据集上训练的,该数据集包含了从人类视频、专门的 3D 动作捕捉数据集以及其他类人机器人中记录的超过 4,100 小时的运动数据。通过将所有这些不同的来源转化为一种单一的、共享的运动语言,该系统学习到了关于身体如何从一种姿态过渡到另一种姿态的通用“直觉”。这种直觉随后被转移到了一个真实的类人机器人身上,使其能够预判自身的未来运动,并以比以往方法更高水平的技巧和效率执行复杂的全身任务。

这项工作的核心在于一个两阶段训练过程,它将学习通用运动规则与学习如何将其应用于特定机器的过程分离开来。在第一阶段,系统在从未见过目标机器人的实际指令的情况下,研究了海量的人类和机器人运动数据集。它学习根据简单的文本描述(例如“拿起玩具”或“下跪”)来预测身体接下来的动作。这创造了一个强大的基础,即一个预测先验,它理解了人类运动所需的肢体协调与平衡。在第二阶段,这种预训练的知识与视频理解模块和动作生成器相结合。随后,系统通过观察来自特定机器人 TianGong 3.0 的少量演示,学习如何将其对运动的通用理解转化为该机器人关节需要执行的具体电机指令。至关重要的是,该系统不仅仅是对当前场景做出反应;它利用其学到的知识来想象自身身体的未来状态,并利用这种预测来实时引导其动作。

在六项困难的现实世界任务测试中,结果令人瞩目。机器人被要求执行诸如捡起玩具、将衣物装入洗衣机、将枕头转移到沙发上以及将箱子搬运到桌子等动作。这些任务要求机器人同时进行弯腰、行走、下跪和操纵物体。新系统表现优于现有的最佳方法,在所有任务中都实现了显著更高的成功率。例如,在箱子转移任务中(机器人需要拿起箱子,走到侧边桌子旁,然后放下它),新系统的成功率为 7 3.3%,而其他方法的成功率要低得多。研究人员发现,用于训练初始“运动专家”的运动数据越多,机器人的表现就越好,这表明该系统学习的是一种可扩展的技能,而不仅仅是记忆特定的例子。更重要的是,该系统在数据使用方面表现出极高的效率;当研究人员将用于训练特定机器人演示的数据量减少一半时,经过大规模运动数据集预训练后的机器人表现仍然优于其他经过全套演示训练的机器人。

这种方法还展示了处理环境变化时的卓越能力。当研究人员稍微移动目标篮子,或者改变机器人必须捡起的玩具的颜色和形状时,系统能够快速适应,在其他模型挣扎时仍能保持高性能。该系统无需生成未来的视频(因为这会带来高昂的计算成本且速度较慢),而是直接预测自身关节的未来位置,从而能在约 363 毫秒内做出决策,这一速度足以实现实时控制。这项研究证实,虽然机器人不能简单地模仿人类运动,因为其身体构造不同,但它可以从人类运动的丰富模式中学习,从而发展出对自身身体运动的稳健且具有预测性的理解。通过利用世界上丰富的人类运动数据,这种方法为创造不仅能够执行复杂任务,而且能以比以往认为更少的演示次数学会这些任务的类人机器人提供了一条新路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →