MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation
MotionWAM 是一个实时基础世界动作模型,它通过利用中间视频去噪特征来预测协调的运动标记,从而统一了人形机器人的全身位移与操作控制,克服了传统分层策略在速度和一致性方面的局限性,并在复杂任务中显著优于视觉-语言-动作(VLA)基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人成为一名像人类一样的助手。通常,我们教机器人的方式分为两个独立的步骤:首先,我们教它们的“大脑”(上半身)如何抓取物体;然后,我们教它们的“腿”(下半身)如何行走并保持平衡。问题在于,这两个部分之间的沟通并不顺畅。大脑说:“去抓那个杯子”,而腿部只会说:“好的,我会向前走以防止你摔倒。”它们无法完成像踢足球或踩踏板这样的动作,因为腿部被仅限于执行“平衡相关的工作”。
MotionWAM 是一个全新的机器人大脑,它通过将整个身体视为一个单一的、协调的整体来解决了这个问题。以下是它的工作原理,我们使用了一些简单的类比:
1. “电影导演” vs. “剧本作家”
大多数机器人大脑就像是剧本作家。它们观察一张图片和一句话(例如“拿起盒子”),然后根据以前见过的经验来猜测下一步的动作。它们并不真正理解物理规律或物体如何随时间运动。
MotionWAM 则不同。它就像是一位看过数千小时电影的电影导演。在告诉机器人该做什么之前,它会对接下来几秒钟的电影画面进行快速的“脑内模拟”。
- 诀窍: 它并没有等待整个电影场景被完全绘制出来(那太慢了),而是在场景正在被绘制的过程中捕捉其“草图”。它从这个草图中抓取未来运动的“神韵”,并立即告诉机器人如何移动。这就是为什么它能思考得足够快,从而实现实时运行。
2. “统一遥控器”
在旧系统中,机器人有两个遥控器:一个控制手臂,一个控制腿部。腿部遥控器非常简单,只知道如何直行或转弯。
- MotionWAM 的创新: 它为整个身体使用一个单一的遥控器。当机器人需要踢足球时,“踢”这个指令不仅仅针对腿部,而是一个单一的指令,它同时告诉手臂如何平衡、躯干如何倾斜以及脚部如何摆动。这使得机器人能够完成像踩踏板或踢球这样的动作,而旧有的“双遥控器”系统无法做到这一点,因为那些系统并不理解腿部也可以成为“任务”的一部分,而不只是为了“平衡”。
3. “三阶段训练营”
以这种方式教导机器人是很困难的,因此研究人员使用了三个阶段的训练营:
- 第一阶段(电影发烧友): 他们向机器人展示了数千小时从人类视角(类似于头戴式 GoPro)拍摄的视频。机器人此时还没有学习如何移动,它只是学习了当你移动时世界看起来是什么样子的。它学习了“视觉的物理学”。
- 第二阶段(翻译官): 他们教会了机器人如何将这些电影技能转化为实际的机器人动作。他们使用了来自不同类型机器人身体的数据,以确保机器人理解“移动”的通用概念,而不仅仅局限于某一种特定的身体形状。
- 第三阶段(特种部队): 最后,他们通过人类操作员利用 VR 眼镜引导,让机器人进行特定的实践任务(如装载推车或擦拭黑板)。在这里,机器人学会了如何将其电影知识应用于真实的、棘手的任务中。
结果
当他们在九项困难任务(如踢足球、装载推车或洗衣服)上测试 MotionWMA 时,取得了巨大的成功:
- 速度: 它的思考速度足以实现实时运行(大约每秒 5 次),这对于机器人保持直立而不摔倒至关重要。
- 成功率: 它的成功率达到了 76%,而此前最优秀的机器人大脑成功率仅为 44% 左右。
- “踢球”因素: 最大的进步在于需要足部交互的任务。旧机器人会试图绕过球走,而 MotionWAM 真的会去踢球。
核心结论
MotionWAM 证明了,如果你给机器人一个理解世界如何运动的“电影导演”大脑,并且允许它用一个统一的计划来控制全身,那么它完成复杂、类人工作的能力会比那些将行走和抓取视为独立问题的机器人强得多。
局限性: 论文指出,这项测试是在一款特定的机器人型号(Unitree G1)上进行的。如果机器人失去了对所持物体的视野(因为摄像头位于头部),它可能会产生混乱并停止工作。目前尚未在其他机器人身体上进行测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。