想象一下,你正在教一个机器人做家务,比如捡起水果或打开抽屉。为了做到这一点,机器人需要一个“大脑”,能够理解它所看到的景象,并确定下一步该如何运动。这篇论文介绍了一种名为 RepWAM 的新型大脑。
以下是其工作原理的简单拆解,使用了日常类比:
问题所在:“像素级完美”与“意义”之间的鸿沟
目前大多数机器人的大脑都是基于视频生成器(类似于生成虚假视频的 AI)构建的。这些生成器痴迷于像素级的完美。
- 旧方法: 想象一个学生试图通过盯着汽车的照片来学习驾驶。他们记住了油漆的确切颜色、道路的纹理和阴影。但当他们坐到方向盘后时,他们并不理解方向盘是如何转动汽车的,或者汽车为什么会移动。他们困在了世界的“外观”上,而不是“逻辑”上。
- 问题所在: 现有的机器人模型试图通过猜测每一个像素在未来看起来是什么样来预测未来。这包含太多细节,却忽略了重要的东西:哪个物体在移动?抽屉正在打开吗?水果正在被捡起吗?
解决方案:一个“语义”翻译器
作者创建了 RepWAM,它使用了一个特殊的翻译器,称为视觉-动作分词器(Visual-Action Tokenizer)。你可以把它看作是一个将机器人的原始摄像机画面转换为“意义”语言而非“像素”语言的翻译器。
视觉翻译器(“是什么”):
这个系统不仅仅是复制图像,它会观察视频并询问:“这里的核心故事是什么?”它将视频压缩为语义分词(semantic tokens)。
- 类比: 与其通过列出每一根毛发的颜色来描述一张猫的照片,它会说:“猫,坐在垫子上,向左看。”它保留了重要的身份和关系,但丢弃了不必要的噪声。
动作翻译器(“怎么做”):
这是聪明之处。该系统不仅学习如何看,它还学习如何观察“变化”。它创建了潜在动作分词(Latent Action Tokens)。
- 类比: 想象一本翻页动画书。旧方法试图完美地画出每一帧。而 RepWAM 学习的是将第 1 页变为第 2 页的那个“箭头”。它学习到“推抽屉”是一个特定的转换,将状态从“关闭”移动到“打开”。它将动作视为连接两个有意义画面之间的桥梁。
它们如何协同工作
RepWAM 将这两个翻译器放在同一个房间里。
- 训练过程: 机器人观看视频并学习预测:“如果我看到这个(有意义的画面)并且我做这个(有意义的动作),下一个画面看起来就会像那个。”
- 结果: 因为机器人是在以“物体和运动”而非“像素和颜色”的角度进行思考,它在执行诸如“捡起水果”或“推开抽屉”之类的指令时表现得更好。
结果:它奏效吗?
作者在真实机器人和模拟环境中对其进行了测试:
- 现实世界: 在双臂机器人上,RepWAM 在捡起水果、推开抽屉以及将管子插入架子方面的表现远优于之前的模型。
- 模拟环境: 在一个复杂的类游戏模拟环境(RoboTwin 2.0)中,它在困难任务上得分非常高,甚至击败了那些在海量视频数据集上进行预训练的模型。
- 关键发现: 论文表明,你不需要通过死记硬背精确的像素来成为一个优秀的机器人。你需要理解场景中的语义故事。通过将机器人所见的景象与其在这一“有意义”空间中的动作相对齐,机器人变得更加可靠。
简而言之
以前的机器人模型就像是试图通过逐笔临摹画作来理解场景运作方式的艺术家。RepWAM 则像是一位理解情节、角色和动作的导演。通过专注于运动的“故事”而非像素的“纹理”,机器人学会了更智能地行动,并能更准确地遵循指令。
技术摘要:RepWAM —— 基于表示的世界动作建模
1. 问题陈述
世界动作模型(World Action Models, WAMs)旨在弥合被动未来预测与具身机器人控制之间的鸿沟,通过学习一个单一的潜在空间,既能预测视觉动态,又能推断实现这些动态所需的机器人动作。然而,当前的 WAM 在其表示设计上面临两个关键局限性:
- 视觉表示缺陷: 现有的 WAM 通常继承自预训练视频生成模型(如 WAN、VQ-VAE)的视频分词器(Tokenizer)。这些分词器针对像素重建进行了优化,将潜在容量分配给了低级外观(如背景纹理),而非任务相关的语义(如物体身份、空间关系、交互线索)。因此,指令驱动的世界建模缺乏接地性(grounding),因为语言目标必须从一个由外观变化主导的潜在空间中进行推断。
- 动作-视觉解耦: 视觉潜在变量与电机指令存在于不相交的空间中。这迫使逆动力学模型(IDM)在每一步都需要跨越显著的模态间隙,阻碍了动作专家将电机指令有效地锚定在场景内容中的能力。
作者指出,WAM 的保真度受限于这些潜在空间,并提出了疑问:一个世界动作模型究竟需要什么样的表示?
2. 方法论:RepWAM
论文提出了 RepWAM,这是一种基于 表示视觉-动作分词器(RepViTok) 的以表示为中心的世界动作模型。该框架由三个核心部分组成:
A. 表示视觉-动作分词器 (RepViTok)
RepViTok 将视觉潜在变量与冻结的视觉基础模型对齐,并将潜在动作(latent action)诱导为该共享语义空间内的状态转换。
- 视觉分词: 一个 Vision Transformer (ViT) 自编码器处理视觉观测。与标准分词器不同,它受双重目标监督:
- 重建损失: 结合 L1、感知损失和对抗损失,以确保像素保真度。
- 特征对齐损失: 通过线性投影将视频潜在变量拉向冻结的视觉基础模型(例如感知编码器)。这确保了潜在空间捕捉的是高层语义(物体身份、交互),而非仅仅是低级外观。
- 潜在动作分词: 基于对齐后的视觉标记,潜在动作分词器(LAT)学习代表视觉状态之间转换的动作标记。它耦合了一个逆动力学模型 (IDM) 和一个前向动力学模型 (FDM):
- IDM 将连续视觉帧(zt,zt+1)之间的转换压缩为紧凑的潜在动作 ℓt。
- FDM 将 ℓt 实现为一个传输映射(负责路由视觉内容)和一个残差,从而重建下一个视觉潜在变量。
- 这种设计确保了潜在动作被定义为语义视觉状态之间的变换,使其具有跨具身性的可迁移性。
B. 因果世界动作模型
RepWAM 预训练了一个因果扩散 Transformer,用于在语言条件的约束下,共同建模未来的视觉状态和潜在动作。
- 架构: 模型使用块因果掩码(block-causal mask),其中视觉标记和动作标记共享注意力权重,但使用各自模态特定的前馈网络(FFN)。
- 训练目标: 模型使用条件流匹配(conditional flow-matching)目标进行训练。它采样一组视觉潜在变量和配对的潜在动作,并将其与高斯噪声进行插值。网络回归目标速度,以同时预测下一个视觉状态及相应的潜在动作。
- 适配: 在大规模视频-动作数据上进行预训练后,该模型被适配到真实的机器人轨迹,用于闭环操纵。
3. 核心贡献
- 语义视觉-动作分词: 引入了 RepViTok,它将视觉潜在变量与基础模型对齐,并将潜在动作学习为该语义空间内的转换,解决了现有 WAM 表示中“浅层”和“解耦”的问题。
- 统一建模框架: 提供了一个统一的架构,通过预训练因果扩散 Transformer 来联合预测未来的视觉状态和潜在动作,随后将其适配到现实世界的机器人控制。
- 实证验证: 在真实世界双臂操纵任务和 RoboTwin 2.0 仿真基准测试中进行了全面的评估,证明了语义对齐能同时提升视觉动态预测和闭环执行能力。
4. 实验结果
作者将 RepWAM(1.3B 和 5B 参数规模)与包括 π0.5、Motus 和 Lingbot-VA 在内的基线模型进行了对比。
- 真实世界操纵 (Franka 双臂):
- 在“拿起水果”、“推开抽屉”和“插入管子”等任务中,RepWAM-5B 分别实现了 60%、80% 和 60% 的成功率。
- 这些结果优于 π0.5(高出 10–50 个百分点)和 Lingbot-VA(高出 10–20 个百分点),尤其是在需要连贯视觉动态的长程精细任务中。
- 仿真基准 (RoboTwin 2.0):
- RepWAM-5B 在简单任务上达到了 89.3%,在困难任务上达到了 88.4%,优于 π0.5 和 Motus 的 50 项任务平均水平。
- 值得注意的是,RepWAM 是从零开始训练的,并未继承预训练的视频生成权重,但在竞争中仍能与利用此类预训练的 Lingbot-VA 等模型抗衡。
- 消融实验:
- 分词器设计: 使用 RepViTok 替换标准的 WAN2.2 VAE 提升了开环得分 (OLS) 和真实机器人成功率,证实了语义对齐对于指令遵循至关重要。
- 潜在动作训练: “两阶段”方法(先在潜在动作上预训练,再适配到机器人控制)显著优于“联合预测”或不使用潜在动作的训练,验证了潜在动作作为中间表示的效用。
- 无分类器指导 (CFG): 与视频生成模型不同,RepWAM 在 CFG 比例为 1.0(无外推)时表现最佳,这表明其语义空间足够鲁棒,减少了对 CFG 的依赖。
5. 重要性与主张
论文声称,表示视觉-动作分词是世界动作模型的一个极具前景的基础。通过将视觉和动作潜在变量锚定在共享的语义表示中,RepWAM 证明了:
- 如果表示能够捕捉任务相关的语义,那么显式的未来生成对于策略学习并非严格必要。
- 语义对齐使得 WAM 即使在没有继承预训练视频生成骨干网络的情况下,也能实现强大的泛化能力和闭环性能。
- 这种方法通过创建一个将动作理解为语义状态变换(而非脱离的电机指令)的表示空间,向通用机器人策略迈进了一步。
作者总结道,潜在空间的设计是具身智能体能力的基础,而 RepWAM 为实现更具解释性、可迁移且高效的机器人操纵提供了探索路径。未来的工作建议将预训练扩展到超越机器人特定视频的领域,包括大规模互联网视频和人类第一视角视频。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。