✨ 要点🔬 技术摘要
想象一下,你正试图教一个机器人玩接球游戏,但你不想花费数年时间去为机器人布线传感器,也不想记录它每一次投掷的过程。相反,你希望机器人通过观看数小时人类玩接球的 YouTube 视频,就能自行领悟游戏的规则。这就是“具身智能”(embodied intelligence)的梦想:创造能够通过观察世界来学习的机器人,就像我们一样。为了实现这一目标,科学家们使用了一种被称为“世界模型”(world model)的技术。把世界模型想象成机器人的内在白日梦或心理模拟器。它是一个能够在大脑中构思“如果我这样投球,它会落在那里”的系统,而无需实际投掷并冒着打破窗户的风险。挑战在于,大多数机器人在这种“白日梦”方面表现得很糟糕,因为它们只能看到平面的 2D 图像(就像一张照片),而现实世界是一个具有深度、体积和物理属性的 3D 空间。如果机器人的白日梦是扁平的,那么当它尝试与 3D 物体互动时,它就会失败。
最近,研究人员发现了一个巧妙的技巧,叫做“潜动作”(latent actions)。他们并没有教机器人复杂的投掷物理学,而是让它直接从无标签的视频中学习一种简单的、隐藏的运动“代码”。这就像是通过观察人类跳舞,来教机器人一种运动的“秘密语言”,而无需知道舞蹈动作的具体名称。然而,一项新研究表明,仅仅向机器人喂入来自不同角度的更多视频,并不足以让它理解 3D 空间。事实上,如果没有特殊的训练,机器人可能会仅仅记住光影的变化或摄像机的移动方式,而不是学习物体如何在空间中实际运动。这正是来自南开大学、清华大学等机构的研究团队致力于解决的难题。
该论文介绍了一个名为 LAWM-3D (从人类视频中学习 3D 感知的潜动作)的新系统。研究人员发现,仅仅向机器人展示多视角(multi-view)视频并不能教会它 3D 感知能力。事实上,他们发现如果没有仔细的引导,机器人会感到困惑。它可能会利用视频的“未来”帧来猜测接下来会发生什么,或者会被“红色的衬衫在侧面看起来与正面不同”这类现象分散注意力。结果,机器人学到的是一个扁平的 2D 动作,而非真实的 3D 运动。
为了解决这个问题,团队构建了一个由三部分组成的训练系统,扮演着一个严格但乐于助人的教练角色:
动作的“通用翻译官”: 机器人接受同时来自多个角度的视频训练。目标是教会它:无论你是从正面、侧面还是上方观察,“投掷”都是同一种动作。他们创建了一种特殊的方法,将这些不同的视角转化为一个统一的“动作标记”(action token,即运动的数字代码),从而忽略摄像机角度,只关注运动本身。
“几何 GPS”: 为了确保机器人不是在瞎猜,他们将机器人的大脑连接到了一个预训练的“3D 基础模型”(一个已经了解 3D 形状规律的高级 AI)。这就像是一个 GPS,不断检查机器人的内在地图,以确保它想象出的 3D 结构符合现实世界的几何逻辑。它迫使机器人理解球是一个球体,而不仅仅是一个随相机移动而改变形状的扁平圆圈。
“禁止作弊”规则: 研究人员增加了一条特殊规则来阻止机器人寻找捷径。在常规训练中,机器人可能会偷看视频的下一帧来观察后续情况并进行模仿。为了防止这种情况,他们让机器人不仅要预测下一张图片,还要预测那张图片的“深度”(即物体距离远近)。由于机器人无法预见未来的深度,它必须真正理解运动的物理特性才能做出准确的预测。这迫使它专注于真实的运动,而不是仅仅复制像素。
该方法的成果令人印象深刻。当他们测试 LAWM-3D 时,机器人的“白日梦”变得更加真实。在模拟实验中,相比以往的方法,LAWM-3D 在预测物体如何运动、弹跳以及如何进行物理交互方面表现得更出色。例如,在模拟机器人捡起香蕉或堆叠积木时,旧方法经常会导致物体漂浮或互相穿透,而 LAWM-3D 则能让物体保持坚实并稳固地存在于 3D 空间中。论文表明,这种方法显著提高了机器人的泛化能力,这意味着它能够处理从未见过的全新任务和环境,因为它理解的是世界的 3D 规则,而非仅仅死记硬背 2D 图片。
简而言之,这篇论文认为,要教机器人理解世界,你不能仅仅给它更多的摄像头;你必须教会它如何进行 3D 思考。通过将多视角视频与严格的几何规则以及“禁止作弊”的训练方法相结合,LAWM-3D 创造了一个不仅是在观察世界,而且真正理解如何在其中运动的机器人。
技术摘要:LAWM-3D
问题陈述
世界模型使智能体能够在无需现实世界交互的情况下进行前向展开(rollouts)和规划,然而其在开放世界具身智能中的应用受到两个主要瓶颈的阻碍:采集动作标注的高昂成本,以及不同机器人平台之间动作空间的异构性。虽然近期的潜在动作模型(Latent Action Models, LAMs)通过以自监督方式从无标签人类视频中学习动作表示,缓解了标注瓶颈,但现有方法仍存在显著局限。大多数方法在 2D 像素空间内基于单视角输入运行,无法捕捉显式的 3D 运动语义。因此,学习到的潜在动作往往反映的是 2D 外观的变化,而非真实的 3D 物理交互。
作者研究了仅仅将多视角视频引入 LAM 训练是否能赋予潜在动作以 3D 感知能力。研究表明,简单的集成是无效的,原因在于三个具体问题:
未来帧外观泄漏(Future-frame appearance leakage): 编码器可以利用未来帧的 RGB 信息来重建像素,导致潜在动作退化为压缩的外观表示,而非运动语义。
相机间差异(Inter-camera discrepancies): 多视角观测是缺乏显式几何约束的 2D 投影,使得一致的 3D 表示学习变得困难。
任务无关信息(Task-irrelevant information): 在像素空间运行会引入噪声,导致模型优先考虑像素重建而非运动语义。
方法论
本文提出了 LAWM-3D (通过人类视频学习用于泛化机器人世界模型的 3D 感知潜在动作),这是一个旨在通过两阶段范式——大规模人类视频预训练及随后的机器人微调——来学习视角不变且具有 3D 感知的潜在动作的框架。其核心架构由一个潜在动作模型(LAM)和一个条件世界模型组成。
关键技术设计
LAM 被形式化为一个结合了三个紧密耦合组件的多视角变分自编码器(VAE):
多视角不变统一动作标记化(Multi-View Invariant Unified Action Tokenization): 该模型处理来自多个相机视角(一个自我视角和 V V V 个外部视角)的同步观测。输入帧被标记化并与动作标记拼接,同时辅以视角嵌入和旋转位置编码。时空 Transformer 编码器跨视角聚合特征(通过池化)以生成统一的潜在动作表示。为了实现视角不变性,训练采用了随机视角掩码策略 ,即编码器必须从不完整的视角集合中推断出一致的潜在动作,而解码器则从保留的子集中重建随机选择的视角。
几何对齐约束(Geometric Alignment Constraint): 为了显式建模跨视角对应关系,LAM 编码器的中间特征与预训练的 3D 基础模型 VGGT (Visual Geometry Grounded Transformer)进行对齐。这种对齐通过两种损失函数实现:
角度损失(L A n g u l a r L_{Angular} L A n g u l a r ): 一种余弦相似度损失,用于将编码器的特征方向与 VGGT 的几何特征对齐。
尺度损失(L S c a l e L_{Scale} L S c a l e ): 对归一化特征进行的回归损失,用以恢复量级信息,确保模型学习到完整的几何表示,而不产生直接对原始特征进行 MSE 回归的不稳定性。
非单射 RGB–D 联合重建(Non-Injective RGB–D Joint Reconstruction): 为了防止编码器直接将未来帧的 RGB 信息压缩进潜在动作的捷径学习,作者引入了一个非单射深度监督信号。解码器接收当前帧及其深度图的拼接,以联合预测未来帧和深度图。由于深度图对编码器是不可见的,这迫使潜在动作专注于具有几何意义的运动线索,而非外观泄漏。
训练流水线
阶段 1(LAM 预训练): 在大规模多视角(Ego-Exco4D, Assembly101)和单视角(EgoDex)人类操纵视频上训练 LAM。目标函数结合了重建损失、KL 散度和几何对齐损失。
阶段 2(世界模型预训练): 使用由 LAM 提取的潜在动作作为伪动作标签,在人类视频上预训练世界模型(基于 Cosmos-Predict2.5)。
阶段 3(机器人微调): 在真实机器人交互数据(如 GR1_robot 数据集)上对世界模型进行微调,以将潜在动作空间与实际控制信号对齐,从而实现下游规划和策略学习。
核心贡献
识别了简单多视角 LAM 的局限性: 本文证明了仅仅将多视角数据添加到现有 LAM 中并不能产生 3D 感知,因为存在外观泄漏和缺乏几何约束的问题。
LAWM-3D 框架: 一种整合了多视角不变标记化、与 3D 基础模型进行几何特征对齐以及非单射 RGB-D 重建的新颖架构,以增强 3D 物理一致性。
最先进的性能(SOTA): 与之前的 LAM 方法(如 DreamDojo 和 UniLACT)相比,所提方法在世界模型生成质量、物理一致性和泛化能力方面取得了卓越的结果。
通过人类数据实现泛化: 本研究验证了从人类视频中学习到的 3D 感知潜在动作能显著提升机器人世界模型在分布外(OOD)场景下的泛化能力。
实验结果
在包括 Ego-Exo4D、Assembly101 以及用于世界模型评估的 WorldArena 基准测试在内的广泛定性和定量实验表明:
潜在动作质量: 在 Ego-Exo4D 和 Assembly101 上,LAWM-3D 在 RGB 和深度预测指标(PSNR/SSIM)上均优于基线模型(LAPA, UniLACT, CoMo, DreamDojo)。值得注意的是,它在 Ego-Exo4D 深度预测上达到了 35.62 的 PSNR 和 0.939 的 SSIM,大幅超越了次优模型(DreamDojo-D)。
世界模型生成: 在涵盖六个维度(视觉质量、运动质量、内容一致性、物理遵循、3D 准确度、可控性)的 16 个指标上进行评估,LAWM-3D 取得了 SOTA 结果。它在运动质量 和 3D 准确度 方面表现尤为突出,表明其对空间结构的理解得到了提升。
泛化性(OOD): 在跨场景评估(In-lab, EgoDex, DreamDojo-HV)中,LAWM-3D 持续优于 DreamDojo 变体,展示了在未知环境和复杂交互中的鲁棒性。
策略评估: 学习到的世界模型可作为可靠的策略评估代理,其与现实世界回报的 Spearman 秩相关系数达到 ρ = 0.952 \rho = 0.952 ρ = 0.952 。此外,利用该世界模型的自适应策略选择机制,使高方差策略组的闭环成功率提升了 17%。
消融实验: 实验证实,仅靠多视角数据(Case 1)并不能提高性能,反而可能因视角差异导致性能下降。几何对齐(Case 2)和深度解码(Case 3)是性能提升的主要驱动力,完整模型达到了最佳效果。
重要性与主张
本文声称 LAWM-3D 代表了弥合无标签人类视频数据与可泛化机器人世界模型之间差距的重要一步。通过明确解决 2D 像素空间学习和简单多视角集成的局限性,该方法成功学习到了具备 3D 感知且视角不变的潜在动作 。
作者断言,这些学习到的表示使世界模型能够:
更好地捕捉现实世界的动力学,包括空间关系和物体状态。
生成具有更高时间一致性且在长程预测中减少伪影的物理合理性的展开(rollouts)。
在无需大量机器人特定动作标注的情况下,有效地泛化到新的机器人任务和环境。
这项工作强调,集成几何先验(通过 VGGT)和非单射重建目标对于将多视角冗余转化为具有物理基础的动作表示至关重要,从而克服了当前潜在动作学习范式中的“外观 vs 运动”困境。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。