← 最新论文
💻 computer science

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

该论文提出了 LAWM-3D,这是一个通过引入多视图不变性标记化、几何对齐约束以及非单射 RGB-D 重建来克服基于 2D 的潜在动作模型局限性的新颖框架,旨在从人类视频中学习具有 3D 感知的潜在动作,从而显著增强机器人世界模型的泛化能力和物理一致性。

原作者: Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人玩接球游戏,但你不想花费数年时间去为机器人布线传感器,也不想记录它每一次投掷的过程。相反,你希望机器人通过观看数小时人类玩接球的 YouTube 视频,就能自行领悟游戏的规则。这就是“具身智能”(embodied intelligence)的梦想:创造能够通过观察世界来学习的机器人,就像我们一样。为了实现这一目标,科学家们使用了一种被称为“世界模型”(world model)的技术。把世界模型想象成机器人的内在白日梦或心理模拟器。它是一个能够在大脑中构思“如果我这样投球,它会落在那里”的系统,而无需实际投掷并冒着打破窗户的风险。挑战在于,大多数机器人在这种“白日梦”方面表现得很糟糕,因为它们只能看到平面的 2D 图像(就像一张照片),而现实世界是一个具有深度、体积和物理属性的 3D 空间。如果机器人的白日梦是扁平的,那么当它尝试与 3D 物体互动时,它就会失败。

最近,研究人员发现了一个巧妙的技巧,叫做“潜动作”(latent actions)。他们并没有教机器人复杂的投掷物理学,而是让它直接从无标签的视频中学习一种简单的、隐藏的运动“代码”。这就像是通过观察人类跳舞,来教机器人一种运动的“秘密语言”,而无需知道舞蹈动作的具体名称。然而,一项新研究表明,仅仅向机器人喂入来自不同角度的更多视频,并不足以让它理解 3D 空间。事实上,如果没有特殊的训练,机器人可能会仅仅记住光影的变化或摄像机的移动方式,而不是学习物体如何在空间中实际运动。这正是来自南开大学、清华大学等机构的研究团队致力于解决的难题。

该论文介绍了一个名为 LAWM-3D(从人类视频中学习 3D 感知的潜动作)的新系统。研究人员发现,仅仅向机器人展示多视角(multi-view)视频并不能教会它 3D 感知能力。事实上,他们发现如果没有仔细的引导,机器人会感到困惑。它可能会利用视频的“未来”帧来猜测接下来会发生什么,或者会被“红色的衬衫在侧面看起来与正面不同”这类现象分散注意力。结果,机器人学到的是一个扁平的 2D 动作,而非真实的 3D 运动。

为了解决这个问题,团队构建了一个由三部分组成的训练系统,扮演着一个严格但乐于助人的教练角色:

  1. 动作的“通用翻译官”: 机器人接受同时来自多个角度的视频训练。目标是教会它:无论你是从正面、侧面还是上方观察,“投掷”都是同一种动作。他们创建了一种特殊的方法,将这些不同的视角转化为一个统一的“动作标记”(action token,即运动的数字代码),从而忽略摄像机角度,只关注运动本身。
  2. “几何 GPS”: 为了确保机器人不是在瞎猜,他们将机器人的大脑连接到了一个预训练的“3D 基础模型”(一个已经了解 3D 形状规律的高级 AI)。这就像是一个 GPS,不断检查机器人的内在地图,以确保它想象出的 3D 结构符合现实世界的几何逻辑。它迫使机器人理解球是一个球体,而不仅仅是一个随相机移动而改变形状的扁平圆圈。
  3. “禁止作弊”规则: 研究人员增加了一条特殊规则来阻止机器人寻找捷径。在常规训练中,机器人可能会偷看视频的下一帧来观察后续情况并进行模仿。为了防止这种情况,他们让机器人不仅要预测下一张图片,还要预测那张图片的“深度”(即物体距离远近)。由于机器人无法预见未来的深度,它必须真正理解运动的物理特性才能做出准确的预测。这迫使它专注于真实的运动,而不是仅仅复制像素。

该方法的成果令人印象深刻。当他们测试 LAWM-3D 时,机器人的“白日梦”变得更加真实。在模拟实验中,相比以往的方法,LAWM-3D 在预测物体如何运动、弹跳以及如何进行物理交互方面表现得更出色。例如,在模拟机器人捡起香蕉或堆叠积木时,旧方法经常会导致物体漂浮或互相穿透,而 LAWM-3D 则能让物体保持坚实并稳固地存在于 3D 空间中。论文表明,这种方法显著提高了机器人的泛化能力,这意味着它能够处理从未见过的全新任务和环境,因为它理解的是世界的 3D 规则,而非仅仅死记硬背 2D 图片。

简而言之,这篇论文认为,要教机器人理解世界,你不能仅仅给它更多的摄像头;你必须教会它如何进行 3D 思考。通过将多视角视频与严格的几何规则以及“禁止作弊”的训练方法相结合,LAWM-3D 创造了一个不仅是在观察世界,而且真正理解如何在其中运动的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →