← 最新论文
🤖 AI

Learning Visual Feature-Based World Models via Residual Latent Action

本文介绍了RLA世界模型,该模型利用从DINO残差中学习并通过流匹配预测的新型残差潜在动作表示,实现了高效、高保真的视觉特征预测,并使得机器人能够从离线视频中学习高级技能,而无需在线交互或手工设计的奖励。

原作者: Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何移动杯子、球或工具。为此,机器人需要一个“世界模型”——一种心理模拟,使其能够预测如果以某种方式移动手臂,接下来会发生什么。

长期以来,科学家们试图通过预测下一视频帧的精确像素来构建这些心理模拟(就像在建造沙堡之前,试图预测每一粒沙子)。这种方法计算量巨大、速度缓慢,且常常导致机器人“幻觉”出不存在的事物,例如杯子突然变成猫。

其他研究人员尝试预测视觉特征(如物体的大致形状和颜色),而不是原始像素。这种方法更快,但往往导致“模糊”的预测,就像透过雾蒙蒙的窗户看照片。在复杂的 3D 任务中,这些预测有时会完全崩溃,导致机器人失去对物体位置的追踪。

本文介绍了一种名为RLA-WM(残差潜在动作世界模型)的新解决方案。以下是其工作原理,使用简单的类比进行说明:

1. “增量”技巧(残差潜在动作)

作者意识到,机器人不需要预测世界的整个下一画面,而只需学习“现在”与“之后”之间的差异

  • 类比:想象你在看电影。你不需要从头开始记忆下一场景的每一帧,你只需要记住发生了什么变化。球向左移动了吗?杯子倾斜了吗?
  • 创新:作者创建了一种紧凑的“变化代码”,称为残差潜在动作(RLA)。他们将当前图像与未来图像之间的差异压缩成一个微小、高效的向量(简短的数字列表),并将其称为“动作”。
  • 为何有效:这就像给机器人提供一份“变更日志”,而不是一本全新的书。它更小、处理速度更快,并且避免了“模糊”问题,因为它只关注运动。

2. “流”机器

一旦机器人拥有了这个“变化代码”,它就需要预测该代码在未来会是什么样子。

  • 类比:想象一条河流。你不需要模拟每一滴水分子就知道河流流向何方。你只需要知道流速流向
  • 创新:他们使用了一种称为流匹配的技术。这就像一台 GPS,根据机器人的动作计算从“现在”到“未来”的最平滑路径。由于他们是在微小的“变化代码”空间(而非巨大的视频空间)中计算这条路径,因此速度极快且准确。

3. 机器人的两项超能力

本文表明,这种新模型通过以下两种具体且强大的方式帮助机器人学习:

A. 从“静默”视频中学习(无需动作标签)

  • 问题:通常,要教机器人,你需要知道确切按下了哪些按钮的视频(动作标签)。但互联网上的大多数视频(如 YouTube)只显示机器人在移动,却未告知它是如何移动的。
  • 解决方案:RLA 模型可以观察静默视频,仅通过观察运动就能推断出“变化代码”(RLA),然后教机器人模仿该运动。这就像仅通过观看他人跳舞的视频来学习跳舞,而无需编舞师告诉你舞步。

B. 在“梦境”中训练(视觉强化学习)

  • 问题:在现实世界中训练机器人既缓慢又充满风险。如果机器人打碎了杯子,你必须把它捡起来再试一次。
  • 解决方案:作者构建了一个系统,让机器人完全在模拟环境(世界模型)中进行练习。
    • 机器人“梦”到一个任务。
    • 它在梦境中尝试一个动作。
    • RLA-WM 即时预测结果。
    • 如果梦境结果看起来像它之前看到的成功视频,机器人就会获得“奖励”。
    • 它在脑海中重复这一过程数百万次,无需接触真实物体,也无需人工评估其表现,即可学会完美的策略。

结果

本文声称,该方法具有以下优势:

  1. 更准确:与之前试图生成完整视频或模糊特征的方法相比,它能更好地预测未来状态。
  2. 快得多:由于它处理的是微小的“变化代码”而非庞大的视频文件,其速度比视频生成模型快几个数量级。
  3. 更可靠:它不会“幻觉”出奇怪的物体,而是严格遵循场景的物理规律。

简而言之,这篇论文教导机器人停止试图“绘制”未来,而是开始简单地计算到达那里所需的“步骤”,从而使它们能够学得更快、更聪明,并能从更多样化的视频中学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →