← 最新论文
🤖 machine learning

Beyond the Next Step: Variable-Length Latent World Models for Long-Horizon Planning

本文介绍了变长潜世界模型(Variable-length Latent World Models, VLWMs),这是一个通过课程训练学习预测变长动作时界内的未来潜状态的框架,从而克服了传统单步模型的复合误差,并显著提升了长时界规划性能。

原作者: Tianqi Du, Qi Zhang, Yifei Wang, Yisen Wang

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianqi Du, Qi Zhang, Yifei Wang, Yisen Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何通过迷宫或将方块推到特定位置。为了做到这一点,机器人需要一个“心理地图”或世界模型(World Model)。这个模型就像是在机器人的大脑中运行的一个模拟器,让它能在实际行动之前,先在脑海中构思:“如果我这样移动手臂,会发生什么?”

长期以来,这些心理模拟器都有一个重大缺陷:它们就像一个人走一步、看一眼落点、再走一步、再看一眼。如果机器人在第一步时犯了一个微小的错误,这个误差会随着后续的每一步而不断放大。到它尝试规划一段长途旅程时,它的心理地图已经完全偏离了。这被称为复合误差(compounding error)

你提供的论文介绍了一种名为 VLWM(可变长度潜空间世界模型,Variable-length Latent World Models) 的新系统。以下是其工作原理的简单解释:

1. 旧方法:“小碎步”问题

把旧的模型(比如他们称之为 LeWM 的模型)想象成一个通过一次只练习一步来学习走路的学生。

  • 训练过程: 老师只问:“如果你走一步,你会落在哪里?”
  • 问题所在: 当学生尝试规划一段 100 步的旅程时,他必须在脑海中连续模拟 100 个单步动作。如果他在第 1 步时踉跄了一下,那么他对第 100 步的预测就会变得极其离谱。他们擅长短途旅行,但在长途规划方面表现糟糕。

2. 新方法:“蛙跳式”法 (VLWM)

作者提出了一种更聪明的训练机器人大脑的方式。与其仅仅练习走一步,不如教会机器人预测任何距离之外的未来

  • 可变长度训练: 想象一位老师问学生:“如果你走 3 步,你会落在哪里?”然后问:“如果你走 5 步,你会落在哪里?”接着问:“如果你走 10 步呢?”
  • 结果: 机器人学会了“跳过”中间的过程。它不需要计算每一个细微的动作才能到达终点;它可以直接跳跃到 5 步或 10 步序列后的目的地。这防止了微小误差的堆积。

3. “动作即标记”技巧 (The "Action-as-Token" Trick)

在旧模型中,机器人的动作(如“向左移动”或“向前推”)是以一种僵化的数学方式隐藏起来的。这就像是在读一本单词被粘在一起的书。

  • 新技巧: 作者将每个动作视为一个独立的标记(token)(就像句子中的一个单词)。他们将“状态”(机器人在哪里)和“动作”(它在做什么)混合成一个长序列,就像一个句子一样。
  • 为什么有效: 这使得机器人可以阅读由 3 个动作组成的句子或由 10 个动作组成的句子,而无需改变其大脑结构。它非常灵活且自然。

4. “爬山策略”(课程学习)

你不能在第一天就教一个婴儿跑马拉松。如果你试图立即教机器人预测 100 步,它会感到困惑并失败。

  • 解决方案: 他们使用了一种课程(Curriculum)
    • 第一阶段: 机器人只学习预测 1 步。
    • 第二阶段: 它学习预测 1 步或 2 步。
    • 第三阶段: 它学习预测 1、2、3 或 4 步。
    • 最终阶段: 它可以预测任何最大距离内的步数。
  • 这在增加长程规划的复杂性之前,先建立了一个强大的短期技能基础。

5. 规划:“分块”策略 (The "Chunking" Strategy)

当机器人实际需要解决问题(如导航迷宫)时,它并不只使用一种方法。它拥有一个策略工具箱:

  • 固定跳跃: 它决定每次总是跳跃 5 步。
  • 随机跳跃: 它跳 2 步,然后跳 7 步,再跳 3 步,进行随机跳跃。
  • 由长到短: 它从大跨度的跳跃开始以获得大致路径,然后在接近目标时切换到微小、精确的跳跃。
  • 优势: 因为机器人在训练中已经学会了处理任何跳跃尺寸,它可以根据需要随时混合使用这些策略,从而避免陷入困境。

结果:他们发现了什么?

作者在三个不同的任务上测试了该系统:

  1. PushT: 推动一个 T 形方块。
  2. OGBench-Cube: 一个机械臂抓取立方体。
  3. TwoRoom: 一个机器人通过一扇门从一个房间导航到另一个房间。

研究发现:

  • 短途旅行: 新系统表现得与旧系统一样出色。
  • 长途旅行: 新系统的表现显著更好。在“TwoRoom”任务中,当目标很远时,旧系统的成功率仅为 36%,而新系统的成功率达到了 68%
  • 原因: 旧系统因为采取“走一步看一步”的方式产生了“复合误差”,从而迷失了方向。而新系统通过学会观察大局,保持了航向。

总结

该论文认为,要让机器人擅长长期规划,我们不应该只教它们一次走一步。相反,我们应该教它们以不同大小的分块来预测未来,从从小步开始,逐渐过渡到大步。这种简单的改变让它们能够在不迷失方向的前提下,规划得更远。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →