← 最新论文
🤖 machine learning

Fast LeWorldModel

该论文介绍了 Fast-LeWorldModel,这是一种无需重构的视觉世界模型,它通过采用一种并行动作前缀预测机制来直接预测候选动作序列的未来潜变量,从而取代了自回归单步展开,进而加速了规划并减少了误差累积。

原作者: Yuntian Gao, Xiangyu Xu

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuntian Gao, Xiangyu Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试穿过一个迷宫,但你看不见墙壁。相反,你有一个“水晶球”(即 AI 模型),它会尝试猜测如果你走某条特定路径时,迷宫看起来会是什么样子。

使用这个水晶球的旧方法(称为 LeWorldModel 或 LeWM)就像是一次只走一小步:

  1. 你问:“如果我向前走,我会到哪里?”
  2. 水晶球给出一个猜测。
  3. 你采用这个猜测,然后问:“如果我从这个猜测的位置向前走,下一步我会到哪里?”
  4. 水晶球再次进行猜测。

问题所在: 这种方式很慢,因为为了看到路径的终点,你需要询问水晶球一百次。此外,如果水晶球在第 1 步时出了一个小错,这个错误会在第 2 步变得更大,到第 10 步时就会变得巨大。这就像是在玩“传声筒”游戏,信息在传递过程中会变得越来越混乱。

新的解决方案 (Fast LeWorldModel):
作者 Yuntian Gao 和 Xiangyu Xu 想到了一种更聪明的方法来使用这个水晶球。他们不再是一个接一个地询问每一步,而是同时询问整段旅程的“块”(chunks)

这可以类比为阅读一本书:

  • 旧方法 (LeWM): 你读一个词,然后猜下一个词,再猜下一个词。如果你第一个词猜错了,整个句子就会变得毫无意义。
  • 新方法 (Fast-LeWM): 你观察前几个词(“前缀”),然后瞬间跳到这个句子的结尾,看看它会导向何处。你可以同时观察前 5 个词、前 10 个词和前 20 个词。

其工作原理(用通俗易懂的语言解释)

  1. “前缀”技巧: 该模型不再是一秒一秒地预测未来,而是观察一段动作的“前缀”(例如:“向前走,左转,向前走”)。它会问:“如果我执行这整块动作,我会最终到达哪里?”
  2. 并行处理: 模型不会等待第一个猜测完成后再进行第二个猜测。它会同时计算 1 步长度的动作块、2 步长度的动作块以及 5 步长度的动作块的终点位置(即并行计算)。
  3. 不再有“传声筒”游戏: 因为每一次预测都是从你的实际当前位置开始的(而不是从一个猜测的位置开始),所以 1 步预测中的错误不会破坏 5 步预测。它们是相互独立的。

结果:更快、更聪明

论文在机器人任务(如推动方块或移动机械臂)上测试了该模型。以下是他们的发现:

  • 速度: 旧模型仅模拟一个计划的未来就需要大约 31 秒。新模型仅需 8 秒。这几乎快了 4 倍
  • 成功率: 由于新模型不会累积误差,机器人实际上能更频繁地达到目标。成功率从约 86% 提升到了 90.5%
  • 准确性: 当他们检查长距离预测的误差时,旧模型的误差增长得非常迅速;而新模型的误差保持在较小水平,且增长非常缓慢。

核心结论

作者们不仅让机器人思考得更快,还改变了它的思考方式。通过让机器人停止在想象中进行那些微小且易出错的单步尝试,转而通过观察动作序列的“块”来进行“跨越式”预测,他们创造了一个既更快速更可靠的世界模型。

这就像是从通过触摸每一根草丛来穿过黑暗森林(缓慢且容易绊倒),转变为使用手电筒一次性看清前方 20 英尺的路途(快速且安全)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →