← 最新论文
🤖 AI

Latent Video Prediction Learns Better World Models

本文提出了一项系统性研究,证明潜在视频预测模型(如 V-JEPA 2.1)在五个鲁棒性维度上均优于传统的基于重建和基于监督的模型,从而确立了它们作为构建鲁棒世界模型的更优候选者。

原作者: Ali J Alrasheed, Aryan Yazdan Parast, Basim Azam, James Bailey, Naveed Akhtar

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali J Alrasheed, Aryan Yazdan Parast, Basim Azam, James Bailey, Naveed Akhtar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过观看视频来教机器人理解物理世界。你希望它成为一个“世界模型”——一个不仅能识别物体,还能理解事物如何运动、相互作用以及随时间变化的系统。

长期以来,研究人员仅凭单一测试分数来评判这些机器人:“它在完美、干净的测试中答对了多少视频?”本文认为,仅凭晴天下的行驶速度来评判汽车的安全性,就像这种单一分数一样。它无法告诉你汽车如何应对雨天、坑洼,或者轮胎爆裂时会发生什么。

本文的作者决定让四种不同的“机器人大脑”(视频 AI 模型)接受更严苛、更贴近现实的考验,看看哪一个真正最懂世界。

四位参赛者

他们比较了四种流行的 AI 模型,这些模型属于三种不同的学习风格:

  1. 像素画家(VideoMAEv2): 这些模型试图通过填补视频中的缺失部分来学习,就像“按数字填色”游戏,它们试图猜测隐藏帧的确切颜色和像素。
  2. 匹配者(VideoPrism): 这些模型试图通过将相似的视频分组来学习,专注于匹配视觉模式。
  3. 未来预测者(V-JEPA 2 和 2.1): 这些模型不试图重绘画面。相反,它们试图在隐藏的内心空间中猜测接下来发生的意义或“要点”。它们会问:“如果我看到这个动作,接下来会发生什么样的事件?”

五项现实世界测试

研究人员没有只进行一项测试,而是让模型经历了五个模拟现实问题的具体挑战:

1. “坏相机”测试(抗干扰鲁棒性)

  • 场景: 想象视频信号出现故障。画面模糊、有雪花点或静态噪声。
  • 结果: 未来预测者是冠军。即使视频看起来糟糕透顶,它们仍能弄清楚发生了什么。像素画家则彻底崩溃。因为它们被训练得关注每一个像素的颜色,一点点雪花或噪声就让它们完全困惑。未来预测者学会了忽略“噪声”,专注于故事。

2. “魔术戏法”测试(细粒度辨别)

  • 场景: 研究人员展示了人们假装做某事(如假装倒水)与真正做某事的视频。动作看起来几乎一模一样,但在“假装”版本中,实际上并没有水流出来。
  • 结果: 这正是未来预测者大放异彩的地方。它们能区分真实和虚假的动作。像素画家被愚弄了。它们过于关注手部动作的视觉细节,而忽略了没有水流出的微妙事实。未来预测者理解了相互作用的物理原理,而不仅仅是画面。

3. “眼罩”测试(遮挡鲁棒性)

  • 场景: 想象有人用手遮住镜头,或者一辆车在镜头和主体之间驶过,挡住了视线。
  • 结果: 未来预测者保持了冷静。即使视频部分缺失,它们仍能猜出发生了什么。有趣的是,匹配者在纸面上看起来非常稳定(它们的内部数学变化不大),但它们实际猜测动作的能力却崩溃了。这就像一个死记硬背了答题卡形状却不知道答案的学生;试卷看起来没问题,但他们考试不及格。

4. “时间机器”测试(时间方向性)

  • 场景: 研究人员倒放视频。
  • 结果: 这是最具揭示性的测试。当一个人“推”箱子的视频被倒放时,未来预测者正确地意识到动作已翻转为“拉”。它们理解了时间是有方向的。其他模型大多只是感到困惑或随机猜测。它们没有学会“推”和“拉”在时间上是相反的;它们只是看到了形状在移动。

5. “冻结与灵活”测试

  • 场景: 通常,为了让模型擅长特定任务,你必须用大量标注数据从头重新训练它。研究人员问道:“一个冻结(未重新训练)的模型,是否仍能击败完全重新训练的模型?”
  • 结果: 是的。即使在冻结状态下,仅通过一个简单的“探针”来读取其思维,未来预测者在“坏相机”和“眼罩”测试中仍击败了完全重新训练的模型。这表明,它们最初的学习方式(预测未来)比单纯死记硬背答案建立了更坚实的基础。

核心结论

本文得出结论:在“内心空间”(潜在空间)中预测未来,比试图完美重绘画面(像素重建)是更好的学习世界的方式。

  • 像素画家就像能完美复制照片的艺术家,但如果光线改变或照片部分撕裂,它们就会感到困惑。
  • 未来预测者就像侦探。它们不在乎衬衫的确切蓝色色调;它们关心的是故事。它们理解如果你推一个杯子,它会移动;如果你倒放那个视频,它就是在被拉。

作者认为,为了构建真正的机器人或 AI“世界模型”,我们需要停止仅仅检查它们是否在干净测试中给出了正确答案。我们需要检查它们是否能处理噪声、缺失信息以及时间的流动。那些通过预测未来来学习的模型,似乎才是真正理解世界运作方式的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →