← 最新论文
💻 computer science

VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation

VDAWorld 引入了一种创新的框架,该框架利用视觉-语言模型将图像-文本对自主蒸馏为抽象且具身化的场景表示,并选择合适的物理模拟器,从而克服了生成式视频模型的局限性,在交互控制、反事实生成和物理推理方面达到了最先进的性能。

原作者: Felix O'Mahony, Roberto Cipolla, Ayush Tewari

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Felix O'Mahony, Roberto Cipolla, Ayush Tewari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一段多米诺骨牌倒下的视频。一个标准的 AI 视频生成器试图通过猜测像素(那些微小的彩色点)应该长什么样来预测下一帧。这就像一位艺术家试图通过观察当前的画作并猜测下一笔该怎么画,从而来描绘未来。有时,这效果极佳;但通常情况下,这位艺术家会感到困惑:一个多米诺骨牌可能会凭空消失,或者像幽灵一样穿过另一个骨牌,甚至整个场景的物理法则会突然发生改变。

VDAWorld 采取了一种完全不同的方法。它不再试图去“描绘”未来,而是扮演了一个聪明的建筑师与物理老师的结合体

以下是它的工作原理,分为简单的几个步骤:

1. “翻译官”(VLM 智能体)

当你给 VDAWorld 一张图片和一段描述(比如“桌子上的一排积木”)时,它不仅仅是在盯着像素看。它使用一个强大的 AI “翻译官”(称为视觉语言模型,Vision-Language Model)来观察场景,并询问:“这是一个什么样的世界?”

  • 类比: 想象你把一张游泳池的照片交给一位翻译官。普通的 AI 可能会试图猜测下一秒水的颜色。而 VDAWorld 的翻译官会看着照片说:“啊,这是水。我需要使用**流体物理学(Fluid Physics)**规则手册。”
  • 如果照片显示的是一叠木制积木,翻译官会说:“这是固体物质。我需要使用**刚体(Rigid Body)**规则手册。”
  • 如果照片是一个游戏的绘图,它会说:“这是逻辑。我需要使用**游戏规则(Game Rules)**规则手册。”

2. 构建“蓝图”(抽象化)

一旦翻译官知道了规则,它就会忽略那些杂乱的细节(比如木头的纹理或阴影),并构建出一个干净、数学化的蓝图

  • 类比: 这就像一名木匠看着一堆乱七八糟的木材,决定建造一张桌子。他们不在乎木屑或木头的颜色;他们在乎的是尺寸和接缝。VDAWorld 剥离了这些“噪音”,创建了一个计算机可以完美理解的简化、结构化的模型。

3. 雇佣“模拟器”(引擎)

随后,翻译官会编写一段计算机程序(代码)来充当模拟器。这并不是一段视频,而是一套指令,它会说:“如果我推这个方块,重力会将它向下拽,然后它会撞击下一个方块。”

  • 类比: VDAWorld 不是在猜测接下来会发生什么,而是构建了一个微型的虚拟实验室。它把方块放入这个实验室,让物理定律来主导一切。因为它是运行在真实的物理规则之上的,所以方块不可能穿过彼此,也不可能凭空消失。它们必须表现得符合逻辑。

4. “如果……会怎样?”的超能力(交互性)

这正是 VDAWorld 优于标准视频 AI 的地方。因为它构建了蓝图和模拟器,所以你可以即时改变规则并观察结果。

  • 类比: 如果你正在观看一段普通的多米诺骨牌倒下的视频,你无法停止时间或增加更多骨牌。但使用 VDAWorld,你就是手持遥控器的导演。
    • 修改剧本: 你可以告诉 AI,“其实,再加两个多米诺骨牌吧,”然后它会更新蓝图并重新运行模拟。
    • 改变物理法则: 你可以要求,“让重力变强,”或者“让水漂浮起来,”模拟器会根据你的新规则立即重新计算结果。
    • 修复错误: 如果 AI 不小心造出了一座看起来很奇怪的桥,你可以通过编辑代码来修复这座桥,模拟也会随之更新。

为什么这更好?

论文声称,标准的视频 AI 就像是即兴演员,他们擅长让画面看起来很真实,但经常会忘记剧本(物理定律)。VDAWorld 则像是一位拥有实验室的科学家。它最初看起来可能不像电影那样“华丽”或具有照片级的写实感,但它保证了物理规律的正确性。

  • 没有魔法: 物体不会消失或融合。
  • 没有猜测: 它根据规则而非仅仅根据模式来计算未来。
  • 可控性: 你可以提出“如果……会怎样?”的问题,并得到一个逻辑性的答案,而不是一段随机的视频片段。

简而言之,VDAWorld 不仅仅是在预测未来;它在构建一个微小的、可交互的世界,在这个世界里,未来的走向是基于现实世界的运作方式计算出来的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →