← 最新论文
💻 computer science

Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection

本文介绍了一种自监督框架,该框架通过将视频特征反投影到体积潜空间中,并将其建模为动作条件的平流过程,从而学习隐式 3D 物理动力学,使模型能够在不依赖显式物理模拟器的情况下,仅从单目视频中涌现出具有物理一致性的长期 3D 世界模型。

原作者: Zican Wang, Niloy Mitra

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Zican Wang, Niloy Mitra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:教 AI “感受”物理规律

想象你正在看一段水杯被撞倒的视频。标准的 AI 视频生成器可能会观察像素并猜测:“好吧,水看起来在溅起,所以我让下一帧看起来像是在溅水。”它擅长模仿“外观”,但它并不真正理解水为什么会溅起,或者如果你再次推动它时它会如何表现。它经常无法保持杯子的完整性,或者会让水像魔法一样飘走。

这篇论文介绍了一种名为**神经体素动力学(Neural Voxel Dynamics)**的新系统。该系统不再仅仅是猜测下一帧像素应该长什么样,而是尝试在计算机内部构建一个隐藏的 3D“心理模型”。它通过观察视频来学习真实的物理规则(如重力、碰撞和流体流动),而不需要人类向它教授数学公式。

问题所在:“平面”与“深度”之争

目前的视频 AI 模型就像是一个盯着平坦画布观察的画家(2D)。它们擅长制作漂亮的图像,但不理解球滚到树后依然存在;在它们看来,球只是消失了。它们缺乏物体恒常性物理一致性

作者认为,要真正理解物理学,AI 需要停止以 2D 图像的形式思考,开始在 3D 空间中思考。

解决方案:这个“隐形乐高”盒子

研究人员构建了一个系统,能将一段平面的视频转化为由被称为**体素(Voxels)**的隐形方块组成的 3D 结构(可以把它们想象成填充房间的微小乐高积木,即 3D 版的像素)。

以下是该系统的运作步骤:

1. 将视频提升至 3D(“去扁平化”机器)

系统获取一段常规视频(仅仅是随时间变化的平面图像),并利用一个“深度猜测器”来判断物体的远近。然后,它将视频的特征投影到一个由这些隐形乐高方块组成的 3D 网格中。

  • 类比: 想象你正在看一场平面的皮影戏,突然意识到那些影子其实是悬挂在房间里的 3D 木偶。该系统通过 2D 影子重建出了 3D 房间。

2. “特征平流”(隐形的风)

一旦世界被构建成一个 3D 方块网格,系统就不会使用沉重的数学方程(如计算摩擦力或黏度)来模拟物理。相反,它将物理过程处理得像是烟雾在空气中移动

  • 类比: 想象这些 3D 方块中充满了隐形的“信息烟雾”。当你推动一个方块(施加一个力)时,系统会学习这种“烟雾”是如何漂移并旋入下一个方块的。
  • 如果你推动一个刚性方块(如立方体),“烟雾”会作为一个整体块移动。
  • 如果你推动一种流体(如水),“烟雾”会扩散并溅起。
  • AI 会自动学习这些模式。它不需要被告知“这是水”或“这是石头”,它只需要学习当施加“这种类型的力”时,会发生“这种类型的流动”。

3. 从“幽灵”观测中学习

由于 AI 只能从单一摄像机角度观察,它无法看到物体的背面。该系统足够聪明,能够猜测那些“不可见”方块中正在发生的事情。

  • 类比: 如果你看到一个球滚到了墙后,人类知道球仍然在那里,只是被挡住了。这个 AI 也做同样的事情。它在隐藏的 3D 方块中保留了这个球的“幽灵”,以便当球从另一侧出现时,它的行为依然符合逻辑。

为什么这意义重大

大多数其他方法试图将 AI 与传统的物理引擎(如视频游戏中所使用的引擎)结合起来。但这些引擎需要人类手动设置规则:“这是固体”、“这是液体”、“这很重”。

这种新方法是自监督的。它仅通过观看视频就能自主学习一切。

  • 它可以在同一个系统中处理刚体(岩石)、流体(水)和烟雾,而无需切换模式。
  • 它创建了一个理解因果关系的“世界模型”。如果你推一个杯子,它知道杯子会倒下,即使视频在杯子落地前就结束了。

实验结果

研究人员在涉及跳动球体、倾倒液体和烟雾的多个基准测试(如 CLEVRER 和 PhysInOne)中测试了他们的系统。

  • 结果: 他们的模型比以往的 AI 模型更准确地预测了未来的运动。它保持了物体的完整性,使流体流动自然,并且不会让物体消失或瞬间移动。
  • 证明: 即使在仅使用单一相机视角(这更难)的情况下进行测试,它在理解 3D 物理方面仍然比仅观察 2D 像素的模型表现更好。

总结

简而言之,这篇论文教会了 AI 不再仅仅是“绘制”视频的下一帧,而是开始在隐藏的网格中“模拟” 3D 世界。通过将物理学视为 3D 方块中的信息流,它学会了预测现实世界的移动、碰撞和流动,而无需人类为它编写物理教科书。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →