← 最新论文
🤖 AI

Mirage2Matter: A Physically Grounded Gaussian World Model from Video

该论文介绍了“Simulate Anything”,这是一个利用 3D 高斯泼溅(3D Gaussian Splatting)和生成模型从多视图视频中重建真实世界环境的框架,旨在创建具有物理基础且可编辑的仿真环境,从而使视觉-语言-动作(Vision Language Action)模型无需昂贵的传感器或真实世界交互数据即可实现强大的零样本性能。

原作者: Zhengqing Gao, Ziwen Li, Xin Wang, Jiaxin Huang, Zhenyang Ren, Mingkai Shao, Hanlue Zhang, Tianyu Huang, Yongkang Cheng, Yandong Guo, Runqi Lin, Yuanyuan Wang, Tongliang Liu, Kun Zhang, Mingming Gong

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengqing Gao, Ziwen Li, Xin Wang, Jiaxin Huang, Zhenyang Ren, Mingkai Shao, Hanlue Zhang, Tianyu Huang, Yongkang Cheng, Yandong Guo, Runqi Lin, Yuanyuan Wang, Tongliang Liu, Kun Zhang, Mingming Gong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个机器人如何拿起香蕉或按下按钮。旧的方法是让机器人在现实世界中进行练习。但那样既慢又贵,而且机器人在学习过程中还会弄坏东西。

新的方法是让机器人在视频游戏(模拟器)中进行练习。但这里有一个问题:大多数视频游戏看起来很假。如果机器人在卡通世界里学习,当它看到真实的、杂乱且有纹理的世界时,它会感到困惑。这就像是教一个人在平坦、灰色的屏幕上开车,然后期望他能应对颠簸、多雨的道路。

Mirage2Matter 是一个修复这一问题的全新工具。它构建了一个看起来和表现起来都与现实世界完全一致的模拟器,但它是完全基于你用普通相机拍摄的简单视频构建而成的。

以下是它的工作原理,我们使用一些简单的类比:

1. “魔法照片” (3D 高斯泼溅 - 3D Gaussian Splatting)

通常,要创建一个 3D 世界,你需要昂贵的激光器或特殊的相机。Mirage2Matter 则不同。它通过获取一段关于某个房间或某个物体(比如一根面包)的普通照片或短视频即可完成。

你可以把这想象成拍了一张照片,然后神奇地将其变成了一个 3D 雕塑。论文中称之为 3D 高斯泼溅 (3D Gaussian Splatting)。想象一下,这个房间是由数百万个微小的、隐形的、发光的“气球”(高斯体)组成的。当你从一个角度看时,它们看起来像一张照片;当你移动头部时,它们会重新排列,看起来像一个 3D 物体。这捕捉到了真实房间的精确外观、纹理和光照。

2. “幽灵外壳” (物理特性 vs. 外观)

这里有一个问题:这些“发光的气球”看起来很棒,但它们太软了,无法被推动或抓取。如果机器人尝试推动一个气球,它会直接穿过气球。机器人需要碰撞到坚实的东西。

因此,该系统进行了第二个技巧。它观察视频中的物体,并利用 AI 在其周围构建一个“幽灵外壳”(一个实心的 3D 网格/mesh)。这个外壳对眼睛来说是隐形的,但对机器人的物理引擎来说是坚实的。

  • 类比: 想象一个逼真的蜡像。它看起来完全像人类(3D 高斯部分),但在内部它有一个坚硬的骨架(网格部分),这样你就可以推它而不会让它融化。

3. “圆规与直尺” (校准 - Calibration)

即使机器人的外观很真实,也有一个坚实的壳,但尺寸可能不对。机器人可能会认为桌子有 10 英尺高,而实际上只有 3 英尺。

Mirage2Matter 通过一个校准板 (calibration board) 解决了这个问题。在拍摄之前,你在地板上放置一块具有已知测量尺寸的特殊板。系统利用它作为“尺子”,来拉伸或收缩数字世界,使其尺寸与现实世界的尺寸完美匹配。它还对齐了机器人的“眼睛”(摄像头),使得机器人在模拟器中看到的内容与它在现实中看到的位置完全一致。

4. “科学怪人电影” (混合渲染 - Hybrid Rendering)

现在,机器人需要练习移动。系统在物理引擎中运行机器人的动作(在这里,坚实的壳会正确地相互碰撞)。然后,系统将机器人移动的视频“缝合”到真实的背景中。

  • 类比: 想象一部电影,背景是一个高清的真实厨房视频,但其中的演员是一个 CGI(电脑成像)角色。通常情况下,CGI 看起来很假。但在这种情况下,系统将真实的机器人从视频中剪切出来,并将其粘贴到真实的背景上,从而使光影效果完美匹配。

结果:零样本成功 (Zero-Shot Success)

论文通过这个“魔法模拟器”对机器人进行了训练。在训练期间,他们从未向机器人展示过真实世界。

当他们把训练好的机器人放入真实的厨房去捡起香蕉或按下按钮时,机器人的表现几乎与由人类在现实世界中训练的机器人一样好。

  • 结论: 机器人不需要任何额外的“微调”或在现实世界中的练习。它在模拟器中学习,并立即掌握了在现实中执行任务的方法。

为什么这很重要?

  • 无需特殊设备: 你不需要昂贵的激光器;一部手机或普通相机就足够了。
  • 不会弄坏东西: 机器人在模拟器中可以崩溃一千次,而不会损坏任何一个真实的物体。
  • 完美匹配: 因为模拟器是根据机器人即将工作的实际房间构建的,所以当机器人进入现实世界时,不会有任何“意外”。

简而言之,Mirage2Matter 将一段简单的视频变成了现实世界的完美数字孪生,让机器人能够在接触现实世界之前,快速且安全地学习复杂的物理任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →