← 最新论文
🤖 AI

Instant NuRec: Feed-Forward 3D Gaussian Reconstruction for Driving Scene Simulation

本文介绍了 Instant NuRec,这是一种前馈神经网络模型,它通过单次前向传播即可从多视图日志中快速重建完全可模拟的 3D 高斯泼溅(Gaussian Splatting)驾驶场景,在速度和渲染质量方面均显著优于现有方法,同时支持动态元素和非针孔相机。

原作者: NVIDIA, :, Jiahui Huang, Jiawei Ren, Michal Tyszkiewicz, Bjoern Haefner, Michael Shelley, Xin Kang, Seung Wook Kim, Ning Xu, Qi Wu, Janick Martinez Esturo, Shengyu Huang, Nick Schneider, Laura Leal-Ta
发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: NVIDIA, :, Jiahui Huang, Jiawei Ren, Michal Tyszkiewicz, Bjoern Haefner, Michael Shelley, Xin Kang, Seung Wook Kim, Ning Xu, Qi Wu, Janick Martinez Esturo, Shengyu Huang, Nick Schneider, Laura Leal-Taixe, Zan Gojcic, Sanja Fidler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图构建一个完美的、可交互的现实世界视频游戏,但你不能使用游戏引擎,而是必须仅凭一堆从行驶中的汽车上拍摄的照片,从零开始构建它。这就是“神经重建”(neural reconstruction)所面临的挑战——在这个领域,科学家们正在教计算机如何将扁平的照片转化为你可以步入其中的 3D 世界。多年来,实现这一目标的最佳方法就像是用粘土雕刻杰作:你必须针对单个场景,花费数小时(甚至数天)的时间进行细致的切割和抛光,并手动调整每一个微小的细节。这种方法很精美,但构建整个城市甚至整个世界实在太慢了。

你即将阅读的论文介绍了一个名为 Instant NuRec 的新工具。把它想象成一个用于 3D 世界的“神奇即时相机”。它不再是一个接一个地雕刻场景,而是观察一段来自汽车摄像头的短视频,并在一次快速的处理闪烁中,吐出一个完整的、可游玩的 3D 世界。它将世界分为三层:像道路和建筑这样无聊且不动的物体;像其他车辆和行人这样移动的物体;以及天空。其目标是让自动驾驶汽车的程序员能够在这些虚拟世界中测试他们的软件,而无需等待数小时来构建世界,从而让教汽车驾驶的过程变得更安全、更快速。


“神奇”即时相机

想象你是一名自动驾驶汽车开发者。你拥有你的车队拍摄的数百万英里的视频资料,并且你需要通过这些资料来测试你的 AI。在过去,要将其中一段视频转化为 3D 模拟场景,你必须运行一个耗时且昂贵的过程,每个场景大约需要 75 分钟。这就像是每次想吃一片蛋糕时,都必须从头开始烘焙整个蛋糕。你每天只能烘焙出几块蛋糕,这意味着你无法频繁地测试你的配方。

现在,由 NVIDIA 推出的新模型 Instant NuRec 改变了游戏规则。它不再是从头开始烘焙蛋糕,而是像拥有一台可以瞬间打印出完美、可食用的蛋糕的机器,只需 1.5 秒

该模型获取一段来自汽车摄像头的短视频剪辑(通常为 10 到 20 秒长),并在一次“前向传播”(这只是一个高级说法,意思就是“快速看一眼”)中,构建出一个完整的 3D 世界。这个世界不仅仅是一个扁平的视频;它是一个由数百万个被称为 高斯点(Gaussians) 的微小发光点组成的层级化 3D 环境。你可以把这些点想象成一团闪闪发光的亮片云,计算机通过排列这些亮片来使场景看起来与真实世界完全一致。

它是如何构建世界的

这种“魔法”之所以发生,是因为该模型知道如何像搭建舞台布景一样,将世界划分为三个截然不同的部分:

  1. 静态层(The Static Layer): 这是永远不会移动的背景——道路、建筑、树木和路灯。模型将其捕捉为一个稳固、不变的 3D 图层。
  2. 动态层(The Dynamic Layer): 这是移动的角色——其他的汽车、骑行者和行人。模型并没有仅仅将他们冻结在原地,而是给了他们一个“剧本”。它计算出他们的路径,并创建一个平滑的移动轨迹,使他们能像在真实视频中那样在模拟环境中行驶或行走。
  3. 天空立方体贴图(The Sky Cubemap): 由于天空非常遥远,没有特定的形状,模型将天空包裹在一个巨大的、360 度的全景图片立方体中,这个立方体位于世界的外部,看起来就像视频游戏中的天空盒(skybox)。

此外,模型还会修正颜色。由于汽车上的不同摄像头看到的颜色可能略有差异(有的可能偏红,有的可能偏蓝),模型会应用快速的“色彩校正”,以确保整个世界看起来视觉统一,就像专业照片编辑修复照片一样。

速度为何如此重要

最令人印象深刻的部分不仅在于它有效,还在于它的速度。研究人员在海量的驾驶剪辑数据集上测试了该模型。虽然旧的、缓慢的方法(称为 NuRec)构建一个场景需要约 75 分钟,但 Instant NuRec 大约只需 1.5 秒。这实现了超过 1,000 倍 的加速。

为了直观理解:如果旧方法构建一个场景需要一整个工作日,那么新方法在同样的一天内可以构建超过 2,000 个场景。这意味着开发者终于可以在数百万种不同的场景中测试他们的自动驾驶软件,而不仅仅是区区几个。

它真的有效吗?

你可能会问:“如果它这么快,效果真的好吗?”作者进行了严格的测试。他们将这种“即时”生成的 3D 世界与那些缓慢但高质量的生成结果进行了对比,甚至还与真实的视频素材进行了对比。

  • 视觉质量: 当观察图像时,即时生成的版本比其他快速方法更加清晰锐利。在标准的 Waymo 公开数据集测试中,它的图像质量比排名第二的快速方法高出了 2.01 dB。这听起来可能是一个很小的数字,但在图像质量领域,这是一个巨大的飞跃。
  • 驾驶测试: 然而,真正的考验在于自动驾驶汽车是否能在这些虚拟世界中实际行驶。研究人员在“缓慢且完美”的世界和“快速且即时”的世界中运行了相同的驾驶软件。他们发现,软件在两种环境下做出的决策和安全性表现完全一致。这些“即时”生成的场景足以信赖,可以用于严肃的测试。

“选择性”捷径

论文还提到了一种聪明的技巧,如果你不需要极致的细节,可以让事情变得更快。模型可以选择使用较少的“闪光点”(高斯点)来专注于场景的重要部分。他们称之为 选择性(Selective) 策略。这种方法将每个视角的点数减少了约 3 倍(从大约 351,000 个减少到 120,000 个),但几乎保持了原有的质量。这就像是决定你只需要给电影场景中的主角上色,而不是给每一片树叶都涂上颜色,就能达到同样的效果。

它目前还做不到什么

作者坦诚地说明了局限性。虽然该模型在处理移动的车辆和行人方面表现出色,但它无法完美捕捉极其细微、扭动的动作,比如一个人挥动手臂或狗抖动皮毛。它将移动物体视为沿着几个关键点之间的平滑直线运动。如果你需要看到行人手指的精确动作,这个模型目前还达不到那个水平。此外,它在经过训练的特定摄像头类型下表现最好;如果你给它一个它从未见过的奇特的新型摄像头设置,它可能需要额外的训练才能表现正确。

总结

Instant NuRec 是让现实世界的 3D 模拟变得快速且实用的一个突破。它将过去的“缓慢且完美”的方法转变为现实世界中的“快速且足够好”的方法。通过将 75 分钟的等待缩短为 1.5 秒的瞬息,它为自动驾驶汽车公司开辟了大门,让他们能够以前所未有的规模来测试其软件。它不仅仅是在构建一个世界,它是在构建一个游乐场,让驾驶的未来可以在光速之下被测试、被改进、并趋于完美。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →