← 最新论文
💻 computer science

Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method

本文介绍了迄今为止规模最大的语义占据数据集 Nuplan-Occ,以及一个利用该数据通过时空解耦架构和新型传感器感知渲染技术联合生成高保真 4D 语义占据、多视角视频和激光雷达点云的统一框架。

原作者: Bohan Li, Xin Jin, Hu Zhu, Hongsi Liu, Ruikai Li, Jiazhe Guo, Kaiwen Cai, Chao Ma, Yueming Jin, Hao Zhao, Xiaokang Yang, Wenjun Zeng

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Bohan Li, Xin Jin, Hu Zhu, Hongsi Liu, Ruikai Li, Jiazhe Guo, Kaiwen Cai, Chao Ma, Yueming Jin, Hao Zhao, Xiaokang Yang, Wenjun Zeng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人如何驾驶汽车。为了安全地做到这一点,机器人需要在数百万种不同的驾驶场景中练习:雨夜、拥挤的城市街道以及阳光明媚的高速公路。但拍摄真实生活既昂贵又缓慢,而且如果机器人犯错,还会带来危险。

本文介绍了UniScenev2,这是一个“数字孪生工厂”,能够即时生成逼真的 4D 驾驶世界,供机器人进行练习。你可以把它想象成一个高科技视频游戏引擎,它不仅能生成漂亮的画面,还能创建自动驾驶汽车所需的实际物理环境和传感器数据。

以下是他们构建该系统的简单解释:

1. 庞大的图书馆:Nuplan-Occ

要构建一个优秀的模拟器,你需要海量的真实世界示例库供其学习。作者创建了Nuplan-Occ,他们将其描述为“迄今为止最大的语义占据数据集”。

  • 类比:想象一下,试图通过看一张汉堡的照片来学习烹饪。现在想象拥有一个图书馆,其照片数量是以往任何图书馆的19 倍,视频帧数是18 倍。这就是 Nuplan-Occ。
  • 它是什么:这是一个巨大的 3D 地图集合,其中每一个空间块(例如体素)都被标记。它确切地知道道路在哪里、行人在哪里、交通锥在哪里,且都在 3D 空间中。

2. 工厂:UniScenev2

一旦拥有了图书馆,他们便构建了一个统一框架(即工厂),能够同时生成三样东西:

  1. 3D 语义占据:世界的 3D 地图(场景的“骨架”)。
  2. 多视角视频:来自所有角度的逼真摄像头画面。
  3. LiDAR 点云:自动驾驶汽车用于测量距离的激光扫描数据。

大多数以前的模拟器只能很好地生成其中一项,或者将它们分开生成。UniScenev2 则能同时生成所有这些内容,确保它们完美匹配。

3. 秘诀:他们如何使其运作

本文重点介绍了他们为了让这个工厂顺利运行而使用的三个巧妙技巧:

A. “解混”方法(时空解耦)
生成移动的城市场景很难,因为你必须同时弄清楚事物“在哪里”(空间)以及“如何移动”(时间)。

  • 类比:想象试图绘制一辆移动的汽车。如果你试图同时绘制旋转的车轮和向前行驶的汽车,可能会搞得一团糟。
  • 解决方案:他们将任务拆分。首先,AI 学习扩展场景(让道路更长更宽)。然后,第二个 AI 学习让场景动起来(让汽车行驶、行人走动)。通过将这些任务分离,结果变得更加清晰和逼真。

B. 视频的“幽灵地图”(高斯泼溅)
为了生成逼真的视频,AI 需要一个指南。他们使用了一种称为“高斯泼溅”(Gaussian Splatting)的技术,将 3D 地图转换为“稀疏点图”(点云),作为视频生成器的指南。

  • 类比:将 3D 地图想象成一幅粗略的草图。为了制作视频,他们将这幅草图转化为一个“幽灵般”的点云,精确显示建筑物和汽车的边缘位置。这有助于视频生成器确切知道在哪里绘制线条,防止图像模糊或扭曲。他们还添加了一个“校准”步骤(使用一种称为无迹变换的方法),以消除任何晃动或失真,确保点与摄像头视角完美对齐。

C. LiDAR 的“传感器翻译器”
自动驾驶汽车使用激光雷达(激光)来感知。不同的汽车拥有不同的激光设置。

  • 类比:想象试图与说不同方言的人交谈。如果你只是大声喊出同样的词语,他们可能听不懂。
  • 解决方案:他们创建了一种“特定传感器嵌入”。这就像是一个翻译器,告诉 AI 正在使用哪种激光扫描仪(安装位置、旋转方式)。这使得 AI 能够模拟激光数据的特定“指纹”,使其看起来与真实情况完全一致,即使汽车拥有奇怪或独特的传感器设置。

4. 结果

论文声称,由于他们扩大了数据(图书馆)和模型(工厂)的规模,其结果显著优于以前的方法:

  • 更好的 3D 地图:生成的 3D 地图更准确、更详细。
  • 更好的视频:视频更清晰,瑕疵更少,移动物体(如汽车)看起来更逼真。
  • 更好的激光数据:模拟的激光数据比以往任何时候都更接近真实世界数据。
  • 下游成功:当他们使用这些虚假数据训练自动驾驶规划系统时,该系统的表现更好(碰撞更少,驾驶更优),优于在更小、更旧的数据集上训练的系统。

总结

简而言之,作者构建了一个超级增强的数字游乐场。他们收集了大量真实的 3D 数据,建立了一个智能系统,将“事物在哪里”与“事物如何移动”分离开来,并添加了特殊工具,确保摄像头视频和激光扫描看起来与现实完全一致。这使得自动驾驶汽车能够在一个安全、无限且高度逼真的虚拟世界中进行练习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →