← 最新论文
🤖 AI

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA OmniDreams 是一个基于 Cosmos 扩散架构构建的实时基础生成世界模型,它通过自回归地合成用于闭环自动驾驶训练与评估的、以动作驱动的逼真传感器观测数据,克服了传统模拟器的泛化限制。

原作者: NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jon
发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:一个学习驾驶的“电子游戏”

想象一下,你正在教一辆自动驾驶汽车如何在世界中穿行。你不能直接让它在真实的街道上行驶,因为那太危险了。你需要一个模拟器——一个让汽车可以练习的“电子游戏”。

长期以来,这些模拟器就像是相册。如果你想测试某种场景,你必须拍一张真实的街道照片,剪出一个汽车,然后把它粘贴进去。如果你想看下雪时会发生什么,你必须找到一张已经有雪的照片。如果汽车转弯的角度是原照片中没有的,模拟器就会出现故障或显示模糊的混乱画面。它被困在了过去。

OmniDreams 则不同。它不是相册,而是一个拥有神奇摄像机的创意导演。它不只是重放旧的素材;它会根据汽车现在的动作,去“想象”世界接下来看起来是什么样子的。

工作原理:“想象力引擎”

OmniDreams 是一个“世界模型(World Model)”。把它想象成一个超级聪明的 AI,它观看过数百万小时的驾驶视频。它已经学习了世界的“规则”:雨滴是如何飘落的,行人可能会如何跳出来,以及汽车转弯时影子是如何变化的。

它运行着这样一个实时循环:

  1. 驾驶员(策略/Policy): 自动驾驶汽车决定向左转。
  2. 导演(OmniDreams): AI 接收到这个决策,并立即“梦幻”出接下来的几秒钟视频。它生成关于街道、雨水以及其他车辆对转向做出反应的逼真图像。
  3. 反馈: 汽车看到这段新视频,决定下一步该做什么,循环往复。

因为它是在进行过程中实时生成视频,所以汽车可以在从未发生过的场景中进行练习,比如突如其来的暴风雪,或者从卡车上掉落的一个床垫。

秘诀所在:如何保持快速与真实

生成视频通常很慢,就像在电影院渲染一部电影一样。但对于以每小时 60 英里速度行驶的汽车,模拟器的运行速度必须与现实一样快(实时)。

  • “流式传输”技巧: 想象你在看一部电影,当你观看当前场景时,下一场戏正在被同时绘制出来。OmniDreams 使用了一个“记忆缓存”(就像一个笔记本)来记住它刚刚画了什么。它不需要每次都重新绘制整个街道,而只是更新发生变化的部分。这使得它能以 68 到 105 帧/秒 的速度生成视频,足以跟上真实汽车的速度。
  • “多视角”魔法: 大多数视频 AI 只能制作单一的相机视角。OmniDreams 可以同时制作四个视角(前视、左视、右视和缩放视图),并且它们能够完美匹配。如果你向左转头,左侧摄像头会显示正确的街角,而右侧摄像头则显示正确的建筑。它们始终保持同步。

两大超能力

论文强调了这项技术的两个主要用途:

1. 终极测试司机(模拟)
OmniDreams 充当环境。它可以创造“长尾(long-tail)”场景——即那些难以通过相机捕捉到的罕见、奇怪或危险的事件。

  • 类比: 如果普通的模拟器是一个拥有固定赛道的驾驶学校,那么 OmniDreams 就是一个教练可以突然改变天气为飓风、在路上丢下一个奶牛、或者让所有人的红绿灯同时变绿,以此来观察汽车如何反应的驾驶学校。

2. 驾驶员的大脑(策略/Policy)
令人惊讶的是,论文表明,用于生成视频的同一个 AI 大脑也可以用来驾驶汽车。

  • 类比: 通常,你有一个“导演”(负责制作电影)和一个“特技司机”(负责开车)。OmniDreams 表明,导演也可以是特技司机。当他们针对驾驶任务微调 OmniDreams 时,尽管它的体积比复杂的 AI 小 5 倍,但表现却更好。它通过“想象”自己行为的后果来学习驾驶。

修复损坏的模拟器

论文还提到,OmniDreams 可以修复其他的模拟器。

  • 类比: 想象一个街道的 3D 模型,从正面看效果很好,但如果你从侧面看,它就会变得模糊且怪异。OmniDreams 可以充当一个“修复者”。它观察模糊的 3D 模型,并“幻觉”出正确的细节,让它重新变得清晰且真实。

核心总结

OmniDreams 是一个用于自动驾驶汽车的实时生成式视频引擎。它用动态的、具有创造力的引擎取代了静态的、基于回放的模拟器,从而能够即时创造出全新的世界。这使得工程师能够在安全的环境中,测试从极端天气到不可预测的行人等无限种多样的场景,而无需真正驶入现实道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →