InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving
InfiniVerse 是一个统一的流水线,通过从单帧图像中重建 3D 占用空间、对其进行自回归扩展,并通过一种将视频扩散输出与 3D 空间表示对齐的分层“草图与细化”范式进行优化,从而为自动驾驶生成逼真、可控且具有时间相干性的长程城市场景。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位试图构建一部永无止境、写实的城市街道电影的建筑师,目的是让自动驾驶汽车从中学习。通常情况下,这极其困难。如果你只是要求计算机“继续生成视频”,它最终会开始产生幻觉——道路可能会扭曲成不可能的形状,建筑物可能会消失,或者汽车可能会开进虚无之中。如果你试图强迫它遵循一张严格的地图,视频看起来就会僵硬且虚假。
InfiniVerse 是一个全新的系统,它通过扮演一位既能根据草图工作,又能使用高清摄像机的全能建筑大师来解决这个问题。
以下是它的工作原理,分步骤说明:
1. “3D 骨架”(占用网格)
首先,系统观察街道的一个单帧快照(通过汽车的多个角度摄像头拍摄)。它不仅仅是将其视为一张平面照片,而是构建了一个世界的 3D“骨架”。你可以把它想象成一个巨大的、隐形的方块网格,计算机在其中决定:“这个方块是道路,那个方块是建筑,还有一个是空白空气。”
- 为什么这很重要: 这为系统提供了一个坚实的物理结构来支撑,使其在视频变长时不会迷失方向。
2. “粗略草图”(自回归扩展)
现在,假设你想让汽车驶向一条在原始照片中并不存在的路。你在地图上画一条简单的线(即“草图”),显示你想前往的方向。
- InfiniVerse 使用这张草图来向前扩展 3D 骨架。它沿着你的路径填充新的城市方块。
- 在这个阶段,城市仍然有点块状且分辨率较低(就像一个 Minecraft 世界),但它已经具备了正确的形状和布局。
3. “高清摄像机”(视频生成)
接下来,系统获取那个块状的 3D 骨架,并询问一个强大的 AI 视频生成器:“让这个看起来像一部真实的、写实主义的电影。”
- 它将那些粗糙的方块转化为平滑的沥青、闪亮的汽车和真实的树木。
- 至关重要的是,它在完成这一过程的同时,保持摄像机完全沿着你绘制的路径移动。
4. “反馈循环”(秘诀所在)
这是最重要的一部分。通常,AI 视频生成器会因为自身的创造力而变得“醉态大醺”,并在一段时间后偏离现实。InfiniVerse 通过双向对话防止了这种情况:
- 3D 指导 2D: 粗略的 3D 骨架告诉视频生成器:“留在路上;不要让建筑物悬浮起来。”
- 2D 指导 3D: 在视频制作完成后,系统会观察那些美丽、写实的图像,并将它们投影回 3D 骨架中。它会说:“嘿,视频显示这里有一棵树,所以更新 3D 骨架以包含这棵树。”
这创建了一个闭环。3D 结构确保视频不会变得怪异,而写实的视频则确保 3D 结构保持准确。它们不断地互相检查对方的工作。
结果
该论文声称,这个系统可以生成长期的、连续的驾驶视频,并且比以往的方法能更久地保持写实性和物理一致性。
- 无需魔法地图: 它不需要预先制作好的、完美的地图。它仅基于一张起始照片,在行驶过程中构建世界。
- 稳定性: 它不会出现“漂移”现象,即道路弯曲进墙里或天空变成绿色。
- 控制力: 你可以告诉它左转、直行或右转,它就会构建出一个遵循该路径的真实城市。
简而言之,InfiniVerse 就像是一个自我修正的电影导演,它在搭建场景(3D)的同时也在拍摄场景(2D),并不断检查演员是否仍站在场景中,以及场景是否依然符合电影的视觉效果。这使得它能够为自动驾驶汽车创造出无穷无尽且写实的驾驶场景进行练习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。