← 最新论文
💻 computer science

ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories

ReCamDriving 是一个纯视觉驱动的框架,它通过采用两阶段渐进式训练范式和专门的数据策展策略,利用稠密 3DGS 渲染来实现在没有 LiDAR 的情况下达到最先进的相机可控性和结构一致性,从而为新颖驾驶轨迹合成多通道视频。

原作者: Yaokun Li, Shuaixian Wang, Mantang Guo, Jiehui Huang, Taojun Ding, Mu Hu, Kaixuan Wang, Shaojie Shen, Guang Tan

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaokun Li, Shuaixian Wang, Mantang Guo, Jiehui Huang, Taojun Ding, Mu Hu, Kaixuan Wang, Shaojie Shen, Guang Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图拍摄一部电影,但你只有一台摄像机,安装在一辆沿着街道行驶的汽车上。你想向观众展示,如果摄像机是在紧挨着第一辆车行驶的第二辆车上,或者是在左侧几米处行驶,那么场景看起来会是什么样子。这就是自动驾驶领域中“新轨迹合成”(novel trajectory synthesis)的梦想:从旧的视角创造出新的视频视角。为了实现这一点,计算机通常会尝试先构建一个世界的 3D 模型,就像一个数字粘土雕塑,然后再尝试在上面绘制新的图像。然而,这非常棘手。如果计算机随后试图修复其 3D 模型中丑陋的部分,它往往会产生一些不合逻辑的、奇怪且带有瑕疵的伪影。或者,如果它尝试使用激光扫描仪(LiDAR)来引导摄像机,它往往会丢失远处的细节或物体背后的细节,因为激光束太稀疏了,就像试图用仅有的几个散落的点来画一幅精细的人物肖像一样。

ReCamDriving 应运而生,这是一种全新的方法,它像一位不需要激光扫描仪或神奇修复工具的大师级导演。相反,它使用一种巧妙的两步舞步,教计算机如何在从未需要昂贵硬件的情况下,“移动”摄像机穿过视频场景。研究人员发现,通过使用一种特定类型的 3D 渲染技术——“3D 高斯泼溅”(3D Gaussian Splatting,可以将其想象成由数百万个微小的、发光的 3D 像素组成的云团,从而形成一个实体形状)作为引导,他们可以教会 AI 完美地理解世界的几何结构。他们并没有让 AI 直接进入深水区;而是先教它走路,再教它奔跑。首先,他们教 AI 根据简单的指令移动。然后,一旦 AI 掌握了移动的方法,他们就展示了那个“像素云”,以帮助它理解从新角度看世界时应该是什么样子。结果是?该系统能够生成平滑、真实的视频,展示汽车从一个全新的角度驶过街道,即使那个角度从未被实拍过。

问题所在:破碎的修复与缺失的点

论文开头指出,目前制作这些新视频的方法有点像试图用胶带去修补一个破碎的花瓶。一种流行的方法是“先重建后修复”法。想象一下,你构建了一个街道的 3D 模型,但它看起来有些模糊或扭曲。然后,你训练计算机去“修复”这些模糊的部分。问题在于,当计算机尝试修复一个它从未见过的视角时,它经常会感到困惑。它会试图应用从旧视角中学到的那种“胶带”逻辑,导致出现奇怪的、超出分布范围的瑕疵,比如汽车可能会融化,或者道路可能会消失。

另一种方法尝试使用 LiDAR(激光扫描仪)来告诉计算机物体在 3D 空间中的确切位置。但 LiDAR 就像是在雾气弥漫的房间里打着手电筒;它能清晰地看到眼前的物体,但点阵在远处或障碍物后面会变得非常稀疏。这会导致视频中的背景看起来不一致,或者 3D 结构发生崩塌。

解决方案:与“云”为导向的两阶段舞步

作者提出了 ReCamDriving,这是一个完全依赖视觉(摄像机)和一种特殊 3D 引导工具的系统。以下是他们如何解开谜题的:

1. “云”引导 (3DGS 渲染)
与其使用稀疏的激光点,团队使用了 3D 高斯泼溅 (3DGS)。不要把场景想象成一面实墙,而要想象成由数百万个微小的、有颜色的、发光的 3D 球体组成的密集云团。当你从一个新角度渲染这个云团时,它会创造出一个完整且密集的图像,即使其中存在一些渲染伪影。关键的洞察在于,即使这个“云图”并不完美,它也拥有正确的形状和结构。它比稀疏的激光扫描更能精确地告诉计算机:“车在这里,路在那里。”

2. 两阶段训练(先走,后跑)
如果仅仅向计算机展示“云图”并要求它生成新视频,它可能会依赖捷径而不是学习完整的变换过程。它可能只是试图“修复”云图,而不是真正学习如何将摄像机移动到新位置。这被称为“捷径学习”。

为了阻止这种情况,作者使用了一种两阶段训练策略

  • 第一阶段(行走): 他们首先使用摄像机的运动指令(位姿)来训练模型。他们告诉 AI,“将摄像机向左移动 3 米。”AI 学习了当你在移动时,世界是如何发生偏移的基本物理规律。这就像是在教学生跳舞之前,先教他们走路。
  • 第二阶段(舞蹈): 一旦 AI 知道如何移动,他们就会“冻结”那部分大脑,并添加一个新层。现在,他们将“云图”(3DGS 渲染)作为引导输入。因为 AI 已经知道如何移动,它现在将云图视为一个结构性的支架,以确保新视频在几何上是正确的,而不仅仅是一个可以复制的模板。这就像是给舞者一张舞台地图,以免他们绊倒,而他们已经在移动中了。

3. “平行”数据集 (ParaDrive)
为了教导这个系统,他们需要海量的训练数据。通常情况下,你无法获得同一条街上由两辆并排行驶的汽车拍摄的视频。因此,他们发明了一个聪明的技巧。他们提取单车视频,构建了场景的 3D 模型,然后“渲染”出一个虚假的视频,模拟如果第二辆车在左侧 3 米处行驶时会是什么样子。他们将这个虚假视频作为“老师”,将真实视频作为“学生”。通过对来自 Waymo 和 NuScenes 数据集的 110,000 对视频进行这种处理,涵盖了 1,600 个场景,他们创建了一个名为 ParaDrive 的新数据集。这使得他们能够针对横向(侧向)移动进行训练,而之前的研究方法在这一领域表现挣扎。

结果:更清晰、更平滑、更准确

当他们测试 ReCamDriving 时,结果令人印象深刻。

  • 视觉质量: 与那些试图“修复”3D 模型的方法相比,新生成的视频更加清晰,且瑕疵更少。
  • 一致性: 3D 结构保持了一致性。即使摄像机大幅度移动(例如向侧方移动 4 米),汽车也不会融化,道路也不会变形。
  • 摄像机控制: 系统在遵循精确的摄像机指令方面表现得更好。例如,当被要求向右移动 4 米时,ReCamDriving 比使用 LiDAR 的方法要准确得多,后者经常会出现漂移或距离判断错误的情况。

论文明确反驳了“修复”糟糕的 3D 渲染是最佳路径的观点,证明了当视角与 AI 见过的视角差异过大时,这种方法会失效。他们还表明,依赖 LiDAR 是追求高保真、一致性生成的死胡同,因为其数据过于稀疏。

为什么这很重要

这项工作表明,我们不需要昂贵的激光扫描仪就能创建完美的自动驾驶汽车 3D 视频模拟。通过使用智能的两步训练过程和密集的 3D 像素“云”,我们可以从单个摄像机生成高质量、几何一致的视频。这可以降低训练自动驾驶汽车的成本并提高效率,因为它们可以从生成的数百万个“假设场景”中学习,而无需配备多辆并排行驶的车辆。作者指出,虽然他们的方法需要一个初始的构建 3D 模型步骤,但这是一个一次性的成本,通过允许生成无穷无尽的视频,这种投入是非常值得的;随着 3D 重建技术的进步,这个过程也只会变得越来越快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →