← 最新论文
💻 computer science

DriveSplat: Unified Neural Gaussian Reconstruction for Dynamic Driving Scenes

本文提出了 DriveSplat,一种统一的神经高斯框架,通过引入面向场景的自适应多尺度 LOD 建模策略处理静态背景、利用对象中心的两阶段形变机制处理动态演员,并结合深度与法线先验进行正则化,从而在 Waymo 和 KITTI 基准上实现了具有时空稳定性与几何一致性的大规模动态驾驶场景重建与新视图合成。

原作者: Cong Wang, Ruiqi Song, Wei Tian, Chenming Zhang, Lingxi Li, Long Chen

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Cong Wang, Ruiqi Song, Wei Tian, Chenming Zhang, Lingxi Li, Long Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 DriveSplat 的新技术,它的主要任务是把自动驾驶汽车看到的真实街景,变成可以在电脑里随意观看、甚至修改的“超级 3D 模型”

想象一下,你坐在车里看风景,有静止的楼房、树木(背景),也有跑动的汽车、行人(动态物体)。要把这些瞬间变成永久的 3D 世界,以前很难,因为:

  1. 远近差异大:近处的树细节要多,远处的山只要个轮廓。
  2. 动静混杂:背景是死的,但人车是活的,而且走路还会变形(非刚性运动)。
  3. 视角多变:换个角度看,以前的模型容易“穿帮”或变模糊。

DriveSplat 就像一位全能且聪明的“场景魔术师”,它用了一套独特的“魔法”解决了这些问题。我们可以用三个生动的比喻来理解它的核心创新:

1. 背景处理:像“智能变焦镜头”一样看世界

(场景感知的 LOD 建模)

  • 以前的做法:就像用一台固定焦距的相机拍全景。为了看清近处的树叶,必须把镜头拉得很近,结果远处的山就糊成一团;或者为了看清远处的山,近处的树叶就全是马赛克。
  • DriveSplat 的做法:它像一个拥有“智能变焦”功能的超级镜头
    • 它把世界分成了近处、中间、远处三个区域。
    • 近处(比如你车旁边的路牌):它分配了超高清的“像素点”(高细节),让你能看清纹理。
    • 远处(比如几公里外的摩天大楼):它只分配概括性的“大色块”(低细节),既省资源又保持整体协调。
    • 最神奇的是:这个分配不是死板的。当你开车靠近某栋楼时,它会自动把那里的“像素点”升级,从“大色块”变成“超高清”,就像镜头自动对焦一样。这让重建出来的背景既清晰又自然,没有多余的噪点。

2. 动态物体:像“骨架带动皮肉”一样运动

(基于锚点的非刚性变形)

  • 以前的做法:如果要模拟一个行人走路,以前的方法可能要把行人的每一块“皮肤”(每一个小点)都单独计算怎么动。这就像让成千上万个独立的木偶师同时控制一个木偶,既慢又容易乱套,导致行人走路时身体扭曲、变形。
  • DriveSplat 的做法:它采用了**“骨架带动皮肉”**的策略。
    • 它先给每个动态物体(如行人)设定一个**“骨架”(Anchor)**。
    • 当行人走路时,系统只计算**“骨架”怎么动**(比如手抬起来、腿迈出去)。
    • 然后,附着在骨架上的所有“皮肉”(具体的 3D 点)会自动跟随骨架一起变形。
    • 比喻:就像牵线木偶,只要拉动主线(骨架),整个木偶(行人)就会协调地动起来。这样不仅计算速度快,而且行人走路时不会“散架”或出现奇怪的扭曲,看起来非常真实稳定。

3. 几何修正:像“戴着 3D 眼镜”看世界

(几何先验监督)

  • 以前的做法:主要靠“猜”。看着照片,猜哪里是墙,哪里是路。有时候猜错了,墙就是歪的,或者地面是波浪形的。
  • DriveSplat 的做法:它请来了两位**“专业助教”**(预训练的深度和法线模型)。
    • 深度助教:告诉它“这棵树离我有多远”。
    • 法线助教:告诉它“这面墙是垂直的,还是倾斜的”。
    • 在重建过程中,DriveSplat 会不断对照这两位助教的建议,修正自己的错误。这就像画画时,不仅看照片,还拿着尺子和水平仪去测量,确保重建出来的 3D 世界不仅好看,而且结构准确

总结:它有什么用?

DriveSplat 就像是为自动驾驶世界打造了一个**“数字孪生实验室”**:

  1. 看得更真:它能生成非常逼真的新视角视频,哪怕是你没去过的角度,也能完美还原。
  2. 动得更稳:无论是飞驰的汽车还是奔跑的行人,在 3D 模型里都动得很自然,不会闪烁或变形。
  3. 改得更易:因为它是基于数学模型重建的,你可以像玩《模拟城市》一样,把路上的车移走、旋转,或者把行人换成机器人,用来测试自动驾驶算法在各种极端情况下的反应。

一句话总结
DriveSplat 就像给自动驾驶汽车装上了一双**“会思考、会变焦、会测量”的 3D 眼睛**,把复杂的现实街景变成了既清晰又灵活、还能随意编辑的虚拟世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →