← 最新论文
💻 computer science

DrivingDepth: Sparse-Prompted Pixel-wise Scale Correction for Driving Depth Estimation

DrivingDepth 提出了一种用于自动驾驶深度估计的新颖框架,该框架通过仅将稀疏 LiDAR 数据用作提示来学习逐像素尺度校正,从而在不从头开始重新生成深度的情况下,保持了基础模型的几何连贯性,并实现了最先进的度量精度和结构一致性。

原作者: Chi Huang, Wenhao Zhang, Hang Yin, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Liang Wang

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Chi Huang, Wenhao Zhang, Hang Yin, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Liang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“地图”与“尺子”的冲突

想象一下,你正在为一辆自动驾驶汽车构建一个城市的 3D 模型。你有两种工具,但它们单独使用时都不完美:

  1. 摄像头(艺术家): 这个工具非常擅长描绘事物的“形状”。它准确地知道汽车边缘在哪里、道路如何弯曲、树木在哪里停止。它创造了一幅精美、细腻且连续的图像。然而,它不知道事物实际距离有多“远”。这就像一位画家可以画出一座完美的山,却不知道这座山是 10 英尺高还是 10 英里高。
  2. 激光雷达 LiDAR(测量员): 这个工具利用激光来测量精确的距离。它给了你一把完美的“尺子”。然而,它的数据非常稀疏。想象一下,测量员只是向墙上投掷了几个飞镖来测量墙面。你会得到一些准确的点,但点与点之间有巨大的间隙。此外,有时这些飞镖会落在错误的位置(噪声),或者与绘画无法完美对齐。

冲突点:
如果你试图将测量员那零星的几个点强行套用到艺术家的画作上,往往会毁掉这幅画。测量员的点可能会有轻微偏差,如果你强迫画作为了适应这些点而发生形变,就会产生奇怪的空洞、破碎的表面或 3D 模型中的“漂浮物”。这就是几何-尺度冲突(Geometry-Scale Conflict):你拥有完美的形状但没有尺度,或者拥有完美的尺度但形状破碎。

旧方法:“推倒重来”

以往的方法试图通过这种方式解决问题:拿走测量员的点,然后告诉计算机:“忽略艺术家的画作;让我们利用这些点从头开始重建整个 3D 世界。”

  • 结果: 计算机得到了正确的尺度,但因为它忽略了艺术家原本平滑的线条,导致结果看起来充满了瑕疵,出现了破碎的表面和伪影。

新方案:DrivingDepth(“微调者”)

本文的作者提出了 DrivingDepth,他们想出了一个更聪明的办法。他们意识到艺术家(一个强大的 AI 模型,名为 DepthAnything3)已经画好了世界的完美“形状”。缺失的仅仅是“大小”。

他们并没有决定重建整幅画,而是决定在现有的画作之上添加一个“微调层”

工作原理(类比)

把 AI 的深度图想象成一张橡胶片,上面已经画好了城市完美的褶皱和纹理。

  1. 冻结的艺术家: 他们保持原始橡胶片完全不变。他们不让计算机重新绘制褶皱。
  2. 稀疏的提示: 测量员的点(LiDAR)被视为放置在橡胶片特定位置的便利贴
  3. 微调者(尺度校正): 新的 AI 会观察这些便利贴。它会问:“好吧,在这个便利贴的位置,橡胶片显示汽车距离 10 个单位,但测量员说它是 20 个单位。”
  4. 神奇之处: AI 不会撕裂橡胶片,它只是在那个位置局部地拉伸或收缩橡胶片,以匹配测量员的数据。它会对每一个像素都进行这样的操作,从而为整幅图像创建一个独特的“拉伸图”(即尺度因子)。

该方法的关键特性:

  • 最小干预: 计算机不学习如何绘制世界,它只学习如何通过“拉伸”现有的绘画来符合测量值。
  • 置信度: AI 非常聪明,知道什么时候测量员的点是错误的(噪声)。如果一个点看起来很可疑,AI 会忽略它,转而信任艺术家的平滑形状。
  • 平滑性: 它确保在便利贴之间,橡胶片不会变得凹凸不平或破裂。它保持了表面的平滑,就像原始绘画一样。

为什么它更好

论文表明,这种方法兼顾了两者的优点:

  • 正确的尺度: 距离是准确的(得益于测量员的点)。
  • 完美的形状: 汽车和道路的边缘清晰且与摄像头图像对齐(得益于艺术家的原始绘画)。

在测试中,其他尝试“推倒重来”的方法会产生带有空洞的破碎 3D 模型。而 DrivingDepth 在保持模型坚实和平滑的同时,依然能获得正确的距离。即使测量员提供的通常数据只有 10%(非常稀疏的点),DrivingDepth 的表现仍然优于那些拥有 100% 数据的其他方法。

总结

DrivingDepth 就像一位高级裁缝,他拿到一件剪裁完美的西装(视觉几何),然后仅仅通过调整纽扣和缝线(尺度)来适配特定的人的身材,而不是试图从头开始缝制一件全新的西装。这确保了西装既好看,又穿着合身。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →