Learning Image-Adaptive Scale Fields for Metric Depth Recovery
本文提出一种度量深度恢复方法,将尺度校正建模为图像自适应尺度场,利用语义与几何基图的低维线性组合,并通过源自稀疏锚点的权重,实现鲁棒且准确的度量深度估计。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一台相机,只需查看单张照片就能推测物体的距离。这被称为单目深度估计。它就像一位才华横溢的艺术家,能在二维纸上勾勒出三维场景。然而,这位艺术家有个怪癖:他们非常擅长把握形状和相对距离(例如树是岩石距离的两倍),却极不擅长把握实际尺寸。他们可能将一棵实际 50 英尺高的树画成 10 英尺,或者将 10 英尺高的树画成 5 英尺。他们的画作是“按比例”的,但比例未知。
在现实世界中,自动驾驶汽车或机器人等应用需要知道精确距离(度量深度)。为了解决这位艺术家的比例问题,我们通常会提供几个“锚点”——即我们知道确切距离的特定位置(例如激光雷达传感器告诉我们:“那块岩石的确切距离是 5 米”)。
旧方法的问题
传统上,人们试图通过应用单一的“全局”修正来修正艺术家的画作。他们会说:“好吧,整幅图都太小了;让我们把所有东西都乘以 2。”或者,他们可能会尝试分别修正图像的不同部分。
但现实生活是混乱的。有时天空太远,地面太近,而中间的建筑物则恰到好处。单一的“乘以 2"规则无法适用于整个场景。以前的方法试图通过将图像分割成微小的网格或区域来解决这个问题,但如果你在每一个微小的网格中都没有足够的“锚点”(确切距离点),数学就会崩溃,修正也会变得不稳定。
新解决方案:“图像自适应比例场”
这篇论文提出了一种更聪明的方法来修正艺术家的画作。作者没有试图直接猜测每个像素的确切距离,而是将这个问题视为混合颜料。
以下是类比:
调色板(基础图):想象艺术家有一个特殊的调色板,上面有几种“基色”(称为基础图)。这些不仅仅是随机颜色;它们是数千张照片中学习到的智能模式。
- 一种模式可能代表“随着向上延伸物体变小”(天空)。
- 另一种可能代表“随着向下延伸物体变近”(地面)。
- 还有一种可能捕捉“建筑物附近的阴影”。
- 这些模式源自艺术家的原始草图以及艺术家用来绘制草图的隐藏细节。
混合(权重):目标不是为每个像素发明一种新颜色。相反,系统会问:“我们需要混合多少模式 A、多少模式 B 和多少模式 C 来修正比例?”
锚点(配方):我们只有少数几个“锚点”(确切距离点)。系统观察这些锚点,并解决一个简单的数学谜题(最小二乘问题),以确定模式的完美混合比例(权重)。
- 即使整幅图中只有 5 个锚点,系统也能找出正确的混合比例,因为这些模式非常智能且覆盖整个图像。
结果:一旦系统知道了混合比例,它就会将该混合应用于整个图像。它会生成一个新的、比例完美的深度图,其中树的高度正确,岩石的距离也正确。
为什么这很重要
- 它仅需极少的锚点即可工作:由于“模式”(基础图)是预先学习并覆盖整个图像的,因此系统不需要密集的锚点网格。即使你只给它 handful 个精确测量值,它也能修正整幅图。
- 它很稳定:如果某个角落缺少锚点,旧方法会感到困惑。这种方法会观察整个图像,并利用全局模式平滑地填补空白。
- 它具有可解释性:你实际上可以查看系统学习到的“模式”。你可以看到:“啊,系统学到了地面通常需要特定类型的修正。”它不是黑盒;它是可理解部分的清晰组合。
总结
作者创建了一个系统,该系统接收深度的“粗略猜测”和几个“精确测量值”,然后利用一组智能的、预先学习的模式将它们融合在一起。这使得机器人和汽车能够从单台相机获取准确、真实的距离,即使它们没有大量额外的传感器数据来帮助它们。他们在道路驾驶和室内场景中对这一系统进行了测试,结果始终优于旧方法,尤其是在数据稀缺的情况下。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。