← 最新论文
💻 computer science

ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning

本文介绍了 ARDepth,一种用于单目深度估计的新型自回归框架,该框架通过尺度渐进式调节(Scale-Progressive Conditioning)和语义感知引导(Semantic-Aware Guidance),在不断增加的空间尺度上逐步构建深度表示,从而比传统的全局扩散式方法更好地捕捉层级几何结构。

原作者: Zijie Wang, Wei Zhang, Weiming Zhang, Xiao Tan, Weikai Chen, Xiaoxu Li, Guanbin Li

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijie Wang, Wei Zhang, Weiming Zhang, Xiao Tan, Weikai Chen, Xiaoxu Li, Guanbin Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅凭一张照片就绘制出一张完美的 3D 房间地图。有一段时间,最聪明的计算机尝试像雕塑家从巨大的石块中凿刻形状那样来完成这项工作:它们从一个充满噪声、模糊的猜测开始,然后一步步缓慢地平滑处理,直到形状显现出来。这种被称为“扩散”(diffusion)的方法,就像是在同时轻轻挪动房间里的每一件物品,试图以此来整理一个凌乱的房间。

但本文的作者们发现,ARDepth 注意到了这种方法的一个问题。真实的房间并不是平滑的色块;它们有尖锐的棱角、细长的桌腿,以及墙壁与地板交界处的突变。试图同时平滑所有内容往往会模糊这些锐利的边缘。这就像是试图通过先画一个巨大的、模糊的圆圈,然后寄希望于街道和建筑能奇迹般地变得清晰,从而绘制出一张详细的城市地图。

核心理念:层层构建,而非全局平滑
与其平滑一个模糊的混乱状态,ARDepth 建议像画家添加细节层次一样,从宏观图景开始并逐渐深入细节来构建深度图。他们称之为“自回归生成”(auto-regressive generation)。这就像组装一套乐高(LEGO)玩具。你不会试图通过一个巨大的跨越来建成整座城堡。首先,你铺设一个大的、粗略的基础底板(房间的总体布局)。然后,你添加中等大小的墙壁。最后,你扣上像窗框和门把手这样微小而精细的零件。

论文指出,这种“由粗到精”(coarse-to-fine)的方法在处理现实世界几何结构的锯齿状、分步式特性方面效果更好。

秘密武器:两个助手
为了让这个乐高组装过程完美运行,团队为他们的模型配备了两个特殊的助手:

  1. 尺度渐进引导(Scale-Progressive Guide, SPC): 想象你正在画一幅壁画。当你画巨大的背景天空时,你需要看到整个画布。但当你画角落里的一朵小花时,你需要近距离观察。SPC 模块做的正是这件事。它在正确的时间向模型提供正确类型的视觉线索。当模型在确定大布局时,它获得的是图像的“广角”视图。当它在处理微小细节时,它获得的是“缩放”视图。这确保了模型在绘制锐利边缘时不会丢失大局感,也不会在放置整个建筑物时被微小细节所迷惑。

  2. 语义引导(Semantic Guide, SAG): 有时候,照片可能会具有误导性。那块暗处是阴影还是洞?那个模糊的形状是人还是树?SAG 模块请求一个超级智能的 AI 助手(视觉语言模型)来看图并给出一段简短、简单的场景描述,例如“一个阳光明媚的客厅,中间有一张沙发,左边有一扇窗户”。这段描述就像一个指南针,帮助模型理解房间的“故事”,以免在细节中迷失方向。这就像有一个导游在耳边低语:“记住,桌子在窗户前面”,这样你就不会不小心把桌子放在窗户后面。

他们否定了什么
作者明确反对认为深度仅仅是一个需要进行全局“去噪”(清理)的平滑、连续场的观点。他们还表明,仅仅使用标准的“扁平化”自回归模型(即像读书一样,一个像素接一个像素地按长线构建图像)效果并不理想。他们的实验表明,扁平化的方法虽然能捕捉到大致形状,但在处理锐利边缘和细长结构时表现糟糕,导致深度图看起来模糊且错误。

结果:效果如何?
团队在五个不同的现实世界基准测试上测试了他们的新方法,包括室内房间(NYUv2)和室外街道(KITTI)。他们将其与目前的冠军模型(主要是那些“平滑型”扩散模型)进行了对比。

  • 数据表现: 在 NYUv2 数据集上,之前的最佳扩散模型(Marigold)的误差得分(AbsRel)为 5.5。使用相似训练数据的 ARDepth 将该误差降低到了 4.8。在 KITTI 数据集上,误差从 9.9 降至 8.4
  • “零样本”测试: 他们在从未见过的数据(zero-shot)上测试了该模型,它依然表现得非常出色,经常击败那些在海量数据上训练过的模型。
  • 规模扩展: 当他们将训练数据从 74,000 张图像增加到 174,000 张图像时,模型变得更加强大,这表明如果可用样本更多,它就能学习得更好。

不足之处(局限性)
尽管结果令人鼓舞,但论文也谨慎地指出,这并非一个完美、已解决的问题。他们承认,当前版本的模型(80 亿参数版本)运行速度稍慢——在高性能计算机上每张图像大约需要 3.4 秒——相比之下,更简单的模型则更快。他们还注意到,“语义引导”依赖于一个可能会偶尔给出带有噪声描述的 AI,因此他们保持文本描述简短且通用,以避免产生困惑。

总结
这篇论文表明,将深度估计视为一个结构化的、循序渐进的构建工程(从粗糙到精细的构建),是目前“平滑与精炼”方法的有力替代方案。通过将这种循序渐进的构建方式与智能视觉和文本引导相结合,ARDepth 创建了更锐利、更准确、且更擅长处理诸如细长物体和尖锐棱角等复杂细节的深度图。这不仅仅是一个小小的改进,更是关于计算机如何“看” 3D 世界的一种全新的思考方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →