← 最新论文
💻 computer science

GeoStereo: A Unified Stereo Geometry Estimation Framework for Disparity and Surface Normal

GeoStereo 是一个统一的框架,它将前馈立体匹配流水线与基于扩散模型的法向量估计分支相结合,以利用强大的几何先验,在具有挑战性的场景和零样本基准测试中,实现了视差估计和表面法向量估计方面的最先进性能。

原作者: Qizhe Wei, Xianda Guo, Shaocong Xu, Hong Li, Runyi Yang, Hao Zhao

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Qizhe Wei, Xianda Guo, Shaocong Xu, Hong Li, Runyi Yang, Hao Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图凭空构建一个3D世界,但你手里只有两张扁平的照片。这正是计算机在“3D视觉”领域面临的日常挑战。为了理解一张扁平的图像,计算机需要弄清楚两件事:每个物体离你有多远(一个被称为“视差”的概念,这只是一个高级说法,指的是你的左右眼看到的图像之间移动了多少)以及表面的朝向是怎样的(被称为“表面法线”,比如知道一面墙是平的、一个屋顶是斜的,还是一个球体是圆的)。

长期以来,计算机在晴朗明亮的情况下对距离的判断已经做得相当不错了。但当情况变得复杂时——比如在黑暗中、在闪亮的镜面前或透过玻璃时——传统的计算机程序就会感到困惑并开始产生“幻觉”。它们缺乏一种关于世界通常长什么样的“直觉”。最近,一种被称为“扩散模型”的新型AI因为其“想象”细节的能力而声名大噪。你可以把它想象成一位看过数百万幅画作的艺术家,即使他从未见过某个特定的场景,也能猜出画面中缺失的部分应该是什么样子。现在的核心问题是,研究人员正在询问:我们能否教会计算机利用这种强大的“想象力”来修正它对3D形状的错误猜测,尤其是在照片很糟糕的情况下?

于是有了 GeoStereo,这是一个由研究团队提出的新框架,旨在解决这个精确的问题。GeoStereo 并没有在快速的传统程序和缓慢的想象型AI之间做选择,而是强迫它们作为一个团队协同工作。研究人员构建了一个系统,让标准的“立体匹配”引擎(快速的工人)和“扩散”引擎(富有想象力的艺术家)不断地进行交流。

这就是奇迹发生的过程:首先,快速的工人会对两张照片进行快速观察,并对距离做出一个粗略的猜测。然后,它将这个粗略的猜测转化为一张描述表面倾斜程度的基础地图。这张粗略的地图会被交给富有想象力的艺术家。艺术家并不仅仅是从零开始猜测;它以这张粗略的地图作为起点,并对其进行“精炼”,填补快速工人感到困惑的地方。但这种团队协作是双向的。艺术家也会观察第二张照片(右眼视角),但它会通过变形处理使第二张照片与第一张照片完美对齐。这为艺术家提供了关于世界形状的额外线索。

最令人兴奋的部分是,这不仅仅是一条单行道。因为这两个部分在数学上是相互关联的,所以当艺术家修正表面图谱时,这种修正会向快速的工人发送一个信号,告诉它:“嘿,你在这里的距离猜测有点偏差,修正一下!”这创造了一个循环:快速的工人变得更擅长猜测距离,而艺术家变得更擅长猜测形状,同时它们也在互相帮助。

研究人员在许多不同的挑战场景中测试了这个想法,包括暗室、闪亮的表面和透明物体。他们发现 GeoStereo 在无需针对每种新类型的房间或场景进行重新训练(这种概念被称为“零样本”学习)的情况下,依然能够极其出色地做出预测。在 KITTI 和 NYUv2 等标准基准测试中,该系统在猜测距离和表面角度方面达到了顶尖的准确度,往往优于那些仅依赖单一类型AI的方法。论文指出,通过将传统方法的快速与扩散模型的“常识”相结合,我们可以构建出在混乱的现实世界中更加可靠的3D视觉系统。作者也提到,虽然该系统非常准确,但由于引入了想象型AI部分,运行起来会多花一点时间,但为了在复杂场景中获得更高的准确度,这种权衡是非常值得的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →