← 最新论文
💻 computer science

Lite Any Stereo V2: Faster and Stronger Efficient Zero-Shot Stereo Matching

本文介绍了 Lite Any Stereo V2 (LAS2),这是一个超快速立体匹配模型系列,通过采用一种延迟优化的仅 2D 代价聚合架构和一种新颖的三阶段训练策略,在挑战效率与零样本泛化权衡的同时,在资源受限的平台上实现了具有最先进水平的精度以及显著降低的推理延迟。

原作者: Junpeng Jing, Ronglai Zuo, Zhelun Shen, Shangchen Zhou, Rolandos Alexandros Potamias, Stefanos Zafeiriou, Krystian Mikolajczyk, Jiankang Deng

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Junpeng Jing, Ronglai Zuo, Zhelun Shen, Shangchen Zhou, Rolandos Alexandros Potamias, Stefanos Zafeiriou, Krystian Mikolajczyk, Jiankang Deng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一对眼睛(两个摄像头),正试图弄清楚场景中物体距离有多远。这被称为立体匹配(Stereo Matching)。长期以来,最好的“眼睛”都是庞大、沉重且缓慢的——就像一台超级计算机在试图解开一个复杂的谜题。它们虽然准确,但对于机器人或自动驾驶汽车来说太重了,无法随身携带。另一方面,“轻量级”的眼睛虽然跑得快、易于携带,但当它们看到从未练习过的陌生场景时,往往会感到困惑。

这篇论文介绍了 Lite Any Stereo V2 (LAS2),这是一个全新的“眼睛”家族,它声称自己既速度极快,又异常聪明,即使在没有任何预先练习的情况下观察全新的场景(这种概念称为“零样本/zero-shot”学习)时也是如此。

以下是他们实现这一目标的原理,通过简单的类比进行了拆解:

1. 新蓝图:一个 2D 捷径

之前的快速模型试图通过减少数学运算来提高效率,但它们仍然使用复杂的 3D“脚手架”来构建对深度的理解。作者意识到,在真实的芯片(如手机或汽车中的芯片)上,这种 3D 脚手架实际上运行得很慢,即使其数学逻辑看起来很简单。

  • 类比: 想象你在整理一个图书馆。旧的快速模型就像是试图将书堆成 3D 塔来节省空间,但这需要不停地爬上爬下梯子。LAS2 说:“让我们直接把书平铺在 2D 书架上。”
  • 结果: 通过切换到仅限 2D 的框架,他们移除了沉重的“攀爬”过程。这使得模型在实际硬件上的运行速度显著提升,且没有丧失清晰感知深度的能力。

2. 三阶段训练营

为了让这些轻量级的眼睛足够聪明以应对现实世界,作者不仅仅是向它们喂入数据;他们还让它们经历了一个严格的三阶段训练营:

  • 第一阶段:教室(合成数据)。
    模型首先在一个完美的、计算机生成的虚拟世界(类似于电子游戏)中学习,那里的答案是 100% 正确的。这为它打下了坚实的基础。
  • 第二阶段:压力测试(自我蒸馏)。
    现在,模型必须学会如何在混乱的环境中保持冷静。老师(模型本身)向学生展示同一张图片,但加入了奇怪的滤镜、模糊效果或颜色变化。目标是教会模型识别物体的“形状”,而不仅仅是特定的颜色或光照。这就像是无论朋友戴着墨镜、帽子还是站在黑暗中,你都能认出对方的脸。
  • 第三阶段:现实世界实习(真实世界的伪标签)。
    这是巨大的飞跃。模型被派往现实世界去观察没有标签的照片。由于没有标准答案,一个“超级聪明的老师”(一个庞大、缓慢的 AI)会先猜测答案。
    • 过滤器: 但这个超级聪明的老师有时会犯错,尤其是在处理像反光的窗户或天空这类棘手问题时。LAS2 使用了一个过滤器,在学生学习之前,将老师错误的猜测剔除掉。
    • 安全网: 如果学生试图从一张非常困难、令人困惑的照片中学习,系统会给学生的想法设置一个“上限(cap)”。这可以防止学生因为一个糟糕的例子就改变自己的判断,从而导致忘记之前学到的所有知识。

3. 结果:既快又强

论文声称,这种新方法创造了一个从小型(S)到大型(H)的模型家族,并且击败了竞争对手:

  • 速度: 在强大的服务器和小型边缘设备(如机器人中使用的 NVIDIA Orin 芯片)上,LAS2 的运行速度比之前的最佳快速模型快 1.6 倍至 2.7 倍
  • 准确度: 尽管它很快,但在观察从未见过的真实场景时,它比其他快速模型更准确。它甚至接近了那些庞大、缓慢的“超模”模型的准确度,但运行速度要快得多。
  • 视觉质量: 在观察棘手场景(如汽车上的反光或长廊)时,与旧方法相比,LAS2 生成的深度图更加干净,噪点更少。

它做不到什么(局限性)

作者坦诚地说明了其局限性。即便有了这些改进:

  • 差距: 它仍然无法完全达到那些使用巨大“基础(foundation)”知识的庞大、缓慢模型的水平。
  • 数据瓶颈: 它受限于高质量、真实世界立体数据量的不足。目前还没有足够的带有标签的真实世界照片来训练它达到完美。
  • “不可能”的场景: 与所有当前技术一样,它在处理极其困难的情况时仍然表现挣扎,例如透过镜子观察、观察透明玻璃墙,或者应对刺眼的强光。

总结: LAS2 是一种构建“聪明眼睛”的新方法,它既轻巧到可以装进口袋,又敏锐到可以在从未造访过的地方清晰地观察世界。他们通过简化内部结构,并结合了完美的模拟环境与经过过滤的现实世界猜测来进行教学,实现了这一目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →