← 最新论文
🤖 AI

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything 引入了一种可扩展的预训练框架,该框架利用一种新颖的“稀疏度量提示”(Sparse Metric Prompt)从 2000 万个嘈杂且异构的 3D 数据源中学习度量深度,确立了度量深度领域首个清晰的缩放趋势,并在包括单目估计、3D 重建以及多模态模型中的空间智能在内的多种任务中实现了最先进的性能。

原作者: Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和创意类比对论文 "Metric Anything" 进行的解释。

核心问题:“嘈杂的厨房”

想象一下,你想教机器人如何理解现实世界的 3D 空间——具体来说,就是物体距离有多远(度量深度)。为了做到这一点,你通常需要一个庞大的“教科书库”(数据集),其中包含图片及其精确的 3D 距离。

问题在于,这些教科书非常混乱。

  • 有些是由 LiDAR(激光雷达)编写的,它们很棒,但存在噪声且稀疏(就像只有零星点位的素描)。
  • 有些是通过计算机从视频中重建出来的,在反光或模糊区域可能会出现奇怪的误差。
  • 有些是渲染出来的(计算机生成的),虽然完美但看起来很假。
  • 它们还来自数千种不同的相机,每种相机都有自己的特性和偏差。

以往试图用这种“嘈杂厨房”中的数据来教机器人的尝试都失败了,因为噪声会让 AI 感到困惑。他们曾试图为每种类型的噪声构建复杂的自定义规则,但这无法规模化。这就像是在用手刷洗每一个盘子,而不是使用洗碗机来清理一个乱七八糟的厨房。

解决方案:“Metric Anything”

作者创建了一个名为 Metric Anything 的新系统。把它想象成一个通用的“洗碗机”,它可以处理任何种类的脏盘子(数据源),而不需要为每种盘子设置专门的模式。

它是如何工作的,分为三个简单的步骤:

1. “稀疏提示”(神奇的暗示)

他们没有一次性向 AI 展示整个 3D 世界的图像(这太嘈杂了),而是给了它一个 稀疏度量提示 (Sparse Metric Prompt)

  • 类比: 想象你在尝试猜一个隐藏在盒子里的物体的形状。与其让你看到整个盒子,不如有人给了你几个随机的“提示”(点),这些点告诉了你几个特定点的精确距离。
  • 实现方式: 他们拿走一个 3D 地图,随机隐藏掉大部分内容,只给 AI 展示一些带有精确距离的零散点。
  • 为什么有效: 这迫使 AI 去学习空间的“逻辑”(物体之间是如何相互关联的),而不是去死记硬背某个相机的特定噪声模式。它将“空间推理”与“传感器偏差”解耦了。

2. “老师”(预训练模型)

他们为这个系统喂入了海量的数据:来自超过 10,000 种不同相机模型2,000 万对图像-深度对

  • 类比: 这就像雇佣了一位天才导师,他读遍了图书馆里的每一本书,无论这些书是用英语、法语还是某种虚构的语言写的。
  • 结果: 这个“老师”模型学会了观察一张图片和一些随机的距离提示,然后补全剩下的整个 3D 世界。它会随着给予的数据量增加而变得越来越强(一种“缩放趋势”),而这在以前被认为在处理此类任务时是不可能的。

3. “学生”(蒸馏模型)

“老师”很厉害,但工作时需要那些“提示”(prompt)。对于许多现实世界的任务(比如自动驾驶汽车或机器人),你无法获得这些提示。

  • 类比: 老师是一位需要看菜谱才能下厨的大厨。学生则是大厨的学徒。老师拿着菜谱烹饪了无数顿饭,而学徒在一旁仔细观察,学习其中的“技法”,而不需要菜谱。
  • 结果: 他们创建了一个从“老师”那里学习的“学生”模型。现在,学生只需看一张普通的照片,就能瞬间知道精确的 3D 距离,完全不需要任何提示或输入

它能做什么?(“超能力”)

由于这个系统是从如此多样且嘈杂的数据中学习的,它具有极强的鲁棒性。论文显示它在以下方面表现出色:

  • 填补空白: 如果你给它一个模糊或低分辨率的深度图,它可以进行“超分辨率”处理,使其变得清晰且细节丰富。
  • 传感器融合: 它可以接收来自 雷达 (Radar) 的非常稀疏、多噪的信号(雷达比 LiDAR 稀疏得多),并将其与相机融合,从而创建一个完美的 3D 地图。
  • 修复相机: 它可以通过理解场景的几何结构,仅凭一张照片就推测出相机的设置(焦距)。
  • 机器人与 AI: 当他们把这个“空间大脑”交给机器人(VLA)或大型多模态模型(MLLM)时,机器人变得更擅长在房间里导航、估计杯子的距离以及规划路径。它不再是靠猜,而是靠测量。

核心总结

这篇论文证明了:更多的数据 + 处理噪声的简单智能方法 = 更强大的 3D 大脑。

他们不需要构建复杂的自定义硬件,也不需要为每种相机编写特殊的规则。他们只需要一个简单的“基于提示”的训练方法和一个庞大的、混乱的数据集。其结果是一个能够理解 3D 世界的模型,其表现甚至优于(或至少等同于)之前的任何系统,并且它无处不在——从雨中的街道到卡通世界,再到机器人的厨房。

简而言之: 他们通过向 AI 展示一百万张带有少量随机线索的混乱图片,教会了它如何理解距离,现在它比以往任何时候都更能看清 3D 世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →