← 最新论文
💻 computer science

Every9D-21M: Large-Scale Real-World 9D Canonicalization of Everyday Objects

本文介绍了 Every9D-21M,这是一个包含 2180 万张真实世界图像的大规模数据集,涵盖 700 个物体类别并配有 9D 姿态标注,该数据集通过利用以物体为中心的视频和跨实例对齐技术构建而成,旨在克服 9D 规范化任务中大规模真实世界监督数据稀缺的问题。

原作者: Leonhard Sommer, Emil Akopyan, Adam Kortylewski

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Leonhard Sommer, Emil Akopyan, Adam Kortylewski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人理解世界。为此,机器人不仅需要了解一个物体“是什么”(比如椅子或杯子),还需要确切知道它“如何”摆放、有多大以及朝向何方。在计算机视觉领域,这被称为“9D 姿态估计”(3D 位置 + 3D 旋转 + 3D 尺寸)。

问题在于,教机器人掌握这些极其困难,因为我们缺乏包含真实世界示例的足够多的“教科书”(数据集)。大多数现有的教科书要么:

  1. 虚假:由计算机生成(合成),导致机器人在看到真实、杂乱的图片时会感到困惑。
  2. 太小:仅包含数千张少数几种物体(例如仅 9 种玩具)的图片。

引入"Every9D-21M":一本庞大的新教科书

这篇论文介绍了一个名为Every9D-21M的全新巨型数据集。把它想象成一个图书馆,其中包含2180 万张关于700 种不同日常物体(从椅子和杯子到动物和工具)的照片。它的规模是以往任何同类真实世界数据集的 100 倍。

他们是如何构建它的?(“复制 - 粘贴”魔法)

你可能会问:“他们怎么可能标注 2180 万张照片?这需要人类耗费一生!”

他们并没有标注每一张照片。相反,他们采用了一种巧妙的“基于参考”的策略,就像使用母本和印章一样:

  1. 视频线索:他们从普通人拍摄的 10.9 万段短视频开始,视频中人们围绕物体行走(例如摄像机围绕花瓶旋转)。
  2. 3D 重建:利用计算机视觉,他们将这些视频转换为 3D 点云(构成物体形状的数字点云)。
  3. “中位点”(最佳代表):他们将相似的物体分组(例如所有“椅子”)。他们没有随机挑选一把椅子作为“首领”,而是挑选了最接近该组平均外观的那一把。
  4. 人类参与(微小部分):人类只需手动标注每个组中的“首领”物体。这总共只需要约1000 个标注(占总数据的不到 0.01%)。
  5. 印章(传播):一旦“首领”椅子被标注了正确的朝向(例如“椅背朝向这个方向”),计算机就利用几何关系和视觉匹配,将相同的朝向“盖印”到该组中的每一把其他椅子上。
  6. 质量检查:随后,人类快速检查了这些盖印结果,以确保计算机没有犯错。

结果:他们仅用199 小时的人类工作就创建了一个大规模、高质量的数据集。如果他们手动标注每一张照片,将需要数千年。

这为何重要?

论文声称,在这个新数据集上训练 AI 模型,使其比在旧的小型数据集上训练的模型更智能。

  • 更好的泛化能力:当他们在 Every9D-21M 上训练模型,并在其他著名数据集(如 ImageNet3D 或 HANDAL)上进行测试时,其表现显著更好。这就像一名学生研读了大量多样化的真实世界示例图书馆,从而能够在完全不同的课堂环境中解决问题。
  • 对称性感知:研究人员还制定了处理“对称性”的规则。例如,如果绕中心旋转瓶子,它看起来是一样的。该数据集教会 AI 理解这些规则,因此它不会因从不同角度观察外观相同的物体而感到困惑。

核心结论

作者通过将数千个以物体为中心的短视频转化为 3D 形状,手动标注其中极小一部分,然后利用智能计算机算法将这些标签复制到数百万张其他图像上,构建了一个“超级数据集”。这为 AI 提供了更坚实的“世界之眼”基础,使其能够比以往更准确地理解日常物体的 3D 形状和朝向。

该论文并未声称

  • 它并未声称这能立即解决所有机器人学问题。
  • 它并未声称深度(距离)数据是完美的传感器数据(它使用的是 AI 估计的深度)。
  • 它并未声称该系统对移动、动态物体(如奔跑的狗)的处理方式与对静态物体的处理方式相同;所使用的视频大多是围绕静态物体从不同角度拍摄的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →