✨ 要点🔬 技术摘要
想象一下,你正在尝试教一个机器人理解世界。为此,机器人不仅需要了解一个物体“是什么”(比如椅子或杯子),还需要确切知道它“如何”摆放、有多大以及朝向何方。在计算机视觉领域,这被称为“9D 姿态估计”(3D 位置 + 3D 旋转 + 3D 尺寸)。
问题在于,教机器人掌握这些极其困难,因为我们缺乏包含真实世界示例的足够多的“教科书”(数据集)。大多数现有的教科书要么:
虚假 :由计算机生成(合成),导致机器人在看到真实、杂乱的图片时会感到困惑。
太小 :仅包含数千张少数几种物体(例如仅 9 种玩具)的图片。
引入"Every9D-21M":一本庞大的新教科书
这篇论文介绍了一个名为Every9D-21M 的全新巨型数据集。把它想象成一个图书馆,其中包含2180 万张 关于700 种不同日常物体 (从椅子和杯子到动物和工具)的照片。它的规模是以往任何同类真实世界数据集的 100 倍。
他们是如何构建它的?(“复制 - 粘贴”魔法)
你可能会问:“他们怎么可能标注 2180 万张照片?这需要人类耗费一生!”
他们并没有标注每一张照片。相反,他们采用了一种巧妙的“基于参考”的策略,就像使用母本和印章一样:
视频线索 :他们从普通人拍摄的 10.9 万段短视频开始,视频中人们围绕物体行走(例如摄像机围绕花瓶旋转)。
3D 重建 :利用计算机视觉,他们将这些视频转换为 3D 点云(构成物体形状的数字点云)。
“中位点”(最佳代表) :他们将相似的物体分组(例如所有“椅子”)。他们没有随机挑选一把椅子作为“首领”,而是挑选了最接近该组平均外观的那一把。
人类参与(微小部分) :人类只需手动标注每个组中的“首领”物体。这总共只需要约1000 个标注 (占总数据的不到 0.01%)。
印章(传播) :一旦“首领”椅子被标注了正确的朝向(例如“椅背朝向这个方向”),计算机就利用几何关系和视觉匹配,将相同的朝向“盖印”到该组中的每一把其他椅子上。
质量检查 :随后,人类快速检查了这些盖印结果,以确保计算机没有犯错。
结果 :他们仅用199 小时 的人类工作就创建了一个大规模、高质量的数据集。如果他们手动标注每一张照片,将需要数千年。
这为何重要?
论文声称,在这个新数据集上训练 AI 模型,使其比在旧的小型数据集上训练的模型更智能。
更好的泛化能力 :当他们在 Every9D-21M 上训练模型,并在其他著名数据集(如 ImageNet3D 或 HANDAL)上进行测试时,其表现显著更好。这就像一名学生研读了大量多样化的真实世界示例图书馆,从而能够在完全不同的课堂环境中解决问题。
对称性感知 :研究人员还制定了处理“对称性”的规则。例如,如果绕中心旋转瓶子,它看起来是一样的。该数据集教会 AI 理解这些规则,因此它不会因从不同角度观察外观相同的物体而感到困惑。
核心结论
作者通过将数千个以物体为中心的短视频转化为 3D 形状,手动标注其中极小一部分,然后利用智能计算机算法将这些标签复制到数百万张其他图像上,构建了一个“超级数据集”。这为 AI 提供了更坚实的“世界之眼”基础,使其能够比以往更准确地理解日常物体的 3D 形状和朝向。
该论文并未声称 :
它并未声称这能立即解决所有机器人学问题。
它并未声称深度(距离)数据是完美的传感器数据(它使用的是 AI 估计的深度)。
它并未声称该系统对移动、动态物体(如奔跑的狗)的处理方式与对静态物体的处理方式相同;所使用的视频大多是围绕静态物体从不同角度拍摄的。
技术摘要:Every9D-21M
问题陈述
从单张真实世界图像中估计日常物体的 9D 姿态(3D 旋转、3D 平移和 3D 物体范围)仍然是计算机视觉领域的一项重大挑战。这一困难主要源于缺乏大规模的真实世界监督。现有数据集在类别多样性与实例规模之间存在权衡:它们要么严重依赖合成渲染,难以泛化到真实世界的噪声和遮挡;要么对真实世界物体的覆盖有限。例如,最大的现有真实世界 9D 姿态数据集(Objectron)仅包含 9 个类别的 17,000 个标注物体,而最大的图像级 3D 姿态数据集(ImageNet3D)覆盖了 200 个类别,但仅有 86,000 张图像。此外,9D 姿态的人工标注成本高昂,且从单视角看往往存在歧义,这阻碍了面向机器人、AR/VR 和 3D 生成建模的鲁棒基础模型的发展。
方法论
作者提出了Every9D-21M ,这是一个为 700 个物体类别的 2180 万张真实世界图像生成 9D 姿态标注的框架。其核心策略利用以物体为中心的视频来克服单视角歧义并扩展标注规模。该流程包含五个迭代阶段:
聚类 :使用 k-means 算法,基于从均匀采样帧中提取的平均 DINOv3 特征,对以物体为中心的视频(源自 uCO3D)进行聚类。这种类别无关的方法将视觉相似的实例分组,允许跨类别对齐,并减少对手动类别标签的依赖。
参考选择 :对于每个簇,选择一个代表性的“中位”视频作为参考实例。这一选择基于簇内与其他视频平均特征距离最小的视频,相比随机选择能产生更高的对齐精度。
参考标注 :对少量参考物体(占总图像数的不到 0.01%,约 1,000 个物体)进行人工标注。标注人员使用交互式工具,利用多视图掩码(LangSAM + XMem)将 3D 边界框对齐到稀疏 3D 点云(通过 VGGSfM 重建)。关键在于,作者定义了基于内在属性、人机交互和物体间交互的跨类别方向规则 ,以确保一致的规范坐标系(例如,将椅子的“正面”定义为背靠背的一侧)。
跨实例对齐 :将簇中剩余的实例视频与参考实例对齐。这涉及重建 3D 表面(通过 alpha 形状)并将多视图 DINO 特征投影到该表面上。使用 RANSAC 初始化 followed by 基于梯度的细化来估计刚性变换(旋转、平移、缩放),最小化几何距离(Chamfer 距离)和外观距离(特征空间最近邻)的加权组合。
验证 :从多个规范视角(前、上、右)验证所有传播的姿态。序列要么被过滤(因几何质量差或多物体泄露而移除),要么被跳过(因参考不匹配而在后续迭代中重新处理)。
生成的规范姿态被传播到以物体为中心的视频中的所有帧,从而获得密集的 9D 标注。
主要贡献
可扩展的真实世界 9D 规范化 :作者引入了一种基于参考的迭代框架,利用以物体为中心的视频进行多视图 3D 重建和跨实例对齐。该方法将规范坐标系从极小比例的人工标注参考传播到数百万张图像,且每个传播的姿态均经过多视角验证。
Every9D-21M 数据集 :一个包含 2180 万张图像、10.9 万个标注物体和 700 个类别的大规模数据集。其在图像数量和类别多样性上均比先前的真实世界 9D 姿态基准大两个数量级。整个数据集的整理仅耗费了约 199 小时的人力(67 小时用于标注,132 小时用于验证)。
基准与基线 :本文建立了标准化的、感知对称性的评估协议,并提供了在 Every9D-21M 上训练的基线模型。这些基线表明,在该数据集上训练能提高在现有基准(PASCAL3D+、ImageNet3D)上的性能,并且与仅在 ImageNet3D 上训练的模型相比,在手部可操作物体数据集(HANDAL)上展现出显著更好的泛化能力。
结果
实验验证了该数据集和规范化框架的有效性:
在 Every9D-21M 上的性能 :在测试集上,在 Every9D-21M 上训练的模型显著优于最先进的基座模型(OrientAnythingV1、OrientAnythingV2、WildDet3D)。具体而言,在对称性无关和对称性感知的设置下,所提出的模型将粗略旋转精度(Acc@30°)相比 OrientAnythingV2 提高了 16.6 到 17.7 个百分点。
泛化能力 :尽管存在领域差距,但在 Every9D-21M 上训练比在 ImageNet3D 上训练能带来对 HANDAL 数据集(真实世界可操作物体数据集)更强的泛化能力。
互补性 :联合使用 Every9D-21M 和 ImageNet3D 进行训练,一致地提高了在 PASCAL3D+ 和 ImageNet3D 上的性能,表明这两个数据集具有互补性。
定性改进 :视觉比较表明,与先前的方法相比,该方法对异常物体朝向具有更强的鲁棒性,能更准确地估计细微的角度差异,并在具有挑战性的光照条件下表现出更好的韧性。
意义
本文将 Every9D-21M 定位为在无约束真实世界环境中推进 9D 姿态估计和 3D 理解的关键资源。通过提供一个具有统一规范坐标系的大规模真实世界数据集,这项工作解决了限制合成数据训练模型泛化能力的“仿真到现实”差距。作者认为,可扩展的规范化监督对于以下领域至关重要:
机器人与 AR/VR :通过推断一致的以物体为中心的坐标系,实现空间推理和物理交互。
3D 生成建模 :提供方向对齐的训练数据,以提高文本到 3D 和图像到 3D 系统中的可控性和几何一致性。
对应关系学习 :确保跨实例的稳定对齐,以用于 3D 可变形建模。
这项工作表明,通过战略性地利用以物体为中心的视频和跨实例对齐,可以以最小的人力成本实现大规模的优质 9D 监督,为真实世界 3D 姿态基准树立了新标准。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。