想象你有一个巨大的数字玩具箱。多年来,箱子里的玩具大多是静态雕像——看起来很美,但你实际上无法“玩”它们。如果你试图拉开一个数字梳妆台的抽屉,它会像幽灵一样直接穿过木头。如果你试图旋转一把椅子,它会保持冻结不动。
这篇论文介绍了Artiverse,这是一个全新的、庞大的 3D 物体集合,其中的物体不仅仅是雕像,而是完全功能化、可“活”动的数字玩具。你可以把它想象成将你的玩具箱从一堆塑料模型升级为一套高科技、具备物理属性的动作人偶,它们能像真实物体那样运作。
以下是他们构建的内容及方法的简要说明,使用了简单的类比:
1. “活”玩具箱(数据集)
Artiverse 包含超过 5,400 个人造物体(如椅子、烤面包机和文件柜),涵盖 88 个不同类别。
- 旧数据集的问题: 之前的集合就像“纸娃娃”。它们拥有正确的形状,但如果你试图移动某个部件,它们不知道如何连接。它们还缺乏“内部”细节(例如微波炉内部的空腔),也不知道物体的重量。
- Artiverse 的解决方案: 这个新箱子里的每个物体都是基于物理现实构建的。
- 它有重量: 计算机知道塑料把手比金属把手轻。
- 它有尺寸: 椅子的尺寸是真实椅子的尺寸,既不是巨型的也不是微型的。
- 它有“骨骼”和“关节”: 就像人类有关节和肘部一样,这些物体拥有铰链、滑块和旋转轴。计算机确切地知道门如何摆动或抽屉如何滑动。
- 它有“内部”: 如果你打开微波炉,你可以看到里面的转盘。如果你打开冰箱,你会看到里面的架子。
2. “机器人厨师”装配线(标注过程)
手工构建 5,400 个复杂的、可移动的玩具,需要人类团队花费数年时间。为了加快这一进程,研究人员建立了一条半自动化装配线。
你可以把它想象成一个机器人厨师试图制作三明治:
- 机器人猜测: AI 观察一个 3D 模型并猜测:“这个部件是把手,那个部件是门。我认为门是通过铰链摆动的。”
- 人类品尝测试员: 一位人类专家查看机器人的猜测。“把手做得不错,但门连接到了错误的一侧。修正它。”
- 结果: 这种团队合作使他们将人工工作时间减少了约 30%。机器人承担繁重的工作,而人类只需修正错误,确保一切完美无缺。
3. 为什么这很重要(实验)
该论文测试了这个新“玩具箱”是否真的能用于训练计算机程序(机器人和 AI)。
- “它如何移动?”测试: 他们训练计算机观察椅子的静态图片并猜测部件如何移动。当他们使用 Artiverse 训练计算机时,其猜测能力比使用旧的、像“幽灵”一样的数据集时有了显著提升。它学会了椅子有旋转底座,抽屉会滑出。
- “从零开始构建”测试: 他们向计算机展示了一张烤面包机的图片,并要求它构建一个实际可用的 3D 版本。在 Artiverse 上训练的计算机构建出了一个带有可操作杠杆和逼真内部部件的烤面包机,而在旧数据上训练的计算机则难以制造出能正确移动的物体。
- “机器人模拟器”测试: 他们将这些物体放入物理模拟器(机器人的视频游戏引擎)中。他们成功编程让一个虚拟机械臂打开一个橱柜抽屉。因为抽屉具有真实的重量、真实的关节和真实的摩擦力,机器人没有直接“穿模”过去,而是真正将其拉开。
总结
Artiverse 是一个庞大的、面向真实世界的 3D 物体库。它不仅仅是一张椅子的图片;它是一个你可以坐、旋转和抬起的数字椅子,具备正确的物理属性、材质和运动部件。通过将 AI 的猜测与人类专家相结合,研究人员创建了一个数据集,帮助教导机器人和 AI 理解、交互并操纵它们周围的物理世界。
技术摘要:Artiverse
问题陈述
现有的用于可动物体的 3D 数据集往往缺乏逼真模拟和具身智能所需的几何保真度、功能真实性和物理基础。虽然大型存储库(如 ShapeNet、Objaverse)提供了多样的几何形状,但它们主要是静态的。专用的可动数据集(如 PartNet-Mobility、AKB-48)提供了运动标注,但在关节复杂性(主要是单自由度)、视觉真实性(简化纹理、缺失内部结构)和物理属性(质量、材质、度量尺度)方面存在局限。ArtVIP 和 PhysX-3D 等近期工作已开始解决物理属性问题,但在规模和类别多样性方面仍然有限。因此,目前缺乏能够捕捉功能交互全谱系(结构分解、运动学依赖和物理合理性)的高质量、基于物理的资产,而这些对于推进功能建模和模拟是必要的。
方法论
作者介绍了Artiverse,这是一个包含 5,402 个人工创作的可动物体的数据集,涵盖 88 个类别,聚合自 10 个多样化的 3D 存储库(包括 ShapeNet、ABO、3D-Future、HSSD、Objaverse 等)。Artiverse 的构建依赖于一个半自动标注流程,旨在平衡可扩展性与高质量的人工验证。
1. 数据选择与预处理
模型通过混合检索工作流从多个存储库中筛选,该工作流结合了自动特征分析(DuoDuoCLIP 嵌入)和人工监督。物体被标准化为一致的 y 轴向上坐标系,归零居中,并缩放到度量单位。对于原始数据缺失的子类别,利用大型语言模型(GPT-4o)推断度量尺度以估算物理尺寸。
2. 半自动标注流程
该流程包含四个连续阶段,并在关键节点集成人工验证:
功能部件分割:
- 模板驱动: 特定类别的模板定义功能部件标签(如把手、盖子、搁板)和运动类型。
- 少样本分割: ASIA 模型(利用少量图像标注进行自适应 3D 分割)在每个类别的一小批人工标注示例上进行训练,以在多视图渲染上生成初始 2D 部件掩码。
- 3D 聚合: 2D 掩码被投影到 3D 网格过分割上。未标记的内部表面通过基于距离的传播分配标签。并查集算法将连接的片段聚类为不相交的部件实例。
- 验证: 人工标注者通过 3D 用户界面修正分割错误,随后由专家进行验证。
内部结构补全:
- 为确保物理真实性,该流程针对三种场景解决缺失的内部几何结构:
- 部分可动部件缺失: 扩展几何结构以补全如抽屉等部件缺失的内部箱体,确保在整个运动范围内的合理性。
- 缺失可动部件: 通过参考相似物体的模板,程序化地插入缺失的内部组件(如洗碗机篮筐、微波炉转盘)。
- 缺失交互功能: 为空心家具添加搁板和架子等结构元素,以支持逼真的交互。
运动标注:
- 自动提案: 几何启发式方法利用 PCA 对齐的边界框和运动学依赖部件之间的接触区域分析,推断关节参数(类型、轴、原点、限制)。基于空间连接性和模板约束构建运动学图。
- 验证: 人类专家验证运动合理性,并使用支持运动复制和即时预览的交互式 Web 界面调整关节参数。
物理属性:
- 质量与材质: 通过计算体积(对实体部件进行四面体化,对空心部件进行壳偏移)并乘以材料密度来估算每个部件的质量。基于语义标签和 LLM 推断的范围分配材质标签和密度范围。
3. 效率
与完全人工流程相比,半自动方法将分割的人工标注时间减少了32.0%,将运动标注时间减少了33.5%。约**50.12%**的自动提案无需人工修正。
主要贡献
- Artiverse 数据集: 一个包含 5,402 个可动物体的多样化集合,拥有丰富的标注,包括功能部件、运动学依赖、多自由度关节(如万向节、圆柱关节)和物理属性(度量尺度、材质、质量)。它涵盖了 88 个子类别,显著扩展了现有数据集的多样性和复杂性。
- 半自动流程: 一个可扩展的工作流,整合了少样本分割、几何推理和多阶段人工验证,以高效地生成高质量标注。
- 基准测试与验证: 论文通过以下方式展示了数据集的效用:
- 部件运动性分析: 在 Artiverse 上训练 FPNGroupMot 模型,其泛化能力优于在 PartNet-Mobility 上训练的模型,尽管数据集的复杂性给现有模型带来了新的挑战。
- 可动物体生成: 评估基于图像的条件生成(SINGAPO、Articulate-Anything)表明,在 Artiverse 上训练的模型产生的结果在结构和几何一致性方面优于仅依赖视觉语言模型(VLM)先验的模型。
- 模拟就绪性: 资产以 GLB、USD 和 URDF 格式发布,可无缝集成到物理引擎(如 Genesis)中,用于具身智能任务。
结果
- 统计数据: Artiverse 包含 24,607 个部件和 23,640 个关节,其中相当一部分是复杂的多自由度关节(480 个 2 自由度关节),而 PartNet-Mobility 主要关注单自由度。
- 跨数据集评估: 在 Artiverse 上训练的模型在部件分割和运动预测指标(如 F1 分数)上优于在 PartNet-Mobility 上训练的模型,表明数据集的多样性和质量增强了模型的泛化能力。
- 生成性能: 在图像到可动物体的生成中,在 Artiverse 上训练的 SINGAPO 实现了更高的 gIoU 和更低的碰撞率(AOR),优于依赖 VLM 先验的模型,突显了结构化数据先验对于详细可动合成的重要性。
意义
论文声称,Artiverse 是推进可动物体功能理解的关键资源。通过提供基于物理的、多样化的和运动学复杂的资产,它实现了:
- 开发更鲁棒的基于学习的方法,用于部件运动性分析和可动物体生成。
- 创建逼真的交互式场景和沉浸式虚拟环境。
- 在基于物理的模拟器中训练和评估具身智能体,以执行物体操作等交互任务。
作者将 Artiverse 定位为不仅是一个数据集合,更是一个基准,它揭示了当前方法在处理复杂、多自由度可动性推理方面的局限性,从而激发未来关于可动行为统一推理的研究。该数据集以标准化格式发布,以促进在模拟和生成建模任务中的立即采用。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。