想象一下,你想教机器人识别一个它从未见过的、造型奇特的咖啡杯。通常,要做到这一点,你需要给机器人提供该咖啡杯的完美 3D 蓝图(CAD 模型)。但如果你没有蓝图怎么办?如果你只有用手机从不同角度拍摄的几张咖啡杯照片呢?
本文介绍了一种名为NeMO(Neural Memory Object,神经记忆物体)的新方法,可解决这一问题。将 NeMO 想象成一种物体的“智能数字记忆卡”。
其工作原理可分解为以下简单步骤:
1. “记忆卡”的创建(编码器)
想象你从不同角度拍摄几张新物体(如那个咖啡杯)的照片,并将这些照片输入 NeMO 系统。
- 它的作用:系统并非仅仅存储图片,而是分析这些图片以构建物体的 3D“骨架”。它生成一个点云,代表物体的形状、纹理和特征。
- 神奇之处:这个“骨架”存储在其自身的坐标系中。它不关心相机在哪里或物体如何旋转;它只了解物体“是什么”。
- 类比:这就像你拍了几张朋友的照片,并在脑海中构建出他们的 3D 全息影像。你不需要他们面部的蓝图;只需几张好照片就能建立心理模型。
2. “搜索与匹配”(解码器)
现在,想象机器人身处一个杂乱的房间(“杂乱场景”),并看到一张新照片。它需要找到那个特定的咖啡杯。
- 它的作用:机器人将之前创建的“记忆卡”(NeMO)与新照片进行比对。
- 结果:系统立即告诉机器人:
- 物体在哪里(检测)。
- 它是什么形状(分割),即使部分被其他物体遮挡。
- 它在空间中的姿态(6DoF 位姿),即它确切地如何倾斜和旋转。
- 其表面看起来如何(重建),本质上即使相机只看到物体的一部分,也能推测出其完整的 3D 形状。
3. 为何此方法特殊
大多数当前的 AI 系统就像死记硬背特定教科书的學生。如果考题稍有变化,他们就会困惑。通常,每遇到一个新物体,都需要对它们进行“重新训练”(再次学习)。
NeMO 的不同之处在于它外包了知识。
- 无需重新训练:你不需要教机器人“大脑”(神经网络)任何新东西。你只需为新物体提供一张新的“记忆卡”(NeMO)。大脑保持不变,仅记忆发生变化。
- 高效性:一旦“记忆卡”制作完成,使用速度非常快。无论你用 5 张照片还是 50 张照片制作该卡片,机器人使用它的速度都是一样的。
- 无需蓝图:它无需 3D CAD 模型即可工作。它直接从真实照片中学习形状。
论文实际证明的内容
作者在用于测试 AI 的各种数据集(图像集合)上测试了该系统。他们表明:
- 它能够在杂乱、拥挤的环境中识别并定位从未见过的物体。
- 它能够非常准确地估计物体的位置和朝向。
- 它甚至能够“推测”物体的完整 3D 表面,从而实现重建。
- 其表现与需要 3D 模型或大量重新训练的其他顶级方法相当,甚至更优。
局限性(目前尚不能做到的)
论文承认该系统尚不完美。
- 对称性:如果物体从各个角度看都一样(如完美的球体或对称的杯子),系统有时会混淆哪一面是“上”。
- 无纹理物体:如果物体完全光滑且没有任何图案(如纯白色的球),系统更难判断其形状,因为它依赖于视觉特征。
- 多个物体:如果图片中有两个相同的杯子,系统可能会将它们合并成一个大的团块,而不是视为两个独立的物品。
简而言之,NeMO 是一种利用几张照片为机器人提供新物体快速、灵活“记忆”的方法,使其能够立即识别并与该物体互动,而无需 3D 蓝图或漫长的训练过程。
技术摘要:NeMO 的探索
问题陈述
本文解决了训练期间未见过的物体的少样本物体感知挑战。虽然基于模型的方法(利用 3D CAD 模型)在检测、分割和 6DoF 姿态估计方面取得了强劲的性能,但在许多 3D 模型不可用的现实场景中,它们并不切实际。相反,现有的无模型方法往往受限于模板视图数量的可扩展性差、依赖成对局部比较而缺乏联合推理,或者需要大量的重新训练和预处理才能接入新物体。作者旨在开发一种系统,仅需一组无序的 RGB 图像即可快速适应新物体,而无需相机标定参数、3D 模型或重新训练核心网络权重。
方法论:神经记忆物体(NeMO)
提出的解决方案是一种以新颖的物体中心表示**神经记忆物体(NeMO)**为核心的编码器 - 解码器架构。
1. NeMO 编码器
编码器处理一组描绘目标物体的 K 个无序 RGB 模板图像(I={Ii})。
- 特征提取:视觉 Transformer(ViT)从所有模板图像中提取分块特征。
- 多视图编码:利用交叉注意力和自注意力机制的多视图编码器更新这些特征。其中一张图像被指定为“锚点”(IA)以定义初始物体朝向,其他图像与其交互以聚合多视图信息。
- 几何映射:为了融入 3D 几何,系统在归一化体积内采样一组 3D 点(Q)。多层感知机(MLP)将这些点编码为特征向量。这些点特征通过几何映射块(使用 Transformer 解码器)与更新后的图像特征融合,使 3D 点能够关注特定于物体的 2D 视觉线索。
- 表面重建与表示:网络学习一个无符号距离场(UDF),以预测初始 3D 点到估计物体表面的距离。最终的 NeMO 表示(χ)是一个稀疏的连续点云,其中每个点由估计的 3D 表面坐标(si)及其对应的特征向量(f^iQ)组成。
- 关键特性:特定于物体的信息与解码器的参数解耦。NeMO 充当一种“记忆”,可以独立于网络权重进行变换(旋转、平移、缩放)。
2. NeMO 解码器
解码器接收查询图像(Iq)和预计算的 NeMO 表示(χ)以生成密集预测。
- 特征融合:查询图像特征(通过 ViT 提取)通过利用交叉注意力和自注意力关注 NeMO 特征进行更新。
- 密集预测头:使用带有多个输出头的 DPT(密集预测 Transformer)骨干网络,解码器生成:
- 模态与无模态分割掩码:预测物体的可见部分和遮挡部分。
- 2D-3D 对应关系(点图):将查询图像中的 2D 像素与 NeMO 坐标系中定义的 3D 表面点连接的密集映射。
- 置信度图:与 2D-3D 映射相关的置信度分数。
- 姿态估计:通过基于置信度过滤点图并应用带有透视 n 点(PnP)算法的 RANSAC 来估计 6DoF 姿态。
3. 训练策略
编码器和解码器在由 BlenderProc 生成的大规模合成数据集上进行联合端到端训练。
- 损失函数:训练最小化预测表面点与真实表面点之间的欧几里得距离、分割损失(Dice 和 BCE),以及用于 2D-3D 对应关系的置信度加权 L1 损失。
- 数据增强:在训练期间,NeMO 点云在传递给解码器之前被随机旋转、平移和缩放。这迫使解码器学习独立于锚点图像的坐标系,确保对 NeMO 朝向的鲁棒性。
- 离线/在线分离:模板视图的繁重编码计算在离线阶段执行。推理时间仅取决于查询图像和预计算的 NeMO,使其与输入模板的数量无关。
主要贡献
- NeMO 表示:一种对几何敏感、紧凑且连续的模板视图点云表示,封装了语义和几何特征,无需相机参数或 3D 模型。
- 统一架构:单个编码器 - 解码器网络能够执行无模型(仅 RGB 模板)和有模型(可用 CAD 模型)设置下的检测、分割和 6DoF 姿态估计。
- 可扩展性与效率:该方法将物体信息与网络权重解耦,无需重新训练即可快速接入新物体。无论用于生成 NeMO 的模板图像数量如何,推理运行时间和内存消耗保持恒定。
- 新数据集:作者贡献了一个多样化的、以物体为中心的合成数据集,模拟真实的杂乱场景,以支持该领域的研究。
实验结果
该方法在BOP 基准上针对各种数据集(HOPEv2、HANDAL、T-LESS、TUD-L、YCB-V)的无模型和有模型设置进行了评估。
- 无模型检测:该方法在 HOPEv2 和 HANDAL 数据集上取得了**最先进(SOTA)*的结果,平均精度(AP)分别比之前的最佳方法高出 2.7 和 1.9 个百分点。值得注意的是,它是首个在单网络下于无模型设置中预测无模态*分割的方法。
- 无模型姿态估计:使用 NeMO 检测时,该方法在 HANDAL 数据集上取得了 SOTA 结果;使用替代检测时,其表现与其他方法相当。
- 有模型感知:在有模型设置中(推理时可用 CAD 模型但训练时不可用),该方法表现具有竞争力,在 YCB-V 上排名第 6,并在 TUD-L 的检测上取得 SOTA。它在无需优化的情况下在 TUD-L 和 YCB-V 上展示了高召回率的姿态估计,但在处理 T-LESS 中具有对称性和无纹理的物体时表现不佳。
- 消融研究:实验表明,性能随模板图像数量(在约 32 个视图处饱和)和 NeMO 点数量(在约 500 个点处饱和)的增加而提升。系统展示了旋转等变性,即旋转 NeMO 输入会导致预测点图产生相应的旋转。
意义与主张
本文声称,NeMO 为无模型少样本感知提供了一种通用解决方案,有效地弥合了无模型方法的灵活性与基于模型方法的几何精度之间的差距。通过将物体信息外包到 NeMO 中,该系统允许:
- 快速接入:新物体可以在不重新训练网络的情况下集成。
- 多阶段流水线:能够在杂乱场景中检测和分割物体,从而允许裁剪感兴趣区域以供后续处理。
- 可扩展性:编码和解码的分离确保了增加更多模板视图不会增加推理延迟。
作者承认了局限性,特别是关于对称性和高度无纹理的物体(如 T-LESS 数据集中所见),将其归因于当前的训练程序和数据集偏差,而非表示本身。他们总结道,他们的工作激发了关于将物体知识与模型权重解耦以推进少样本感知的讨论。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。