想象一下,你正在教一个机器人如何拿起一个它从未见过的、奇怪的新物体,比如一个形状奇特的浇水壶。过去的方法就像是要求一名图书管理员仅根据书名来找书。如果你要找“马克杯”,管理员只会给你看其他的马克杯;如果你要找“浇水壶”,他们就只会给你看浇水壶。但如果这个浇水壶的手柄形状恰好和马克杯的手柄一模一样呢?旧的方法会错过这种联系,因为它们的“名称”(物体的名字)不同,尽管它们的“部件”是相同的。
这篇论文介绍了一种名为 GRAFT 的新方法,它教机器人不再仅仅观察物体整体,而是去观察物体的部件。你可以把它想象成一位资深的木匠,他们不仅仅是看一把椅子,还会观察椅腿、座面和靠背,从而理解如何建造或修理它。
以下是 GRAFT 的工作原理,分为几个简单的步骤:
1. 将物体转化为“家族树”(图谱)
GRAFT 不再将物体视为一个巨大的整体,而是将其分解为一张部件地图。
- 节点(Nodes): 想象每一个手柄、喷嘴或底座都是家族树上的一个节点。
- 连接(Connections): 连接这些节点的线条展示了它们在空间中的排列方式(例如,手柄是“附着”在杯子侧面的)。
- “DNA”: 每个部件都有关于其形状以及人类通常如何使用它的描述(例如,“这是抓握的地方”)。
2. “媒人”算法 (UFGW)
现在,机器人有一个新物体(“目标”)和一个包含旧演示案例的库(“源”)。它需要找到最佳匹配。
- 旧的方法: 它会尝试匹配整个物体。“这个浇水壶像茶壶吗?”不像。“它像瓶子吗?”不像。
- GRAFT 的方法: 它使用一种特殊的数学工具,称为 UFGW(非平衡融合 Gromov–Wasserstein)。你可以把它想象成一个超级聪明的媒人,它会说:“我不在乎整个物体看起来是否不同。我看到这个浇水壶有一个手柄,它的外观和功能都和那个茶壶的手柄完全一样。”
- “非平衡”的小技巧: 有时物体的部件数量不同(例如,马克杯有手柄,而碗没有)。数学中的“非平衡”部分允许机器人说:“好吧,我会把手柄匹配到手柄,然后忽略那些没有匹配项的额外部件。”这使得匹配过程更加灵活。
3. 寻找“根部”(抓握位置)
为了确保机器人知道在哪里抓取,GRAFT 会查看演示过程中的哪个部件是被首先触碰的(即“根部”)。
- 它使用一个叫做 EM 优化 的过程(可以理解为一个“试错”循环)。
- 问题所在: 如果机器人只是盲目猜测最佳匹配,它可能会抓错部位,因为它可能抓住了视觉上相似但毫无用处的部位(比如抓住了瓶子的顶部而不是瓶颈)。
- 解决方案: EM 过程会观察整个“家族树”结构,以决定哪个部件是最重要的“根部”。它确保机器人抓取的是功能性部件(如手柄),而不仅仅是一个视觉相似但没用的部件。
4. 结果:零样本(Zero-Shot)魔法
一旦机器人找到了匹配的部件,它就会“转移”知识。
- 如果人类演示了如何通过手柄抓取茶壶,GRAFT 就会找到浇水壶的手柄并说:“抓这里!”
- 然后,它会告诉机器人的手具体应该移动到哪里。
- “零样本”的部分: 机器人之前从未见过这个特定的浇水壶。它不需要针对它进行专门训练。它只是利用部件的逻辑瞬间搞定了。
为什么这种方法更好?
论文在模拟环境和真实机器人身上测试了该方法。
- 更多样性: 因为它是通过匹配部件来进行的,所以它可以利用茶壶的演示来教机器人如何拿取马克杯、瓶子或形状奇特的工具。旧的方法太挑剔了,只能处理几乎完全相同的物体。
- 更高的成功率: 在测试中,GRAFT 成功抓取新物体的概率约为 81%,而其他方法的成功率仅在 36-43% 左右徘徊。
- 数据生成器: 作者还展示了 GRAFT 可以通过将少量真实的演示案例“嫁接”到新形状上,自动生成数千个新的训练案例,从而让机器人更容易在现实世界中进行训练。
简而言之: GRAFT 让机器人不再痴迷于物体的“名称”,而是开始思考物体的“解剖结构”。这就像是教机器人识别出门把手和水龙头把手是“亲戚”,即使一个是用来开门的,另一个是用来开关水的。
技术摘要:GRAFT:基于图的部件对应性仿射转移
问题陈述
将机器人操控泛化到未见过的物体仍然是基于学习的方法面临的一个重大挑战,这些方法通常需要大量的演示,并且在少样本或零样本设置下表现不佳。现有的基于检索的方法试图通过在数据集中寻找相似的源物体来转移操控仿射(例如抓取)。然而,现有的流水线通常依赖于高层语义过滤(例如类别名称),随后使用基于外观的描述符(例如来自 DINOv2 等基础模型的描述符)进行几何对齐。作者认为,这种从语义到几何的工作流过于保守;它严重限制了可检索物体的多样性,因为它要求源物体和目标物体在全局外观上必须相似。因此,这些方法无法识别属于不同语义类别但具有相似部件级几何结构的的功能兼容物体(例如,马克杯的手柄与浇水壶的手柄)。
方法论
本文提出了 GRAFT(基于图的仿射转移),这是一个无需学习、具备几何感知能力的对应框架,旨在实现仅需每个物体一个演示的零样本操控转移。其核心洞察是:功能的兼容性是由物体的结构组织而非其整体外观决定的。
1. 基于部件的图表示
每个物体都被表示为一个无向图,其中:
- 节点 对应于单个物体部件。每个节点编码多层描述符:
- 几何特征: 有向包围盒(OBB)范围和归一化的部件点云。
- 顶点级特征: 规范位置编码(傅里叶风格),以实现部件内精细的点对点匹配。
- 全局/功能特征: 从基础模型(如 DINOv2)中提取的描述符,以及一个二进制标注,指示该部件是否为可交互区域(基于演示)。
- 边 捕捉部件之间的空间关系,存储相对平移和旋转,以保留物体的组装结构。
2. 非平衡融合 Gromov–Wasserstein (UFGW) 距离
为了比较这些图,GRAFT 采用了 UFGW 距离。与标准的图匹配不同,UFGW:
- 联合优化节点特征相似度和图级结构一致性。
- 支持不等规模或不等结构图之间的部分匹配(例如,具有不同部件数量的物体)。
- 允许质量变化,这对于处理不同规模或关节运动的物体至关重要。
3. 节点质量估计与优化
该框架的一个关键组件是为节点分配“质量”,代表其结构和功能的重要性:
- 源节点: 质量根据 OBB 体积和显著性因子固定,该因子随广度优先搜索(BFS)距离演示接触部件(根节点)的距离呈指数级衰减。这确保了可交互区域及其相邻区域具有更高的权重。
- 目标节点: 由于目标物体缺乏交互标注,其节点质量并非预定义的。GRAFT 使用集成在 UFGW 优化中的**期望最大化(EM)**程序:
- E 步: 在当前目标质量给定下,求解最优传输计划 T。
- M 步: 通过结合几何先验(归一化 OBB 体积)与来自传输计划的经验流来更新目标质量。这种自适应加权提高了对部件规模或相关性变化的鲁棒性。
4. 检索与转移流水线
- 检索: 对于目标物体,系统计算其与演示缓冲区中所有源物体的 UFGW 距离。选择前 K 个功能最相似的物体。
- 对齐: 最优传输计划 T 提供源部件与目标部件之间的映射。
- 接触传播: 源演示中的接触点通过建立的部件级对应关系传播到目标物体。
- 执行: 转移后的接触点被输入到抓取规划器(如 AnyGrasp)和运动规划器中,以生成可执行的轨迹。
核心贡献
- 结构驱动的检索: 本文引入了一种范式转变,即从物体级的语义/几何相似性转向部件级结构对应性。这使得系统即使在物体属于不相交的语义类别时,也能检索到功能相似的物体。
- 无需学习的框架: GRAFT 无需为特定任务训练新模型,而是依赖于几何描述符和 UFGW 度量。
- 基于 EM 的质量优化: 通过 EM 程序推断目标节点质量的新颖集成,实现了即使在目标物体功能部件未知的情况下也能进行鲁棒匹配。
- 可扩展的数据生成: 通过与 MimicGen 集成,GRAFT 可作为结构先验,用于从少量种子演示中合成多样且物理有效的、针对未见物体的操控演示。
实验结果
作者在三个设置下评估了 GRAFT:
零样本仿射泛化:
- 与使用 CLIP 或 DINO 特征的基线(如 where2act 和 ROBO-ABC)相比,GRAFT 表现优异。
- 指标: GRAFT 达到了 0.85 的仿射成功率(ASR)(对比表现最好的基线为 0.69)和 0.82 的归一化语义相似度(NSS),同时显著降低了运动距离(DTM)至 0.02。
基于仿真的执行:
- 在带有浮动夹持器的物理仿真(SAPIEN)中,GRAFT 实现了 81.25% 的仿真成功率(SR),显著优于基线(例如,使用 DINO 的 ROBO-ABC 为 43.75%)。
- 至关重要的是,GRAFT 实现了 0% 的 AnyGrasp 误差,表明转移的抓取点始终有效,而基线经常无法在目标附近预测出有效的抓取姿态。
数据生成(MimicGen 集成):
- 当用于为未见物体生成训练轨迹时,GRAFT 在 Mujoco 中实现了 63% 的轨迹成功率,而 vanilla MimicGen(缺乏对应性推理)仅为 11%。
真实世界验证:
- 系统在 Franka Panda 机器人上使用真实扫描物体进行了测试。它成功地将抓取从源物体转移到未见的目标(例如,马克杯、公文包)并执行了稳定的提升。
消融实验
作者进行了消融研究以验证各组件的必要性:
- 移除图结构: 导致性能下降最大(SR 降至 0.38),证实了部件级结构关系至关重要。
- 用 CLIP 替换 DINO: 导致 NSS 轻微下降,表明 DINO 的自监督特征能更好地捕捉几何对应关系。
- 移除 BFS 显著性: 降低了性能,强调了基于交互点邻近程度对部件进行加权的重要性。
- 贪婪根节点选择(无 EM): 使用贪婪方法选择目标根节点会导致次优对齐(SR 为 0.77,对比 0.85),证明了 EM 优化对于解决全局结构一致性的必要性。
重要性与主张
本文声称 GRAFT 为机器人操控中的对应性驱动推理建立了稳健的基础。通过从保守的、基于外观的检索转向基于结构的部件对应,该方法实现了:
- 更大的多样性: 检索更广泛的功能相似物体,包括来自不同语义类别的物体。
- 零样本泛化: 成功地将操控技能转移到全新的物体实例,而无需微调。
- 可扩展的数据合成: 为未见物体生成高质量、物理有效的训练数据,这对于训练能在开放世界设置中泛化的策略至关重要。
作者承认了局限性,指出该方法假设物体为刚体(变形物体可能会违反结构假设),且目前主要评估的是拾取与放置任务。然而,他们将 GRAFT 定位为迈向数据高效、开放世界操控的重要一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。