想象一下,你正在教一个机械手去抓取咖啡杯、泰迪熊或形状奇特的瓶子。长期以来,机器人一直难以胜任这项任务,因为它们的“大脑”试图解决一个过于复杂的数学问题。它们试图同时计算每一个手指关节的精确角度以及手腕在三维空间中的精确位置,同时还要担心不要压碎物体。这就像是在开车的同时,还要同时解一道复杂的微积分方程并平衡一叠盘子。
这篇论文介绍了 KPGrasp,一种教机器人如何抓取物品的新方法。KPGarp 不再让机器人进行繁重的数学运算,而是通过一种更简单、更直观的方式,教会它如何“看见”手的形状。
以下是它的工作原理,分为几个简单的概念:
1. 旧的方法:“混乱不堪”的说明书
以前,当机器人需要抓取某样东西时,它会得到一份混乱的说明书。它必须同时搞清楚两件不同的事情:
- 手腕: 手在空间中的什么位置?(这很棘手,因为旋转在数学上是非常“奇怪”且“不平滑”的)
- 手指: 每个手指应该弯曲多少?
这就像是通过指令来烤蛋糕,指令是:“将烤箱顺时针旋转 45 度,然后加入 2.5 杯面粉,再将烤箱逆时针旋转 10 度。”这些指令使用的是不同的“语言”(旋转 vs 直线),这使得机器人很难学习其中的规律。如果机器人在手腕旋转上出了微小的差错,整个手就会落在错误的位置,手指也可能撞到物体。
2. 新的方法:“连点成线”的画作
KPGrasp 改变了游戏规则。它不再给机器人复杂的旋转角度,而是告诉机器人只需在三维空间中放置一些点。
想象你有一张手的图片。与其描述关节的角度,你只需要在大拇指尖放一个点,在小拇指尖放一个点,并在手掌上放几个点。
- 神奇之处: 这些点存在于普通的、直线型的空间(欧几里得空间)中。对于计算机来说,学习如何移动点,要比学习如何旋转手腕容易得多。
- 结果: 机器人学会了将这些点精准地放置在需要的位置,从而完美地“拥抱”物体。一旦点位确定,一个简单的“翻译器”(称为逆运动学,Inverse Kinematics)会立即算出手指需要什么样的角度来匹配这些点。
3. “流”模型(Flow Model):向海量图书馆学习
机器人如何学习在哪里放置这些点?
- 旧的方法: 研究人员必须编写严格的规则(例如“不要碰得太重”或“不要让手指穿过物体”)。如果规则太严,机器人就会僵住;如果规则太松,机器人就会压碎物体。这就像是在不断地“调节旋钮”。
- KPGrasp 的方法: 研究人员向机器人喂养了一个包含 950 万个成功抓取动作的海量库。他们使用了一种叫做**流匹配(Flow Matching)**的技术。
- 类比: 想象一条河流,从一片混沌的海洋(随机噪声)流向一个平静、有序的湖泊(完美的抓取)。机器人学习的是这条河流的“水流方向”。它从一个随机的猜测开始,顺着水流一直走到一个完美的抓取位置。
- 因为它从如此多的例子中学习,所以它不需要严格的规则或“调节旋钮”。它仅仅通过观察了数百万次成功的抓取,就自然而然地知道一个好的抓取看起来是什么样的。
4. 结果:快速、准确、真实
论文测试了这种新方法与现有最强机器人的对比:
- 成功率: 在一项名为“Dexonomy”的高难度测试中,KPGrasp 的成功率为 76.3%。而排名第二的机器人成功率仅为 29% 左右。这是一个巨大的飞跃。
- 不压碎物体: 机器人几乎没有触碰到物体(穿透深度仅为 2.4 毫米),这意味着它不会压碎或挤压东西。
- 速度: 它非常快。它可以在 0.032 秒内生成一个抓取动作。那些试图在生成抓取后“修复”错误的旧方法则需要大约 2.8 秒。KPGrasp 大约快了 87 倍。
- 现实世界: 他们在带有真实摄像头的真实机械臂上进行了测试。即使摄像头只能看到物体的单侧(而不是完美的 3D 扫描),机器人仍然取得了 83% 的成功率。
总结
KPGrasp 就像是通过向机器人展示一百万张成功抓取的图片,并要求它在手上“连点成线”,而不是强迫它去解复杂的几何方程。通过简化机器人使用的语言(使用点而非角度)并为其提供大量的优质示例,机器人能够快速且温柔地抓取几乎任何东西,而无需人类不断去微调它的设置。
技术摘要:KPGrasp:用于灵巧抓取生成的可扩展关键点流匹配技术
问题陈述
生成高质量的灵巧抓取对于基于学习的方法仍然是一个重大挑战。传统方法通常依赖于精心调优的接触损失、基于物理的目标函数或成本高昂的基于接触的测试时优化,以确保抓取的稳定性。这些组件继承了解析方法的缺点,包括脆弱的参数调优、缓慢的推理以及可能生成具有较大穿透深度或稳定性较差的抓取的风险。此外,现有的基于学习的方法经常在训练或推理流水线中重新引入显式的物理先验(例如接触惩罚、判别器),这引发了一个问题:大规模、高质量的数据是否可以在没有这些手工设计的情况下,隐式地提供足够的抓取先验。
此外,标准的灵巧抓取输出参数化——即非欧几里得 SE(3) 手腕位姿与欧几里得关节角度的混合元组——为可扩展的生成建模带来了挑战。这种“位姿-关节”表示法引入了流形不连续性(特别是 SO(3) 中),会导致沿运动链的运动学误差累积,并且需要在混合输出空间之间进行复杂的损失平衡。
方法论
作者提出了 KPGrasp,这是一个流匹配框架,它直接从大规模离线合成数据中学习灵巧抓取先验,消除了对显式接触损失或测试时优化的需求。该方法建立在两个核心创新之上:
1. 全欧几里得 3D 手部关键点参数化
KPGrasp 不再预测手腕位姿和关节角度,而是直接预测一组 3D 手部关键点(K∈RJ×3),其坐标系与输入的物体点云一致。
- 定义: 对于 Shadow Hand,定义了 J=21 个关键点,位于机械关节、指尖以及刚性手掌上的五个点(中心及四个手指根部)。
- 优势: 这种表示法使手部输出完全处于欧几里得空间中,自然地与物体点云对齐,并能够实现原生的空间推理。它避免了 SO(3) 的不连续性,并允许网络在手物交互过程中对空间接近度进行推理。
- 转换: 在训练期间,标签是通过将标准位姿-关节抓取应用正向运动学(Forward Kinematics)得到的。在推理期间,预测的关键点被转换回可执行的机器人指令:手掌关键点通过基于 SVD 的刚体配准确定手腕位姿(R,t),并通过标准的逆运动学(IK)求解器恢复关节角度(θ)。这一 IK 步骤将关键点投影到运动学流形上,而无需针对接触或穿透进行优化。
2. 可扩展 Transformer 流模型
KPGrasp 采用条件 Transformer 流模型来学习抓取分布。
- 架构: 该模型使用扩散 Transformer (DiT) 骨干网络。输入物体点云由 MinkUNet 处理以生成几何 Token。带噪声的手部关键点作为 Token 被嵌入。网络在关键点自注意力(建模手部结构)和物体条件交叉注意力(将手部几何与物体表面对齐)之间交替进行。
- 训练目标: 模型仅使用标准的流匹配 (Flow Matching, FM) 损失进行训练,该损失最小化预测速度场与数据路径的条件速度之间的距离。没有使用任何辅助接触损失、判别器或基于物理的惩罚。
- 推理: 通过求解学习到的常微分方程 (ODE)(使用欧拉积分)来进行采样。为了选择高质量的抓取,模型利用连续归一化流 (CNF) 的可解似然度(通过 Hutchinson trace estimator 进行估计)对候选方案进行排序,而无需外部评估器。
核心贡献
- KPGrasp 框架: 一种灵巧抓取生成器,直接从大规模数据中学习先验,无需接触损失或基于接触的测试时优化。
- 关键点参数化: 引入了全欧几里得 3D 手部关键点输出空间,取代了传统的混合 SE(3) 位姿和关节角度表示,以促进可扩展的生成学习。
- 可扩展流模型: 一个基于 Transformer 的流模型,展示了在标准流匹配目标下,其性能随数据集大小、模型容量和批次大小的可扩展性。
- 实证验证: 在仿真基准测试中展示了最先进的 (SOTA) 性能,并在现实世界实验中成功部署。
实验结果
仿真基准测试
- Dexonomy 基准: KPGrasp 实现了 76.3% 的抓取成功率 (GSR),相比于最强的直接可比基线(不带分类器的 Dexonomy)提升了 47.4 个百分点。它还超过了带有分类器的 Dexonomy 版本 (63.9% GSR),且无需额外的生成训练数据。至关重要的是,它将平均穿透深度降低至 2.4 mm,并实现了 97.3% 的物体成功率 (OSR)。
- DexGrasp Anything 基准: 在无需微调的情况下,在 Dexonomy 上训练的模型在五个不同的物体集上实现了最佳平均成功率 (63.8%) 和最低平均穿透深度 (12.9 mm),展示了强大的泛化能力。
消融研究
- 参数化: 关键点参数化显著优于位姿-关节变体(包括欧几里得和 SE(3) 流),证实了欧几里得表示在该任务中更具优越性。
- Token 化: 性能增益归功于关键点表示的多 Token 推理能力;即使增加 Token 数量,位姿-关节输出也未能获得这一收益。
- 似然度排序: 使用流似然度对候选方案进行排序使 GSR 从 67.0% 提高到 76.3%,验证了似然度得分是一种有效的选择指标。
- 扩展性: 性能随着数据集大小、模型容量(DiT 块的数量)和批次大小的增加而持续提升。
效率与现实世界部署
- 推理速度: KPGrasp 在批量推理期间(包括采样、排序和 IK)每个抓取仅需 0.032 秒,比 DexGrasp Anything (2.8s) 快约 87 倍,每 GPU 的吞吐量约为每秒 24 个有效抓取。
- 现实世界实验: 在 Galbot 平台上,使用 Shadow Hand 和单视图点云设置,在 20 种不同物体上进行了测试。该流水线在无需微调核心架构的情况下实现了 83% 的成功率(100 次试验中 83 次成功),尽管注意到其对微小的物体位姿扰动较为敏感。
重要性与主张
论文声称 KPGrasp 证明了大规模、高质量的数据可以隐式地提供足够的抓取先验,从而使显式的基于物理的目标和测试时优化变得不再必要。通过转向全欧几里得关键点参数化,作者表明,灵巧抓取生成可以被构建为一个干净的欧几里得学习问题,与可扩展的 Transformer 架构相兼容。结果表明,这种方法不仅在成功率和穿透深度方面实现了更优的性能,而且与依赖复杂损失调优或迭代优化的先前方法相比,在推理速度和可扩展性方面也具有显著优势。作者将 KPGrasp 定位为迈向高效、数据驱动的灵巧操作的重要一步,旨在避免解析方法的脆弱性和物理引导推理的计算开销。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。