想象一下,你正在寻找你的车钥匙,但它们掉进了一个装满了玩具、书籍和衣物的混乱箱子里。在现实世界中,你不会只是盯着箱子希望看到钥匙;你会伸手进去,在乱堆中翻找,拨开一只袜子,戳一下玩具,甚至可能搅拌一下这堆东西,直到钥匙露出来。
这篇名为 RetrDex 的论文,教导机器人也学会这样做。
问题所在:“凝视并抓取”的陷阱
传统上,机器人的表现就像是那些在没能完美看清物体前不敢触碰任何东西的人。如果机器人看到目标物体被埋在堆积如山的杂物之下,它往往会陷入僵局。它试图抓取最上面的物品却失败了,或者试图像推土机一样直线式地推开物体,这种方式既笨拙又低效。论文指出,这种“先观察,后行动”的方法对于混乱的现实世界情况来说太慢且太僵化了。
解决方案:“翻找大师”
作者创建了一个名为 RetrDex 的系统,它使用了一个灵巧手(一种拥有像人类一样手指的机器人手,而不是简单的两指夹持器)。
以下是他们训练它的方式,使用了巧妙的两步法:
老师(模拟器大师):
首先,他们构建了一个虚拟世界(视频游戏模拟器),并在其中将 20 多个随机物体丢进一个箱子里。他们使用强化学习训练了一个“老师”机器人。可以把它想象成一个超级快速的视频游戏,机器人在几秒钟内就能进行数百万次的尝试。
- 秘诀: 老师拥有“作弊码”(特权信息)。它可以看到每个物体的精确 3D 位置、掉落物体的速度以及杂物的精确形状。
- 教训: 老师学到的不仅仅是抓取,它学会了搅拌、戳弄和推动杂物。它明白有时你必须挪动一本书才能释放出下面的笔,或者把玩具推到一边以露出隐藏的物品。它将整个堆积物视为一个需要去探索的流体混乱体,而不是一个需要逐层拆解的堆叠物。
学生(现实世界的工人):
老师太聪明了,拥有现实中的机器人无法获得的“作弊码”。因此,作者使用了行为克隆技术。他们记录了老师成功的动作,并训练了一个“学生”机器人来模仿这些动作。
- 学生没有作弊码。它只能看到摄像头看到的画面(2D 图像),并知道自己手臂关节的位置。
- 学生学习如何将老师复杂的“翻找”策略转化为它在现实世界中可以执行的动作。
实际运作方式
当真实的机器人尝试寻找物体时:
- 它不只是抓取: 如果目标被埋住了,机器人的手会伸进去开始搅拌这堆东西(就像搅拌一锅汤),或者戳弄特定的物体以使其移动。
- 它会适应: 如果一个玩具挡住了视线,它可能会把那个玩具推到一边。如果一本书很重,它可能会抬起边缘。
- 零样本迁移(Zero-Shot Transfer): 最令人印象深刻的部分是,该机器人完全是在计算机模拟中训练的。当他们将其置于现实世界时,它无需任何额外训练即可立即工作。它仅仅通过观察游戏中的“老师”,就学会了如何处理真实的重力、摩擦力和混乱的堆积物。
结果:更快、更聪明
论文在 16 种不同的家用物体(如牛奶盒、肥皂和球)被埋在不同类型的杂物中进行了测试。
- 成功率: 对于它见过的物体,RetRdex 机器人的成功率约为 91%;对于它从未见过的全新物体,成功率也达到了 86%。
- 速度: 它比其他方法快得多。其他机器人试图逐一移除物品(就像剥洋葱一样一层层去掉),而 RetRdex 会直接“搅拌”这堆东西,直到目标浮出水面。这节省了大量时间。
- 手的重要性: 当他们将灵巧手换成简单的两指夹持器时,成功率大幅下降。简单的夹持器无法有效地进行“搅拌”或“戳弄”;它只能推动或抓取,这往往会让混乱的情况变得更糟。
简而言之
RetRdex 是一个学会成为“混乱箱子大师”的机器人。它并没有试图完美计划如何移除目标上方的每一个物体,而是学会了主动探索、戳弄和搅拌杂物,直到目标显露出来。通过在超快速模拟器中训练一个“老师”,并教导一个“学生”去模仿这些动作,他们创造出了一个能够像人类一样熟练地在凌乱房间中寻找丢失物品的机器人。
技术摘要:RetrDex —— 利用灵巧手实现杂乱场景中的高效物体检索
问题陈述
从掩埋在杂乱物体下的物体中进行检索,是具身智能领域的一个基本挑战,尤其是在家庭等非结构化环境中。核心难点在于复杂的支撑关系和遮挡问题,这使得机器人仅通过被动视觉无法获得精确的位姿或可行的抓取点。现有方法通常依赖于“感知-规划-行动”范式,将物理交互(如推挤)视为抓取之前的孤立、顺序的准备步骤。这些方法往往无法将场景探索与目标检索建模为一个连续且深度耦合的过程。此外,标准的平行夹爪仅限于线性清扫动作,而即使是灵巧手的方法,也往往侧重于离散的“交互-抓取”组合,而非学习一个连续的操控技能谱系。
方法论
作者提出了 RetrDex,这是一个旨在使灵巧臂手系统能够学习高效物体检索策略的框架,该策略能够从仿真环境零样本迁移至现实世界。该方法由四个关键部分组成:
1. 任务构建与环境
系统利用 IsaacGym 生成多样且真实的杂乱场景。在每个回合(episode)中,20 多个不同质量、大小和形状的家用物体被丢入一个箱子,目标物体被放置在底部。为了确保训练稳定性,机器人手会在“准备姿态”(位于箱子上方)和“悬挂姿态”(远离箱子)之间交替,以避免在初始化期间干扰物体物理特性,并定期在无遮挡的情况下计算基于像素的奖励。
2. 空间感知表示(教师策略)
学习框架的核心是 教师-学生(Teacher-Student) 架构。
- 空间表示: 一个图神经网络(GNN)模块学习一种空间感知表示(ht∗),该表示编码了目标、灵巧手以及周围杂乱物体之间的遮挡模式和空间关系。该图包含目标、手以及 K 个最近邻物体。节点使用针对采样点云的 PointNet++ 进行编码,并通过 EdgeConv 层传播特征以建模上下文。
- 教师训练: 教师策略在 512 个并行环境中通过 近端策略优化(PPO) 进行训练。它接收特权信息,包括 GNN 表示、指尖的全运动学状态以及物体速度。
- 奖励设计: 奖励函数通过五个组件鼓励主动暴露目标:
- 距离奖励 (rdist): 鼓励接近遮挡区域。
- 搅拌奖励 (rstir): 促进周围物体的位移,以清除深层遮挡。
- 邻近清理奖励 (rclean): 专注于清除紧邻目标的物体。
- 像素可见性奖励 (rpixel): 奖励自顶向下分割掩码中可见的目标像素数量。
- 惩罚项: 包括动作、接触和目标位移惩罚。
- 塑造(Shaping): 使用基于势能的奖励塑造框架来加速训练并减少奖励作弊(reward hacking)。
3. 学生策略与仿真-现实迁移
为了在真实硬件上部署,通过 行为克隆(BC) 从教师那里蒸馏出 学生策略。
- 输入: 学生仅观察本体感受数据(机械臂关节位置)和视觉数据(来自顶视相机的目标像素坐标),并通过一个处理 15 个时间步历史记录的 Transformer 网络进行处理。
- 蒸馏: 教师在仿真中生成高质量轨迹。经过筛选的成功轨迹(即手指避开箱底且目标分布均匀的轨迹)被用于训练学生。这种方法使学生能够学习复杂的时序依赖性和操控技能(推、搅拌、戳刺),而无需教师所拥有的特权空间信息。
核心贡献
- 统一的连续框架: RetrDex 不将物体检索视为离散步骤(先推后抓)的序列,而是一个连续且耦合的过程,其中机器人主动探索并操控杂乱物体以暴露目标。
- 空间感知图表示: 引入基于 GNN 的表示,显式编码遮挡和空间关系,使策略能够推理复杂的杂乱结构并开发多样化的操控策略。
- 零样本仿真-现实迁移: 该框架成功地将仿真中训练的策略无缝迁移到真实的灵巧多指机器人(安装在 Realman RM-75 机械臂上的 Inspire Hand)上,无需微调,展示了对未知物体和杂乱配置的鲁棒性。
- 技能发现: 系统自主发现了有效的技能,如搅拌、戳刺和重新定向,这些技能难以通过手动编码或使用标准夹爪来学习。
实验结果
作者在 16 种家用物体上评估了 RetrDex 在不同杂乱配置下的表现,并将其与包括基于视觉的运动规划(VMP)、顺序抓取-拾取以及使用 SAC 或平行夹爪的变体在内的基准方法进行了比较。
- 成功率与效率: Retr Dex 在已知物体上的检索成功率(RSR)达到 91.4%,在未见过的微小物体上达到 86.2%,显著优于基准方法。与 VMP 相比,它平均减少了 38% 的检索步骤;与 Grasp-Pick 相比,减少了 90%。
- 泛化能力: 该方法对未见过的物体形状(小型和大型)以及增加的杂乱密度(L2 和 L3 设置)表现出强大的泛化能力,而顺序移除方法的性能随着杂乱复杂度的增加而大幅下降。
- 现实世界表现: 在现实实验中,RetrDex 在多种物体类型(长方体、圆柱体、球体)和位置下均取得了较高的成功率。与 VMP 相比,它减少了 51.2% 的检索时间;与顺序抓取并移除的方法相比,减少了 61.9% 的时间。
- 消融研究:
- 去除 GNN 模块或“搅拌”奖励会显著降低性能,特别是在面对大尺寸物体和深层遮挡时。
- 灵巧手变体大幅优于平行夹爪变体,证实了精细操控技能(戳刺、搅拌)相对于线性推挤的优势。
重要性与主张
本文声称 RetrDex 解决了当前机器人操控中的一个根本局限:过度依赖被动观察和离散的顺序决策。通过利用多指手的灵巧性以及大规模强化学习,该框架使机器人能够自主发现解决遮挡的高效策略。
作者强调,灵巧手的真正优势在于其能够学习广泛的交互行为,这些行为超越了离散的预抓取动作。成功的零样本迁移验证了在仿真中学习复杂的、富接触(contact-rich)的操控技能,并将其部署到现实世界非结构化环境中的实际应用价值。这项工作表明,将遮挡消除视为一个连续且耦合的过程,比将其视为一个辅助步骤是一种更有效的范式。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。