← 最新论文
💻 computer science

RetrDex: Efficient Object Retrieval in Cluttered Scenes with a Dexterous Hand

RetrDex 是一个高效的框架,它利用大规模并行强化学习和空间感知表示,使灵巧机器人能够通过多样化的操控技能主动清除遮挡,从而在杂乱场景中实现鲁棒的目标检索,并成功零样本迁移至真实世界系统。

原作者: Fengshuo Bai, Yu Li, Jie Chu, Tawei Chou, Runchuan Zhu, Ying Wen, Yaodong Yang, Yuanpei Chen

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Fengshuo Bai, Yu Li, Jie Chu, Tawei Chou, Runchuan Zhu, Ying Wen, Yaodong Yang, Yuanpei Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在寻找你的车钥匙,但它们掉进了一个装满了玩具、书籍和衣物的混乱箱子里。在现实世界中,你不会只是盯着箱子希望看到钥匙;你会伸手进去,在乱堆中翻找,拨开一只袜子,戳一下玩具,甚至可能搅拌一下这堆东西,直到钥匙露出来。

这篇名为 RetrDex 的论文,教导机器人也学会这样做。

问题所在:“凝视并抓取”的陷阱

传统上,机器人的表现就像是那些在没能完美看清物体前不敢触碰任何东西的人。如果机器人看到目标物体被埋在堆积如山的杂物之下,它往往会陷入僵局。它试图抓取最上面的物品却失败了,或者试图像推土机一样直线式地推开物体,这种方式既笨拙又低效。论文指出,这种“先观察,后行动”的方法对于混乱的现实世界情况来说太慢且太僵化了。

解决方案:“翻找大师”

作者创建了一个名为 RetrDex 的系统,它使用了一个灵巧手(一种拥有像人类一样手指的机器人手,而不是简单的两指夹持器)。

以下是他们训练它的方式,使用了巧妙的两步法:

  1. 老师(模拟器大师):
    首先,他们构建了一个虚拟世界(视频游戏模拟器),并在其中将 20 多个随机物体丢进一个箱子里。他们使用强化学习训练了一个“老师”机器人。可以把它想象成一个超级快速的视频游戏,机器人在几秒钟内就能进行数百万次的尝试。

    • 秘诀: 老师拥有“作弊码”(特权信息)。它可以看到每个物体的精确 3D 位置、掉落物体的速度以及杂物的精确形状。
    • 教训: 老师学到的不仅仅是抓取,它学会了搅拌、戳弄和推动杂物。它明白有时你必须挪动一本书才能释放出下面的笔,或者把玩具推到一边以露出隐藏的物品。它将整个堆积物视为一个需要去探索的流体混乱体,而不是一个需要逐层拆解的堆叠物。
  2. 学生(现实世界的工人):
    老师太聪明了,拥有现实中的机器人无法获得的“作弊码”。因此,作者使用了行为克隆技术。他们记录了老师成功的动作,并训练了一个“学生”机器人来模仿这些动作。

    • 学生没有作弊码。它只能看到摄像头看到的画面(2D 图像),并知道自己手臂关节的位置。
    • 学生学习如何将老师复杂的“翻找”策略转化为它在现实世界中可以执行的动作。

实际运作方式

当真实的机器人尝试寻找物体时:

  • 它不只是抓取: 如果目标被埋住了,机器人的手会伸进去开始搅拌这堆东西(就像搅拌一锅汤),或者戳弄特定的物体以使其移动。
  • 它会适应: 如果一个玩具挡住了视线,它可能会把那个玩具推到一边。如果一本书很重,它可能会抬起边缘。
  • 零样本迁移(Zero-Shot Transfer): 最令人印象深刻的部分是,该机器人完全是在计算机模拟中训练的。当他们将其置于现实世界时,它无需任何额外训练即可立即工作。它仅仅通过观察游戏中的“老师”,就学会了如何处理真实的重力、摩擦力和混乱的堆积物。

结果:更快、更聪明

论文在 16 种不同的家用物体(如牛奶盒、肥皂和球)被埋在不同类型的杂物中进行了测试。

  • 成功率: 对于它见过的物体,RetRdex 机器人的成功率约为 91%;对于它从未见过的全新物体,成功率也达到了 86%。
  • 速度: 它比其他方法快得多。其他机器人试图逐一移除物品(就像剥洋葱一样一层层去掉),而 RetRdex 会直接“搅拌”这堆东西,直到目标浮出水面。这节省了大量时间。
  • 手的重要性: 当他们将灵巧手换成简单的两指夹持器时,成功率大幅下降。简单的夹持器无法有效地进行“搅拌”或“戳弄”;它只能推动或抓取,这往往会让混乱的情况变得更糟。

简而言之

RetRdex 是一个学会成为“混乱箱子大师”的机器人。它并没有试图完美计划如何移除目标上方的每一个物体,而是学会了主动探索、戳弄和搅拌杂物,直到目标显露出来。通过在超快速模拟器中训练一个“老师”,并教导一个“学生”去模仿这些动作,他们创造出了一个能够像人类一样熟练地在凌乱房间中寻找丢失物品的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →