Human Universal Grasping
本文介绍了 HUG,这是一种基于包含 100 万帧第一视角人类抓取海量数据集训练的流匹配模型,能够从单张 RGB-D 图像中生成多样化且可重定向的抓取动作,在各种具身智能形态和环境中实现了零样本机器人抓取的先进性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何拿起咖啡杯。通常情况下,工程师必须花费数月时间来为机器人编程,向它展示成千上万个关于那个特定机器人应该如何移动手指的示例。这就像是在教一个孩子系鞋带时,只向他们展示自己的手是如何系鞋带的,然后期望他们能学会用另一双手系鞋带。
这篇名为**“人类通用抓取”(Human Universal Grasping,简称 HUG)**的论文提出了一种更简单、更自然的解决方案:直接观察人类是如何做的。
以下是他们实现这一目标的历程,用通俗易懂的方式进行了解释。
1. 问题所在:机器人是笨拙的学生
机器人在工厂执行重复性任务时表现出色,但在混乱、不可预测的家庭环境中却显得力不从心。如果你给机器人一个形状奇特的物体(比如菠萝或发刷),它往往不知道该如何抓取而不至于将其撞倒。大多数机器人都是通过“模拟”数据(计算机游戏)或由人类手动控制来训练的,这既缓慢又乏味。
2. 解决方案:“智能眼镜”实地考察
研究人员意识到,人类已经是抓取物品的专家了。我们每天都在不假思索地拿起成千上万种物体。与其从零开始教机器人,他们决定模仿人类的剧本。
- 数据收集: 他们给人们配备了一副智能眼镜(称为 Aria Gen 2),这种眼镜看起来像普通的眼镜,但带有摄像头和传感器。
- 任务: 人们戴着这些眼镜,在 41 个不同的建筑(住宅、办公室等)中过着日常活动。他们抓取了 6,707 种不同的物体。
- 结果: 他们创建了一个庞大的库,名为 1M-HUGS。它包含了 100 万张人类抓取物体的图像。这就像是人类抓取的“YouTube”,但带有 3D 深度信息,因此计算机能够准确知道手距离有多远。
3. 大脑:一个“流”模型
有了数据之后,他们需要一种方法来教机器人利用这些数据。他们构建了一个名为 HUG 的模型。
把 HUG 想象成一只变色龙或一个通用翻译官:
- 输入: 你向它展示一张物体的单张照片(带有深度信息),比如台面上的烤面包机。你用鼠标点击烤面包机。
- 处理: 模型会查看它的 100 万个抓取库。它会问:“如果人类看到这个烤面包机,会如何抓取它?”
- 输出: 它不仅仅是说“抓取它”。它会计算出抓取该特定物体所需的精确位置、旋转角度和手指形状。
神奇之处在于,这个模型学习的是人类如何移动,而不是特定机器人的移动方式。它学习的是抓取的概念。
4. 转换:从人手到机器手
这是最巧妙的部分。模型预测抓取时使用的是标准的真人手部形状(称为 MANO)。但机器人的手各不相同——有的有三根手指,有的有四根,有的大,有的小。
研究人员构建了一个重定向系统(retargeting system)。想象你是一名舞者。你学习了一段舞步(人类的抓取动作)。现在,你必须在不同的舞台布局上,或者与一个比你更高的搭档一起表演这段舞步。你不需要学习新的舞蹈;你只需要调整你的步伐以适应你的新搭档。
HUG 可以瞬间完成这一点。它获取它所预测的人类手部姿态,并从数学上将其“重定向”以适应机器人的特定手指。
- 无需重新训练: 你不需要再次教机器人。你只需接入新的机器人,它就能工作。
- 零样本学习(Zero-shot): 这意味着它能处理机器人从未见过的物体,以及它从未去过的房间。
5. 测试:“HUG-BENCH”挑战
为了证明其有效性,他们并没有仅仅测试球或盒子这类简单的东西。他们构建了一个名为 HUG-BENCH 的“期末考试”:
- 他们收集了 90 种棘手的物体:带有手柄的东西、形状怪异的东西、微小的物品以及大型且笨重的物品。
- 他们通过两种方式测试了该系统:
- 在模拟器中: 一个可以快速进行成千上万次测试的计算机世界。
- 在现实世界中: 他们带着一个真实的机器人进入真实的房屋,尝试拿起这 90 种物体。
测试结果:
- HUG 在桌面操作中的成功率为 66.7%,在真实环境(凌乱的房屋)中的成功率为 62%。
- 它以巨大的优势击败了目前的最佳机器人方法(高出 23% 到 34%)。
- 当其他机器人面对像野餐篮或喷雾瓶这样棘手的物品而失败时,HUG 却能搞定它们,因为它之前“见过”人类进行类似的动作。
总结
该论文声称,通过使用智能眼镜收集 100 万个真实的抓取动作,他们创建了一个系统,使机器人能够通过模仿人类的直觉,抓取任何地方的任何物体,并使用任何手部。它弥合了人类灵巧度与机器人笨拙感之间的鸿沟,而无需为每一个新物体单独编写程序。
他们没有声称的内容:
- 他们并未声称这适用于医疗手术或精细的临床任务。
- 他们并未声称机器人可以规划复杂的、多步骤的任务(如制作三明治);它仅解决“我现在如何抓取这一个物体”的具体问题。
- 他们也指出了局限性:该系统目前仅模拟右手抓取,并且在处理极小的物体或完全被遮挡的物体时会遇到困难。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。