HannesImitation: Grasping with the Hannes Prosthetic Hand via Imitation Learning
本文介绍了 HannesImitationPolicy,这是一个利用在新建的 HannesImitationDataset 上训练的扩散模型实现的模仿学习框架,旨在使 Hannes 假手能够在非结构化环境中自主抓取物体,并展示了其优于传统视觉伺服控制器的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个机器人手,需要去抓取咖啡杯、螺丝刀或一碗水果。在过去,让这个手正常工作就像是在开一辆只有一个档位的汽车:用户必须手动控制每一个动作,一次只能控制一个关节。如果用户想要同时转动手腕并闭合手指来抓取物体,他们必须费力地思考并协调两个独立的指令。这非常令人疲惫,往往会导致挫败感,并导致许多人放弃使用他们的假肢。
这篇论文介绍了一种新的方法,通过一种叫做**模仿学习(Imitation Learning)**的方法,教导 Hannes 假肢手如何自主抓取物体。这就像教一个孩子骑自行车:你不是给孩子一本关于物理学和平衡的说明书,而是让他们看着你骑车,并通过模仿你的动作来学习。
以下是研究人员如何实现这一目标的步骤,分为简单的几个步骤:
1. “老师”与“学生”
研究人员创建了一个庞大的“课程”库,称为 HannesImitationDataset。他们让一名人类用户佩戴 Hannes 手,练习抓取 15 种不同的物体(如苹果、盒子和工具),并涵盖了三种不同的场景:
- 在桌面上: 从平坦的表面拿起东西。
- 在架子上: 伸手向上抓取物品。
- 手对手: 接收另一个人递过来的物体。
他们记录了 450 次这样的尝试。至关重要的一点是,他们不仅记录了最终的结果,还记录了整个过程——手腕是如何扭转的,手指是如何弯曲的,以及掌心的摄像头在每一时刻看到了什么。
2. “神奇大脑”(扩散策略/Diffusion Policy)
为了将这些课程转化为一项技能,他们使用了一种被称为**扩散策略(Diffusion Policy)**的 AI 类型。
- 类比: 想象你有一张晴朗天空的照片,但有人慢慢向其中加入了雾气,直到你看不清任何东西。一个“扩散”模型就像一位聪明的艺术家,能够观察这张模糊的照片,并完美地推测出原本清晰的天空是什么样子的。
- 在本论文中: AI 从一个关于手部动作的“模糊”猜测开始(随机动作)。然后,它利用数据集中的“课程”,逐步“清理”掉这些雾气,不断精炼这个猜测,直到它能预测出抓取物体所需的完美的腕部扭转和手指闭合序列。
3. “手眼协同”(Eye-in-Hand)
Hannes 手的掌心内置了一个微型摄像头。这充当了手的“眼睛”。用户不再需要盯着自己的手并告诉它“向左转”,摄像头会看到物体,AI 会立即判断:“啊,那是一个杯子,我需要这样扭转手腕并以这种方式闭合手指。”
4. 结果:效果如何?
研究人员在现实世界中测试了这个“学生”手。
- 得分: 在所有场景下,它成功抓取物体的概率约为 79%。
- 对比: 他们将其与一种依赖简单图像识别(类似于只说“左转”的 GPS)的旧方法进行了比较。在混乱、不可预测的情况下(例如接住朋友递来的碗),旧方法表现极差(成功率仅为 16%),而这种新的 AI 方法成功率达到了 86%。
- 惊喜: 即使在测试它从未见过的物体(如香蕉或棒球)时,它仍然能成功抓取约 76% 的情况。它学习的是抓取的“概念”,而不仅仅是针对特定物体的特定动作。
为什么这很重要(根据论文所述)
其主要成就在于自主性。用户不再需要微观管理每一个关节。他们可以专注于自己想要抓取什么,而 AI 则负责处理扭转手腕和闭合手指这些复杂的编排动作。
该论文声称,这是此类假肢手领域首个此类数据集,并证明了通过展示示例(模仿)来教导假肢手,比尝试用僵化的规则或简单的图像检测来编程更为有效。它将一个困难、高压的任务变成了一个感觉更加自然且流畅的过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。