RoboHitch: Learning Visual Affordance from Disordered Keypoints for Hitch Knots Tying
RoboHitch 是一个新颖的框架,它通过动态图与带有交叉注意力的卷积自编码器融合无序的 3D 关键点与 RGB 图像,使机器人能够从人类演示中学习系 hitch 结,从而消除了对精确拓扑跟踪的需求并成功处理复杂的自遮挡问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图教机器人把一根绳子打个结。这对机器来说是一项出人意料的艰巨任务。与刚性盒子或杯子不同,绳子是柔软的,它会扭曲,并且经常将自己的一部分遮挡在摄像头视野之外(这被称为“自遮挡”问题)。
以下是RoboHitch的故事,这是一种教机器人打结的新方法,解释得简单明了。
问题:绳子的“丢失顺序”
大多数机器人试图通过将绳子视为一列带有编号车厢的火车来打结。它们需要确切知道绳子的哪一部分是"1 号车厢”,哪部分是"2 号车厢”,以此类推,才能理解形状。
但在现实世界中,当绳子缠绕或交叉时,机器人的摄像头会感到困惑。它会丢失顺序的追踪。这就像当食材散落在地板上且你无法分辨哪个是面粉、哪个是糖时,试图跟随食谱一样。如果机器人丢失了“顺序”,它通常会失败。
解决方案:RoboHitch
RoboHitch 背后的研究人员决定停止强迫机器人保持完美的绳子顺序列表。相反,他们教导机器人同时以两种不同的方式观察绳子,就像一个人同时使用眼睛和触觉一样。
1. “点图”(几何视图)
机器人不再使用编号列表,而是将绳子视为散落的点(关键点)云。它不在乎这些点是否有序;它只看到形状。
- 类比: 想象看着天空中的一群鸟。你不需要知道哪只鸟是#1,哪只是#2,就能理解鸟群正在绕圈移动。你只需看到点的图案。机器人使用一种特殊的“图自编码器”(一种智能数学工具)来理解这种图案,而无需严格的顺序。
2. “照片”(视觉视图)
机器人还会查看场景的标准彩色照片(RGB 图像)。这有助于它看到背景、绳子系着的杆子以及整体环境。
- 类比: 这就像看着一张凌乱房间的照片。你无法看到每个物体的确切三维形状,但你可以看到物体彼此之间的位置关系。
3. “翻译器”(交叉注意力)
这是关键所在。机器人必须结合“点图”和“照片”。
- 问题: 如果你只是把照片和点图粘在一起,它们可能无法对齐。点图可能说“在这里抓取”,但照片却说“那是一堵墙”。
- 解决方法: 研究人员构建了一种“双向交叉注意力”机制。将其想象为一个翻译器,它不断询问照片:“嘿,这个点附近发生了什么?”并询问点图:“嘿,照片的这个部分看起来像什么?”
- 结果: 机器人学会了忽略缠绕绳子的混乱,专注于可供性——这是一个 fancy 的词,意为“这里可能采取什么行动”。它学会了:“我应该抓取这个特定的环,并将其放置到那里。”
它是如何学习的
机器人并非通过试错来学习(那将耗时无穷)。相反,它观看了100 段人类打结的视频。
- 研究人员使用软件追踪人类的大拇指和手指。
- 他们教导机器人:“当人类用手做这个动作时,机器人应该抓取这个点并将其移动到这个位置。”
- 机器人学会了根据绳子混乱、缠绕的状态预测下一步动作,而无需知道绳子的“完美”顺序。
结果
该团队在一台带有夹爪的真实机械臂(UR10)上测试了这种方法。
- 成功率: 机器人成功系好系结(将绳子系在杆子上)的比例达到84%。这优于之前试图完美追踪绳子的方法。
- 局限性: 它在柔软的尼龙绳上表现极佳。然而,当他们尝试使用坚硬的塑料绳(聚丙烯)时,它完全失败了。坚硬的绳子太有弹性;在结固定之前它就弹回去了。这表明机器人非常擅长处理柔软的绳子,但在处理坚硬的绳子时仍会遇到困难。
一句话总结
RoboHitch 是一种机器人,它通过同时观察绳子作为混乱的点云和彩色照片来打结。当绳子缠绕时,它不会感到困惑,而是利用智能“翻译器”来确定在哪里抓取绳子以及将其放置在哪里,并直接通过观察人类进行学习。这是教导机器人处理柔软物体那混乱且不可预测的世界的又一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。