Monocular Vision Based Control Framework for Grasping
本文提出了一种统一的单目视觉控制框架,该框架通过利用开放词汇检测、语言引导的刚度估计以及实时视觉跟踪,使位置控制型机器人夹爪能够在无需触觉传感器的情况下,通过调整抓取策略,在非结构化环境中成功抓取软变形物体和刚性物品。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一个机械臂正试图抓取一个购物袋。里面有一个硬塑料水瓶和一个软塌塌的生菜头。对于人类来说,同时抓取这两者很容易:你可以用力捏紧水瓶,但也要温柔地托住生菜,以免把它变成一滩绿色的烂泥。但对于机器人来说,这一直是个噩梦。通常,机器人需要在手指上安装特殊的“触觉传感器”来感知何时捏得太重,或者需要一种专门针对软物设计的“软手”和一种针对硬物的“硬手”。
但这篇论文提出了另一种方法:一个仅使用一个普通摄像头(就像你手机上的那种)和一个标准的、坚硬的机器人手来同时抓取软塌塌的生菜和硬塑料瓶的机器人。它之所以能做到这一点,是因为它表现得像一个观察力敏锐且精通语言的侦探。
“魔力之眼”与“词汇猜测”
首先,机器人看着物体并问一个简单的问题:“那是什么?”它使用了一种叫做 StiffNET 的语言技巧。你可以把这想象成一个读过百万本食谱的机器人,它仅仅通过描述词汇就知道“生菜”是软的,而“塑料瓶”是硬的。在机器人接触物体之前,这种语言层面的猜测就已经告诉它:“好吧,动作要轻,”或者“好吧,你可以用力捏。”
一旦机器人知道了自己在处理什么,它就会像鹰一样盯着物体看。它不仅仅是看整个画面,还会挑选出物体表面四个微小的、隐形的点,并在机器人移动时追踪这些点。
两种不同的“舞步”
在这里,机器人变得非常聪明。它会根据抓取的东西进行两种完全不同的“舞蹈”:
1. “软塌塌”舞步(针对生菜、奶酪、牛角包)
当机器人抓取柔软的东西时,它会观察那四个点。如果是一个坚硬的瓶子,这些点相对于彼此的位置会保持不变。但如果是一个生菜头,当机器人挤压时,这些点会向中间靠拢或被拉开。机器人会测量这种“挤压程度”(称为差异性/dissimilarity)。
- 类比: 想象你拿着一个压力球。如果你捏得太重,它就会变形。机器人观察形状的变化。如果形状变化得太厉害,机器人就知道:“喔,我捏得太重了!”然后它会放松握力。如果形状变化得不够,它就知道:“我需要再多捏一点才能抓稳。”它会实时调整握紧的宽度,直到形状恰到好处。
2. “缩放”舞步(针对瓶子、硬塑料)
当机器人抓取硬物时,这些点不会发生形变。因此,机器人忽略形状的变化,转而观察距离。随着机器人手臂向上移动去提瓶子,摄像头离物体越来越近。机器人注意到物体在相机视野中变得“变大”了(即缩放因子/scaling factor的变化)。
- 类比: 想象你拿着一块硬石头。你不需要感受它的挤压感,你只需要知道手指收拢到什么程度能让石头不再掉落。机器人观察物体在相机视野中变大的过程。随着物体靠近,机器人会自动收窄手指,直到牢牢抓紧物体。
证据:现实世界测试
作者不仅仅是在电脑屏幕上运行程序;他们制造了一个真实的机器人手臂(Franka Emika Research 3),配备了一个标准的夹持器,并在现实世界中进行了测试。他们尝试了以下物品:
- 软物: 新鲜马苏里拉奶酪、生菜、牛角包和纸巾。
- 硬物: 塑料水瓶。
结果显示,该机器人可以成功抓取并移动所有这些物品,而无需任何特殊的软手指或触觉传感器。对于软物,机器人根据物体的形变来调整握力;对于硬瓶子,它则根据摄像头靠近的程度来调整。
这并不是什么
重要的是要了解这个机器人目前还“不能”做什么。论文明确排除了对昂贵、脆弱的“基于视觉的触觉传感器”(即充当摄像头的特殊指尖)以及试图精确计算所需力量的复杂物理模型的依赖。作者认为,依赖这些设备往往过于昂贵,或者随着时间推移会失效。相反,他们提出,利用普通摄像头观察物体并利用语言来猜测材质就足够了。
他们还指出,这种方法在机器人缓慢且稳定移动时效果最好。如果机器人猛烈地晃动物体,系统可能会产生混乱,因此他们建议添加一个“安全系数”(类似于缓冲区域),以确保机器人在移动较快时不会掉落物体。
简而言之,这篇论文表明,机器人不需要通过“感觉”来了解如何抓取物体。它只需要观察、知道物体的名称,并观察物体是如何移动或改变形状的。这是一种更简单、更廉价的方法,旨在教会机器人如何处理日常生活中那些杂乱、柔软且坚硬的物体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。