Kitchen Robotic Manipulation utilizing Foundation Models
本文提出了一种用于厨房机器人操作的模块化感知流水线,该流水线集成了多个基础模型以实现鲁棒的 6D 位姿估计和抓取规划,在杂乱基准测试中展示了 89.12% 的 ADI,并在物理机器人上成功实现了如餐具转移和杯子堆叠等任务的零样本部署。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图教一个机器人帮你在凌乱的厨房里干活。这听起来很简单,但对于机器而言,厨房简直是混乱的噩梦。不同于工厂里每件工具都放在完全相同的位置,厨房里充满了堆叠的碗碟、被遮挡的物体,以及光滑且闪亮的表面。机器人要拿起一个咖啡杯,首先需要清晰地“看到”它,弄清楚它在3D空间中的确切位置,并知道如何抓取它而不撞倒整叠碗碟。这就是**机器人感知(robotic perception)**的世界:这是一门赋予机器“眼睛”和“大脑”,使其能够理解混乱且多变世界的科学。
为了实现这一目标,科学家们一直在开发基础模型(Foundation Models)。把它们想象成超级聪明的学生,在开始任何具体工作之前,他们已经读过了互联网上几乎所有的书,看过了几乎所有的图片。因为见识广博,他们不需要在进入每个新房间时都从头开始学习;他们可以利用通用的知识,即使从未见过那个特定的杯子,也能识别出这是一个“杯子”。研究人员提出的重大问题是:我们能否将这些强大的、预训练好的“大脑”直接接入机器人的身体,让它能够处理家务,而无需为每一间房子进行数月的定制化训练?
厨房机器人的新“瑞士军刀”大脑
在这篇论文中,一个研究小组构建了一个机器人“感知流水线”,旨在帮助机械臂在杂乱的厨房水槽中导航并移动餐具。他们并没有构建一个只能针对特定厨房工作的庞大且僵化的脑部系统,而是创建了一个模块化系统。想象一下一部高端相机,你可以根据拍摄内容更换镜头、传感器和处理器。这个机器人系统也是如此:它允许研究人员通过混合搭配不同的“基础模型”,来观察哪种组合最擅长寻找和抓取餐具。
机器人的任务是观察装满盘子、杯子和碗的水槽,确定每个物品的确切位置(其 6D 位姿,即它在 3D 空间中的位置和角度),然后规划一条安全的抓取路径。该团队在一个包含 20 个真实厨房场景(包含杂乱堆叠和隐藏物体)的定制数据集上测试了该系统。
成功的配方
研究人员并非凭空猜测使用哪些模型,而是系统地测试了 24 种不同的视觉与几何模型组合。他们将该系统视为一种食谱,通过更换“食材”来寻找完美的“风味”。
- 眼睛(视觉模型): 这些模型通过观察 2D 图片来识别那里有哪些物体。
- 双手(几何模型): 这些模型通过观察物体的 3D 形状来理解其结构。
- 粘合剂(特征融合): 他们发现,仅仅使用“眼睛”或“双手”是不够的。秘诀在于将 2D 图像特征与 3D 点云特征进行融合。这就像是一个侦探,不仅能通过照片认出一张脸,还能理解人体形状,从而知道该如何握手。
在运行数据后,团队发现了一个“冠军”配置:LLMDet(用于发现物体)、SAMv2(用于将物体从背景中分割出来)、DINOv2(用于识别精细细节)以及 GeoTransformer(用于理解 3D 几何结构)。当这四者协同工作时,机器人达到了 89.12% 的 ADI(不可分辨视图平均距离)。用通俗的话说,这意味着即使在物体部分被遮挡或处于杂乱环境时,机器人也能极其准确地估计餐盘的位置和角度。
现实世界的证明
最棒的部分在于,他们并没有止步于计算机模拟。他们将这个“冠军”配置安装在一个真实厨房里的物理机械臂上。他们观察到机器人成功完成了以下任务:
- 将餐具从水槽转移到洗碗机中。
- 在柜台上堆叠杯子。
- 从杂乱的水槽中拿起物品。
机器人完成这一切时,无需针对特定厨房进行任何重新训练。它不需要学习在那个特定房子里“杯子”长什么样;它只是利用了其预训练的基础知识。在一系列现实世界测试中,机器人的成功率达到了 87.5%(296 次尝试中成功 259 次)。
它的短板
论文也坦诚地说明了该系统目前并不完美的地方。失败的主要原因不是机器人的“大脑”看不见物体,而是机器人的“手”打滑了。机器人使用一种顺应性夹持器(一种柔软且具有适应性的手)来温柔地抓取物品,但有时物体在运输过程中会滑落,尤其是在拥挤的水槽中堆叠杯子时。机器人偶尔也会因为检测略有偏差而尝试抓取错误的位置。然而,作者指出,这些是夹持器带来的物理挑战,而非感知系统的失效。
这为何重要
这项工作表明,我们不需要为每一间房子都构建一个新的、定制的机器人大脑。相反,我们可以使用一个灵活的模块化系统,通过更换最合适的“基础模型”来完成任务。它证明了通过结合正确的视觉智能与几何智能的混合体,机器人可以适应人类家庭中混乱且不可预测的现实情况,而无需老师手把手教它们完成每一项任务。虽然在增强机器人抓取力度和使动作更平滑方面仍有改进空间,但这一流水线为实现能够真正帮我们洗碗的机器人提供了一条实用且可扩展的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。