于是,SeededGrasp 出现了,它像是一个由“大脑”和“手”组成的聪明团队。研究人员并没有试图教一个巨大的、超级复杂的机器人大脑同时完成所有事情(这就像是在教一只狗学微积分的同时还要学习捡球),而是将这项工作进行了拆分。首先,他们使用了一个强大的视觉语言模型(VLM)——可以把它想象成一个既能阅读又能观察的超智能 AI——来观察凌乱的场景和指令。这个 AI 并不会尝试计算精确的手指位置;相反,它只是在物体上指向一个单一的“种子点(seed point)”,就像一个数字图钉一样,作为抓取的起始点。这就像人类说“就在那儿抓”并用手指指了一下。
一旦这个“种子点”被植入,第二个轻量级模型就会接管工作。这个模型就像一位精通机械的高级技工,知道如何根据那一个点来精确移动机器人的手指。因为理解语言的重任由第一个 AI 承担,而几何结构的重任由第二个模型承担,它们可以非常高效地协同工作。研究人员在模拟的凌乱房间中,针对三种不同类型的机器人手(标准的双指夹持器、三指夹持器,以及一个具有许多关节的高度灵巧手)进行了测试。他们发现这种“种子点”方法效果极佳,在模拟实验中达到了 72% 的成功率。更令人印象深刻的是,当他们在真实世界中使用真实机器人进行测试时,成功率达到了 78%。
该论文还反驳了一些常见的观点。它指出,试图从头开始训练一个完成所有任务的庞大模型成本太高,且对数据的需求过于巨大。它还表明,仅仅使用 VLM 直接猜测整个抓取姿态往往会导致错误,因为 AI 会被 3D 几何结构所迷惑。相反,“种子点”充当了一个完美的桥梁,让聪明的 AI 处理语言,让专门的模型处理物理特性。为了证明这一点,团队不仅依赖现有数据,还创建了一个全新的、包含 610 个凌乱场景中 256 万个抓取动作的海量数据集来训练他们的系统。虽然研究结果非常令人期待,但作者也指出,这是在模拟环境和特定设置下的实物实验中进行的,目前仍需进一步研究,以确保机器人的手臂能够到达“种子点”所指的每一个位置,而不至于撞到障碍物。但就目前而言,SeededGrasp 展示了一种有趣且有效的方法,通过一点“指点之功”,教会机器人如何倾听、观察并抓取。
技术摘要:SeededGrasp
问题陈述
在复杂、拥挤的场景中进行实际的机器人抓取,需要一个能够进行精确 3D 空间推理,并能遵循自然语言定义的特定任务要求的系统。现有方法面临着显著的局限性: