← 最新论文
💻 computer science

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp 是一个数据高效的框架,它通过使用视觉语言模型为轻量级抓取生成器预测种子点,将高层语义推理与底层几何执行解耦,从而在无需昂贵的端到端训练的情况下,实现复杂场景中稳健的多具身抓取。

原作者: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人正试图从凌乱的卧室地板上捡起一个玩具。对人类来说,这很容易:你看到了玩具,知道它的手柄在哪里,然后抓起它。但对于机器人来说,世界是一个由形状和阴影组成的混乱堆叠。它需要同时理解两件截然不同的事情:“大局观”(我的目标是什么?“抓起红色杯子的手柄”)和“微小细节”(我的手指究竟应该触碰哪里,才不会撞倒台灯?)。这就是**机器人抓取(robotic grasping)**的挑战。长期以来,机器人要么非常聪明但笨拙(它们知道要做什么,但搞不清触摸物体的物理特性),要么非常擅长物理学但很“蠢”(它们可以抓取任何东西,但前提是你必须精确地告诉它们位置,而无法理解语言)。科学家们一直试图构建一种能够听懂简单句子——比如“抓住篮子的手柄”——并能在凌乱的房间里,使用不同类型的机器人手,自行找出完美抓取方式的机器人。

于是,SeededGrasp 出现了,它像是一个由“大脑”和“手”组成的聪明团队。研究人员并没有试图教一个巨大的、超级复杂的机器人大脑同时完成所有事情(这就像是在教一只狗学微积分的同时还要学习捡球),而是将这项工作进行了拆分。首先,他们使用了一个强大的视觉语言模型(VLM)——可以把它想象成一个既能阅读又能观察的超智能 AI——来观察凌乱的场景和指令。这个 AI 并不会尝试计算精确的手指位置;相反,它只是在物体上指向一个单一的“种子点(seed point)”,就像一个数字图钉一样,作为抓取的起始点。这就像人类说“就在那儿抓”并用手指指了一下。

一旦这个“种子点”被植入,第二个轻量级模型就会接管工作。这个模型就像一位精通机械的高级技工,知道如何根据那一个点来精确移动机器人的手指。因为理解语言的重任由第一个 AI 承担,而几何结构的重任由第二个模型承担,它们可以非常高效地协同工作。研究人员在模拟的凌乱房间中,针对三种不同类型的机器人手(标准的双指夹持器、三指夹持器,以及一个具有许多关节的高度灵巧手)进行了测试。他们发现这种“种子点”方法效果极佳,在模拟实验中达到了 72% 的成功率。更令人印象深刻的是,当他们在真实世界中使用真实机器人进行测试时,成功率达到了 78%。

该论文还反驳了一些常见的观点。它指出,试图从头开始训练一个完成所有任务的庞大模型成本太高,且对数据的需求过于巨大。它还表明,仅仅使用 VLM 直接猜测整个抓取姿态往往会导致错误,因为 AI 会被 3D 几何结构所迷惑。相反,“种子点”充当了一个完美的桥梁,让聪明的 AI 处理语言,让专门的模型处理物理特性。为了证明这一点,团队不仅依赖现有数据,还创建了一个全新的、包含 610 个凌乱场景中 256 万个抓取动作的海量数据集来训练他们的系统。虽然研究结果非常令人期待,但作者也指出,这是在模拟环境和特定设置下的实物实验中进行的,目前仍需进一步研究,以确保机器人的手臂能够到达“种子点”所指的每一个位置,而不至于撞到障碍物。但就目前而言,SeededGrasp 展示了一种有趣且有效的方法,通过一点“指点之功”,教会机器人如何倾听、观察并抓取。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →