← 最新论文
💻 computer science

CLAW: A Vision-Language-Action Framework for Weight-Aware Robotic Grasping

该论文介绍了 CLAW,这是一个通过使用经过微调的 CLIP 模型来监测刻度读数并为基于流的 VLA 策略生成离散指令,从而将符号化重量推理与动作生成解耦的视觉-语言-动作框架,进而使机器人系统能够可靠地执行超越标准 VLA 模型能力的重量感知抓取任务。

原作者: Zijian An, Ran Yang, Yiming Feng, Lifeng Zhou

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijian An, Ran Yang, Yiming Feng, Lifeng Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人往碗里装大蒜或糖果,直到达到特定的重量,比如 40 克。

问题所在:“靠猜”的机器人
目前的先进机器人(被称为视觉-语言-动作模型)就像是聪明但有点心不在焉的大厨。如果你告诉它们,“往这个碗里装 40 克大蒜”,它们通常能搞清楚如何拿起大蒜。然而,它们很难知道“何时停止”。

为什么呢?因为这些机器人是通过观看人类完成任务的视频来学习的。它们倾向于记忆模式,比如“人类通常会拿起大蒜大约 5 次,然后停止”。它们并没有真正地“阅读”秤。如果大蒜块比平时大或小,机器人可能会过早停止,或者一直装到碗溢出来,因为它只是在根据它看到手部动作的次数进行猜测,而不是根据实际重量。

解决方案:CLAW(“聪明的副厨”)
这篇论文的作者创建了一个名为 CLAW 的新系统。他们意识到,与其试图让主机器人变得全能,不如给它一个专门的助手。

把 CLAW 想象成一个两人团队:

  1. “聪明的副厨” (CLIP): 这是一个轻量级、快速运行的 AI,充当专门训练用来读取数字的眼睛。它的唯一工作就是盯着桌上的电子秤。它不断检查数字,并喊出简单的指令,比如“继续!”或“停!我们达到 40 克了!”
  2. “主厨” (π0): 这是主机器人大脑,负责实际移动手臂。它非常擅长平滑、精准的动作,但由于不擅长阅读数字。它听从副厨的指令。当副厨说“继续”时,主厨就再抓一点;当副厨说“停”时,主厨会立即放下碗。

在现实生活中是如何运作的
团队用大蒜和糖果测试了这一点。

  • 没有 CLAW: 机器人会抓取大蒜,在心里数着“一,二,三……”然后随机停止。有时会接近 40 克,但经常偏差很大(比如 30 克或 50 克)。
  • 有了 CLAW: 机器人抓取大蒜,副厨观察秤,一旦指针达到 40 克,副厨就会大喊“停!”主厨会立即服从。

结果
论文表明,这种团队协作模式的效果远好于机器人独自尝试。

  • 精准度: 在测试中,机器人每次都能准确地在目标重量处停止。
  • 灵活性: 如果你将目标从 20 克改为 40 克,机器人不需要重新训练。你只需告诉副厨去寻找不同的数字,它就会立即调整。
  • 应对突发状况: 在一次测试中,他们不小心掉入了额外的糖果,导致重量瞬间超过了限制。副厨看到了数值激增,大喊“停!”,机器人立即停止抓取并开始移开碗,展示了它应对突然变化的能力。

总结
论文声称,通过将任务拆分——让系统的其中一部分负责“观察数字”,另一部分负责“移动手臂”——机器人可以比以前更好地完成需要精确测量的任务。他们不仅是让机器人变得更聪明,还给了它一个专门处理它所不擅长的数学问题的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →