想象一下,你正在教一个机器人往碗里装大蒜或糖果,直到达到特定的重量,比如 40 克。
问题所在:“靠猜”的机器人
目前的先进机器人(被称为视觉-语言-动作模型)就像是聪明但有点心不在焉的大厨。如果你告诉它们,“往这个碗里装 40 克大蒜”,它们通常能搞清楚如何拿起大蒜。然而,它们很难知道“何时停止”。
为什么呢?因为这些机器人是通过观看人类完成任务的视频来学习的。它们倾向于记忆模式,比如“人类通常会拿起大蒜大约 5 次,然后停止”。它们并没有真正地“阅读”秤。如果大蒜块比平时大或小,机器人可能会过早停止,或者一直装到碗溢出来,因为它只是在根据它看到手部动作的次数进行猜测,而不是根据实际重量。
解决方案:CLAW(“聪明的副厨”)
这篇论文的作者创建了一个名为 CLAW 的新系统。他们意识到,与其试图让主机器人变得全能,不如给它一个专门的助手。
把 CLAW 想象成一个两人团队:
- “聪明的副厨” (CLIP): 这是一个轻量级、快速运行的 AI,充当专门训练用来读取数字的眼睛。它的唯一工作就是盯着桌上的电子秤。它不断检查数字,并喊出简单的指令,比如“继续!”或“停!我们达到 40 克了!”
- “主厨” (π0): 这是主机器人大脑,负责实际移动手臂。它非常擅长平滑、精准的动作,但由于不擅长阅读数字。它听从副厨的指令。当副厨说“继续”时,主厨就再抓一点;当副厨说“停”时,主厨会立即放下碗。
在现实生活中是如何运作的
团队用大蒜和糖果测试了这一点。
- 没有 CLAW: 机器人会抓取大蒜,在心里数着“一,二,三……”然后随机停止。有时会接近 40 克,但经常偏差很大(比如 30 克或 50 克)。
- 有了 CLAW: 机器人抓取大蒜,副厨观察秤,一旦指针达到 40 克,副厨就会大喊“停!”主厨会立即服从。
结果
论文表明,这种团队协作模式的效果远好于机器人独自尝试。
- 精准度: 在测试中,机器人每次都能准确地在目标重量处停止。
- 灵活性: 如果你将目标从 20 克改为 40 克,机器人不需要重新训练。你只需告诉副厨去寻找不同的数字,它就会立即调整。
- 应对突发状况: 在一次测试中,他们不小心掉入了额外的糖果,导致重量瞬间超过了限制。副厨看到了数值激增,大喊“停!”,机器人立即停止抓取并开始移开碗,展示了它应对突然变化的能力。
总结
论文声称,通过将任务拆分——让系统的其中一部分负责“观察数字”,另一部分负责“移动手臂”——机器人可以比以前更好地完成需要精确测量的任务。他们不仅是让机器人变得更聪明,还给了它一个专门处理它所不擅长的数学问题的工具。
技术摘要:CLAW —— 一种面向重量感知抓取的视觉-语言-动作框架
问题陈述
视觉-语言-动作(VLA)模型已成为一种强大的机器人控制范式,能够实现将自然语言指令和视觉观测映射到电机动作的端到端策略。然而,当前的 VLA 架构往往难以满足精确且具有数值约束的任务要求。具体而言,它们缺乏显式的机制来监测传感器反馈(例如数字重量阈值),以决定何时终止动作。由于 VLA 的动作生成是基于训练数据中的统计相关性而非显式的条件监测进行隐式塑造的,这些模型通常无法在达到精确的目标重量时停止,而是依赖于在训练期间观察到的启发式模式(例如抓取尝试的次数)。这种局限性阻碍了 VLA 执行需要严格实时定量控制的任务。
方法论
作者提出了 CLAW(CLIP-Language-Action for Weight),该框架通过将条件评估与动作生成解耦,来解决端到端 VLA 在重量感知操作中的局限性。该系统集成了两个主要组件:
1. 轻量级提示生成器 (CLIP)
CLAW 采用了一个经过微调的 CLIP 模型作为专门的轻量级感知模块。
- 功能: 该模块通过固定摄像头持续监测重量秤的数字读数。
- 机制: 它接收秤的图像和人类任务指令(例如“装 40g 大蒜”)作为输入。根据视觉读数,它输出一个离散的符号化提示:
continue(继续)或 stop(停止)。
- 训练: 作者构建了一个包含 2,000 张秤图像及其合成指令的数据集。CLIP 被微调用于分类当前重量 (w∗) 是低于还是高于目标重量 (k),并将此比较映射到二元提示。这种方法避免了大型生成式 VLM 的延迟,确保了适用于实时控制的高频推理。
2. 视觉运动策略 (π0)
动作生成由 π0 处理,这是一种最先进的基于流(flow-based)的 VLA 策略。
- 功能: π0 接收工作空间的多视图摄像头观测结果以及由 CLIP 模块生成的离散提示。
- 机制: 它将自身的连续动作分布建立在视觉上下文和符号化提示的基础之上。该策略生成高频(高达 50Hz)的电机指令以操纵物体。
- 训练: 作者收集了机器人执行抓取和移除碗的任务演示片段。至关重要的是,在数据收集期间,每一帧都手动标注了相应的
clip_prompt 标签(模拟 CLIP 的输出)。随后,π0 使用基于提示的条件流匹配损失(flow-matching loss)进行微调,从而教会策略根据提供的语言指令来区分“继续抓取”和“停止并移除”阶段。
系统架构
该框架形成了一个闭环:
- 感知: CLIP 分析秤的图像和任务指令。
- 决策: CLIP 生成提示 (mt∈{continue,stop})。
- 动作: π0 将 mt 与多视图观测结合,生成下一个动作块。
这种设计允许系统将符号化推理(重量阈值)与连续的视觉运动控制相结合。
核心贡献
本文概述了四项主要贡献:
- 框架设计: 引入了 CLAW,它通过增加一个轻量级的、任务专用的 VLM 来增强标准的 VLA 架构,从而实现显式的条件监测,进而实现重量感知的操作。
- CLIP 适配: 一种微调程序,将 CLIP 转化为可靠的提示生成器,能够将原始的秤读数转化为 VLA 可理解的语言指令(
continue/stop)。
- 策略集成: 一种使用提示监督的 π0 微调策略,确保策略能有效地将符号化提示与多视图观测相结合,从而产生精确的动作。
- 实证验证: 在三个场景(单物体糖果拾取、单物体大蒜拾取以及混合物体双臂操作)中进行了全面的评估,证明了 CLAW 在遵守重量约束方面优于原始 π0 和经过微调的 π0 基准模型。
实验结果
作者将 CLAW 与两个基准模型进行了对比评估:Raw-π0(未进行任务特定微调的预训练模型)和 Fine-tuned π0(针对特定任务进行了训练但没有 CLIP 提示模块的模型)。
- 成功率: 在单物体任务(拾取 20g、30g 或 40g 的糖果或大蒜)中,CLAW 在动作执行和正确的停止点方面均达到了 100% 的成功率。
- 基准性能:
- Raw-π0 未能在正确的重量处停止(停止点成功率为 0%),且动作成功率较低(15–35%)。
- Fine-tuned π0 实现了 100% 的动作成功率,但无法一致地在目标重量处停止(停止点成功率在 0% 到 35% 之间波动)。作者观察到,该模型依赖于训练中看到的抓取次数,而非实际的秤读数,从而导致了随机的停止行为。
- 鲁棒性: 在混合物体和干扰测试(即在中途增加了额外重量)中,CLAW 成功进行了调整。当秤的读数超过阈值时,CLIP 立即将提示切换为
stop,导致 π0 中止抓取动作并开始移除碗的操作。这展示了系统处理意外输入变化并协调双臂任务的能力。
重要性与主张
论文声称 CLAW 解决了当前 VLA 研究中的一个关键空白:即无法在连续控制任务中强制执行精确的、以数值定义的约束。
- 关注点解耦: 作者认为,通过将条件监测(由轻量级、专门的 VLM 处理)与动作生成(由基于流的 VLA 处理)分离,系统同时实现了灵活性和定量准确性。
- 提示敏感性: 结果强调了 π0 对语言提示的高度敏感性。即使指令几乎完全相同,通过改变目标物体或
continue/stop 指令,模型也能可靠地进行歧义辨析并执行不同的行为。
- 效率: 使用经过微调的 CLIP 模型而非大型生成式 VLM,确保了系统运行频率能够兼容实时机器人控制,避免了与大型模型相关的延迟问题。
作者总结道,虽然 VLA 模型提供了强大的语义落地能力,但它们从提供显式、特定任务约束的外部轻量级模块中获益匪浅。这种方法使机器人能够超越仅仅“完成一个动作”,转而实现对物理参数严格遵循的“完成一项任务”。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。