想象一下,你正在教一个机器人如何拿起一个杯子。你向它展示一段来自机器人自己“眼睛”(安装在手腕上的摄像头)的视频。问题在于,在这段视频中,机器人自己的手(抓取器)占据了屏幕的巨大比例。
如果你用一种特定的手(比如一个简单的双指夹持器)来训练机器人,它会学会识别这种特定的形状。如果随后你把这个机器人的手更换成一个完全不同的手(比如一个拥有五根手指的人类形态手掌),机器人就会感到困惑。这就像是你通过只看福特的方向盘来教一个人开车,如果突然把他换到一辆特斯拉里,面对一个不同的方向盘,他可能会惊慌失措,因为他大脑中的“视觉地图”与他所看到的内容不匹配。
问题:“手”造成的干扰
在机器人领域,收集数据既昂贵又缓慢。我们拥有大量的关于使用双指夹持器完成任务的机器人数据库。但机器人的未来正朝着复杂的多指手掌发展。我们希望利用旧数据来教这些新的手,但旧机器人的手看起来与新的一点也不像。机器人的大脑过于关注自己手指的具体形状,以至于无法理解任务本身。
解决方案:“Cloak”(斗篷)
论文介绍了一个巧妙的技巧,叫做 Cloak。你可以把它想象成机器视觉中的数字“眼罩”或“口罩”。
- 隐藏手部: 与其让机器人看到摄像头画面中的手,不如用一个掩码(mask)将手部进行数字涂抹。这就像是在摄像镜头的特定部分贴上一块胶带,遮住手部。
- 学习场景,而非学习手部: 通过隐藏手部,机器人被迫去观察外部世界——桌面、杯子以及障碍物。它学习的是任务的逻辑(例如,“向前移动直到碰到杯子”),而不是被自己手指的具体形状所分心。
- “变色龙”式训练: 为了确保机器人不仅仅是学会了忽略某种特定形状的胶带,研究人员在训练过程中随机改变了“眼罩”的形状。有时掩码很大,有时很小,有时形状很奇怪。这教会了机器人:“我的手明天可能会长得不一样,所以我不应该依赖于看到它。”
在现实生活中是如何运作的
当机器人实际执行任务时:
- 眼睛: 摄像头画面中仍然存在手部,但软件会在机器人大脑看到图像之前,立即用数字掩码覆盖掉手部。
- 大脑: 机器人的大脑(一个视觉-语言-动作模型)看到了被遮挡的图像和文本指令,如“拿起杯子”。它根据环境计算出运动轨迹。
- 身体: 一旦大脑决定“将我的指尖移动到这个位置”,一个转换器(称为末端姿态重定向,tip-pose retargeting)会将这一指令转换为新手所需的特定肌肉运动。如果新手有五根手指,系统会计算如何移动这五根手指来匹配原有的双指方案。
实验结果
研究人员通过在简单的双指夹持器上进行训练,然后尝试将训练好的大脑应用到三个它从未见过的完全不同的机器人身上:
- 一个不同的双指夹持器(颜色和形状不同)。
2.一个完全不同的机器人手臂。
- 一个复杂的、具有五根手指的人类形态手掌。
结果如下:
- 没有使用 Cloak: 机器人在面对新手时表现糟糕。因为它感到困惑,因为视觉“地图”不再匹配。
- 使用了 Cloak: 机器人在新手上的表现几乎与在原始机器人上的表现一样出色。它成功实现了零样本迁移(zero-shot transfer),这意味着它不需要针对新手的任何新训练数据。
核心启示
Cloak 证明了你可以将机器人的“大脑”(完成任务的技能)与“身体”(特定的硬件)分离。通过在学习过程中将身体从机器人的视野中隐藏起来,在一种机器人上收集的数据可以在未来被重新用于完全不同的机器人。这就像是通过戴着眼罩学习游泳,从而让你专注于水的律动而非自己的肢体;一旦你掌握了水的节奏,无论使用什么样的脚蹼,你都能游得很好。
局限性
论文指出,这种方法最适用于可以通过放置两个点(如两个指尖)接触物体的任务。它目前还无法解决需要精细手内操纵(in-hand manipulation)的复杂任务(例如在手掌内玩转球),因为这类任务高度依赖于手指的具体触感和形状。
技术摘要:Cloak:通过从 VLA 中屏蔽末端执行器实现零样本跨具身操控
1. 问题陈述
目前的机器人操控研究分散在各种不同的末端执行器中,从简单的平行夹爪到复杂的类人多指手。虽然在特定“源”具身上训练的视觉-语言-动作(VLA)模型能在这些特定机器人上表现出色,但当部署在具有不同形态的“目标”具身时,其能力会显著下降。
零样本跨具身迁移的主要障碍是视觉差距。在带有腕部摄像头的标准设置中,末端执行器占据了视觉场中一个巨大且一致的区域。在源机器人(例如平行夹爪)上训练的策略会学习高度依赖于该特定末端执行器外观的特征。当部署在具有不同外观的目标机器人(例如五指手)上时,视觉观测会发生分布外偏移,导致性能崩溃。现有的解决方案通常依赖于为每个目标收集新数据,或者使用生成模型来“重绘”图像中的机器人,但这会引入延迟、幻觉风险和计算开销。
2. 方法论:Cloak 配方
作者提出了 Cloak,这是一种训练配方,通过在训练期间显式地从腕部相机视图中屏蔽(Masking)末端执行器,使 VLA 能够泛化到未见的具身。这迫使模型依赖场景上下文和语言指令,而不是依赖源机器人的特定几何形状。
核心组件
几何屏蔽(训练与推理):
- Cloak 并非使用学习到的分割或生成式修复,而是利用机器人已知的运动学(正向运动学)、连杆网格和相机内参,实时渲染出末端执行器的几何掩码(Geometric Mask)。
- 该掩码被投影到腕部相机图像上,识别出被机器人自身躯体占据的像素。
- 掩码注意力(Masked Attention): 掩码被下采样到视觉编码器的 Patch 网格(例如 ViT patches)。在视觉编码器的注意力计算过程中,落在掩码内的 Patch 会被分配一个 −∞ 的注意力偏置。这有效地从策略的感知中移除了末端执行器的视觉信息,同时保持序列长度不变。
掩码增强(仅限训练):
- 为了防止模型过拟于源夹爪的具体轮廓,作者在训练期间对掩码进行了增强。
- 增强过程包括在掩码轮廓处随机添加“胶囊(Capsules)”,并在其内部减去“圆盘(Disks)”。
- 为了填补图像中产生的空洞(否则会暴露源机器人),作者使用了一种简单的非生成式修复策略:将同一图像的副本滚动到被遮蔽的区域。这确保了像素分布保持真实,而不会产生幻觉内容。
末端姿态重定向(运动学桥接):
- 虽然通过屏蔽解决了视觉差距,但通过**正向运动学(FK)和逆向运动学(IK)**来解决运动学差距(不同的关节空间)。
- 输入重定向: 将目标机器人的状态转换为源机器人的关节空间,方法是计算目标指定“末端”(例如指尖或夹爪)的 FK,然后求解出与这些末端姿态匹配的源机器人关节配置。
- 输出重定向: VLA 在源机器人的关节空间内输出动作。这些动作通过计算源机器人末端的 FK,然后求解目标机器人的 IK 以实现相同的末端姿态来进行转换。
- 对于夹爪信号,使用在预定义的开/合状态之间的线性插值来实现目标手的动作。
3. 主要贡献
- Cloak-VLA: 一个在单一平行夹爪数据集(DROID)上训练的 VLA 策略,能够零样本迁移到未见的具身,包括不同的夹爪、不同的机械臂以及五指灵巧手,且无需收集任何新数据。
- 基于几何的屏蔽: 一种通过从已知几何结构渲染掩码而非依赖生成模型或学习分割来缩小视觉差距的新方法,从而避免了幻觉并确保了实时性能。
- 掩码增强策略: 一种在训练期间随机化源夹爪轮廓的技术,确保模型学习的是具身无关的推理,而不是记忆特定的形状。
- 解耦数据与硬件: 证明了操控技能可以与执行任务的具体身体解耦,使得在一种机器人上收集的数据能够“长寿”于硬件更新。
4. 实验结果
作者在 DROID 数据集(源:配备 Robotiq 2F-85 夹爪的 Franka Panda)上评估了 Cloak-VLA,并在三个未见具身上测试了零样本迁移:
- UMI 夹爪: 另一种平行夹爪(不同的颜色、形状、尺寸)。
- YAM 机械臂: 带有夹爪的不同机械臂平台。
- Sharpa 手: 一个五指灵巧类人手。
性能指标(任务进展率):
- 源具身: Cloak-VLA 的表现与未屏蔽基线(π0.5-droid)相当,表明屏蔽腕部视图对源机器人造成的性能损失微乎其微。
- 未见具身:
- Cloak-VLA 在所有未见目标上均保持了高性能(例如,在 Sharpa 手上为 81.8%,在 UMI 夹爪上为 85.1%)。
- 基线模型(π0.5-droid 和 LAP-VLA)在未见具身上的性能显著下降,特别是在五指手上(分别降至 54.4% 和 60.2%)。
- 消融实验: 去除掩码增强(Cloak-VLA-NoAug)或使用固定目标掩码覆盖(Cloak-VLA-Overlap)会导致性能降低,证实了增强源轮廓对于泛化至关重要。
5. 重要性与主张
论文声称 Cloak 代表了迈向**具身无关操控(Body-agnostic Manipulation)**的重要一步。通过对末端执行器进行“遮蔽”,模型学会了对任务和环境进行推理,而不受机器人手部特定外观的偏差影响。
- 数据长寿性: 主要意义在于能够为新的、新兴的硬件重复使用大规模数据集(如 DROID),而无需重新训练或采集新数据。
- 鲁棒性: 该方法避免了生成模型的缺陷(幻觉、速度问题)以及学习型分割的局限(在细微结构上不可靠)。
- 范围: 作者谦虚地指出,目前的方法仅限于可通过两个指尖表达的任务(抓取/放置),尚未涵盖复杂的掌内重定向或需要丰富接触策略的技能。他们认为,由此产生的具身无关模型可以作为未来在新具身上进行微调的强大初始化。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。