✨ 要点🔬 技术摘要
想象一下教机器人做家务,比如把马克杯放到盘子上,或者拉开抽屉。过去,科学家试图通过向机器人展示成千上万段人类执行这些任务的视频来训练它们。机器人会尝试模仿这些动作,但它常常很吃力,因为它是在以“二维”方式(就像看一张平面照片)观察世界。它并不真正理解杯子是一个有深度的实体,也不明白需要绕过某个物体才能抓住它。
本文介绍了CLAMP ,这是一种训练机器人的新方法,相当于在机器人开始学习具体家务之前,先赋予它们一个“三维大脑”。
以下是其工作原理,分解为简单的概念:
1. 问题:平面视觉 vs. 三维视觉
想象一下,标准的机器人摄像头就像人类在看一幅画。你能看到颜色和形状,但无法感知深度。如果机器人试图拿起一把螺丝刀,它可能会抓空,因为它没有完全理解物体周围的三维空间。
CLAMP 的解决方案 :CLAMP 不只是看平面图片,而是构建一个三维点云 。想象一下,用一百万个微小的点来代表机器人看到的每一个表面。这赋予了机器人对世界的“实体”理解,使其确切知道物体在三维空间中的边缘和角落在哪里。
2. “健身房”训练(预训练)
在机器人尝试执行特定任务(如拉开抽屉)之前,它会在计算机模拟中进行大规模的“健身房”训练。这被称为预训练 。
锻炼内容 :机器人观看数百万次模拟的机器人动作。
学习要点 :它学会将三件事联系起来:
它看到的 (物体的三维形状)。
它做的 (其机械臂动作的历史记录)。
它被告知的 (文本描述,如“把开罐器放进左边的插槽”)。
魔法技巧(对比学习) :想象一个“记忆”游戏。机器人被展示一张场景图片和一份动作列表。它必须将正确的图片与正确的动作匹配。如果它将螺丝刀的图片与“拿起螺丝刀”的动作匹配,它就得分;如果它将螺丝刀的图片与“拿起剪刀”的动作匹配,它就丢分。经过数百万次尝试,它学会了看到 物体与知道 如何移动以抓取它之间的深层联系。
3. “腕部摄像头”的优势
该论文的一项重大发现是,机器人需要从自己的手部视角观察事物,而不仅仅是从天花板上的固定摄像头观察。
类比 :想象当别人拿着墙上的手电筒时,你试图穿针引线。这很难。但如果你自己拿着手电筒(即“腕部视角”),你就能确切地看到自己在做什么。
CLAMP 的做法 :它模拟安装在机器人手腕上的摄像头。这有助于机器人即使在其机械臂遮挡视线时也能清晰地看到物体,这对于高精度任务至关重要。
4. “先发优势”(微调)
在机器人完成“健身房”训练后,它就准备好学习真实任务了。
旧方法 :通常,你必须从头开始,向机器人展示几百个新任务的示例,它需要很长时间才能学会。
CLAMP 的方法 :因为机器人已经理解了三维空间以及动作与物体之间的关系,它只需要看到极少量的示例 (例如 4,500 次演示)就能掌握新任务。这就像一名已经学会读写学生;他们只需要学习新学科的具体词汇,而不需要从头学习如何握笔。
5. 结果
作者在六个不同的模拟任务(如将开罐器放入收纳盒)和五个现实世界任务(如拉开抽屉或回收易拉罐)上测试了 CLAMP。
结果 :CLAMP 在学习方面比其他顶尖方法显著更好、更快。在现实世界中,与未经过这种三维预训练的机器人相比,它成功拉开抽屉和将马克杯放到盘子上的频率要高得多。
总结
CLAMP 就像一个机器人训练营。它不只是向机器人展示如何完成某项具体工作,而是教机器人如何以三维方式观察 世界,以及它的身体如何在该空间中移动。一旦机器人拥有了这种关于三维物体和运动的通用“常识”,它就能极其快速且准确地学习新的、具体的家务任务。
技术摘要:CLAMP
问题陈述
虽然利用预训练的 2D 图像表示进行行为克隆已成为机器人操作的标准方法,但这些方法往往无法捕捉与物体和场景进行精确交互所需的本质 3D 空间信息。现有的机器人预训练方法面临诸多挑战,包括大规模机器人数据的可用性有限、关于最佳模态(例如 RGB 与点云)的不确定性,以及高维状态和动作空间的复杂性。此外,先前的 3D 预训练工作(如 3D-MVP)通常依赖通过掩码自编码器进行图像重建,而未纳入机器人动作数据,导致在 3D 感知与动作模式之间建立联系的学习存在空白。
方法论
作者提出了CLAMP (用于 3D 多视图动作条件机器人操作预训练的对比学习),这是一个旨在通过大规模模拟机器人轨迹上的对比学习来学习鲁棒的 3D 图像和动作表示的框架。
1. 数据表示与渲染
点云构建 :系统根据 RGB-D 图像和相机外参构建场景点云,并省略 RGB 颜色以提高外观泛化能力。
多视图重渲染 :CLAMP 不采用标准的正交视图,而是将场景重渲染为四通道图像(深度、X、Y、Z 坐标),视角来自五个虚拟视点:三个固定视图(俯视、左前、右后)和两个动态手腕视图(附着于夹爪)。动态手腕视图专门设计用于减少遮挡,并为高精度任务提供更清晰的观测。
文本输入 :文本输入包括高级任务描述、物体名称、归一化的全局位置以及任务进度整数。这些源自模拟器真值,仅在预训练期间使用,以将表示 grounded(锚定)。
2. 模型架构
CLAMP 采用三个通过对比学习训练的编码器:
图像编码器 :一个利用STRING 相对位置编码的视觉 Transformer(ViT)。与标准位置编码不同,STRING 使用从点云导出的 3D 坐标(可见点的质心)来关联不同视图中的 token。这使得模型能够隐式地学习 3D 结构,并关联来自不同 2D 视图但对应相似 3D 区域的 token。
动作编码器 :一个 Transformer 编码器,处理历史动作块序列。
文本编码器 :一个基于 CLIP 的文本编码器,处理任务和物体描述。
3. 对比预训练目标
编码器通过最小化 SigLIP 风格的损失进行训练,涵盖三种模态对:图像 - 文本、图像 - 动作和文本 - 动作。该目标将匹配三元组 ( I , T , A ) (I, T, A) ( I , T , A ) 的嵌入拉近,同时将不匹配的三元组推远。这促使模型学习能够推断未来状态的动作模式,以及能够推断动作历史的图像表示,且这些推断均以空间和时间的任务描述为条件。
4. 扩散策略预训练与微调
并行预训练 :扩散策略(视觉运动控制器)与编码器在同一模拟数据集上并行预训练。该策略使用预训练权重进行初始化,以提高下游的样本效率。
微调 :对于下游任务,策略在有限数量的特定任务演示上进行微调。在此阶段,CLAMP 编码器被冻结,用于提取图像和动作嵌入,这些嵌入与 RGB 特征(来自 ResNet-50)和本体感知数据拼接。随后,这些数据被输入到一个 Transformer 编码器 - 解码器中,以预测接下来 50 个动作步的噪声。
主要贡献
新颖的 3D 预训练框架 :提出了 CLAMP,利用机器人动作和动态手腕视图进行 3D 对比预训练。
用于 3D 坐标的 STRING :首次应用 STRING 相对位置编码,使用直接从点云(而非深度图)导出的 3D 坐标来关联多视图观测中的 token。
动态视图的重要性 :证明了动态手腕视图对于高精度操作任务至关重要。
联合编码器与策略预训练 :证明了同时预训练编码器和扩散策略比仅预训练编码器能带来显著更好的性能。
结果
作者在 ALOHA 机器人平台上,针对六个模拟任务和五个真实世界任务评估了 CLAMP。
模拟环境 :CLAMP 在所有六个任务中显著优于最先进基线(包括 ALOHA Unleashed、ACT 和 VLA 骨干网络)。例如,在“罐装开启器放入托盘”任务中,CLAMP 达到了 94.0% 的成功率,而预训练的 ALOHA Unleashed 为 70.0%,VLA 骨干网络仅为 7.3%。
真实世界 :在真实世界实验中,CLAMP 在五个任务中的四个任务上优于基线,在打开/关闭抽屉和将马克杯放置在盘子上表现出显著改进。
消融研究 :
移除虚拟手腕视图导致性能显著下降(例如,“马克杯放盘”任务下降 28.6%)。
将 ViT 替换为 PointNet 风格的骨干网络(DP3)导致性能退化。
移除文本编码器在模拟环境中影响较小,但在真实世界设置中产生了明显的负面影响,表明在处理视觉噪声时,文本锚定更具价值。
证明与编码器并行预训练策略对于高样本效率至关重要。
意义
该论文声称,CLAMP 通过有效利用 3D 几何信息和机器人动作模式,显著提高了在未见任务上的学习效率和策略性能。通过在大规模模拟数据上进行预训练,并利用这些学习到的表示初始化策略,该框架降低了在有限真实世界演示上进行微调所需的样本复杂度。这项工作确立了,与现有的 2D 或基于重建的方法相比,结合 3D 感知和动作条件对比学习是机器人操作预训练的一种可行且更优越的方法。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。