想象一下,你正在教一个机器人如何拿起玩具。你拥有成千上万个人类完美执行该动作的视频,但关于机器人执行该动作的视频却寥寥无几。
问题在于,人类和机器人的外观截然不同。人手有皮肤、皱纹,以及五个以特定方式弯曲的手指。而机械手可能由金属制成,只有四根手指,或者看起来像爪子。由于外观差异巨大,机器人的“大脑”(其计算机视觉系统)会感到困惑。它在视频中看到人手时,会认为“那是人类”,但当它看到自己的金属手时,却会想“那完全是另一回事”。它无法将两者联系起来,因此无法从人类视频中学习。
本文介绍了一种名为LACE(跨形态学习的潜在对齐)的解决方案。以下是其工作原理,通过简单的类比来说明:
1. “语言”问题
将机器人的大脑想象成一名学生,它使用一种名为“潜在空间”的复杂语言。这种语言用于描述它所看到的内容。
- 问题所在: 当机器人观察人手时,它用这种语言的一种方言来描述;当它观察自己的金属手时,则用完全不同的另一种方言来描述。尽管两者都是“手”,但机器人认为它们是完全不相关的词汇。
- 结果: 机器人忽略了人类视频,因为它无法理解人类所使用的“方言”。
2. LACE 解决方案:通用翻译器
LACE 就像一个通用翻译器,教导机器人对人类手和机械手使用同一种方言。
LACE 并不试图让机器人的摄像头图像看起来完全像人类照片(这很难且经常失败),而是在机器人的大脑内部运作。它表示:“嘿,尽管人类拇指和机械拇指看起来不同,但它们做着同样的工作。让我们确保机器人的大脑使用完全相同的内部代码来描述它们。”
3. 如何学习:“共享部件”技巧
要训练这个翻译器,你不需要成千上万个机器人视频。你只需要一段机器人移动的视频,加上一些现成的人类视频。
- 地图: 系统使用一张身体部位的“地图”。它知道人类拇指对应机械拇指,人类手腕对应机械手腕,等等。
- 课程: 它选取一张人手图片和一张机械手图片。它指向两张图片中的拇指,并说:“这两个像素对机器人的大脑来说必须意味着相同的东西。”
- 魔法: 它调整机器人的大脑,使其在看到机械拇指时,产生的“内部感觉”与看到人类拇指时完全相同。
4. 学习的两条规则
该论文提到了系统遵循的两条具体规则,以确保正确学习而不遗忘其他内容:
- 规则 1:“媒人”(语义对齐损失): 这条规则迫使机器人匹配人类和机器人的身体部位。就像一位老师说:“如果你看到人类拇指,你必须对‘拇指性’的思维方式,与你对机械拇指的思维方式完全一致。”
- 规则 2:“锚点”(Gram 损失): 这一点至关重要。如果你只教机器人关于拇指的知识,它可能会忘记如何识别杯子或椅子。“锚点”规则说:“保持你对世界的一般知识(比如桌子的样子)与之前完全相同。只改变你对手的思维方式。”这防止了机器人对其他事物产生困惑。
5. 结果:从零到英雄
研究人员在现实世界中测试了这种方法:
- 没有 LACE: 如果给机器人零个机器人训练视频,只提供人类视频,机器人几乎 100% 会失败。它无法弄清楚自己的手在哪里。
- 使用 LACE: 使用相同的设置(零个机器人视频),机器人的成功率达到了60%。它能够观看人类视频,理解该动作,并成功将其应用到自己的金属手上。
- 低数据: 即使只给机器人极少量的自身视频(通常所需量的 10%),LACE 也能帮助其表现比以往好得多。
总结
LACE 是一种方法,它教导机器人停止将人类和机器人视为两个不同的物种。通过教导机器人的大脑对共享身体部位(如拇指和手腕)使用相同的“内部代码”,它使机器人能够从互联网上海量的人类视频数据中学习复杂的技能,即使它们从未见过机器人执行过该特定任务。它仅需极少的数据,且不需要机器人长得像人类。
技术摘要:LACE——用于跨具身学习的潜在视觉表征
1. 问题陈述
本文探讨了跨具身学习的挑战,特别是将从人类演示中学习到的策略迁移到机器人时所面临的困难。尽管自监督学习(SSL)骨干网络(例如 DINO)已成为编码通用物体丰富类间语义的标准,但作者指出了一个关键缺陷:这些预训练模型无法在人类手和机器人手之间建立可靠的语义对应关系。
作者认为,这种失败源于潜在特征空间中的“视觉鸿沟”。预训练的 SSL 模型是在互联网规模的数据集(例如 DINO 使用的 LVD-1689M)上训练的,这些数据集缺乏多样化的机器人具身形态。因此,虽然这些模型能够捕捉自然图像的语义,但它们并未学习人体部位(例如人类拇指)与其机器人对应部位(例如机器人手指)之间的结构映射。现有的解决方案通常试图在像素空间中弥合这一鸿沟(通过图像编辑、分割或修复),但这会丢弃特定具身的形态特征、需要推理时的处理,或将迁移限制在特定的目标机器人上。
2. 方法论:LACE
作者提出了LACE(跨具身潜在对齐),这是一个直接在预训练 SSL 骨干网络的潜在特征空间中对齐人类和机器人视觉表征的框架。
核心概念
LACE 利用跨具身共享身体部位的结构对应关系(例如将人类关键点映射到机器人关键点)作为稀疏监督信号。它微调预训练骨干网络,以最小化潜在空间中的视觉鸿沟,同时保留骨干网络的通用语义能力。
关键组件
数据设置:
- 人类数据: 源自现有的关键点标注数据集(例如 HInt 中的 EpicKitchen 子集)。
- 机器人数据: 仅需单次机器人演示。关键点通过正向运动学(FK)和渲染器分割掩码自动推导得出。
- 训练对: 模型在不同具身(跨具身)和相同具身(内具身)的图像对 (Ia,Ib) 上进行训练。
损失函数:
训练目标由两部分组成:
- 语义对齐损失(Lalign): 这将关键点级别的监督提升为语义级别的对齐。对于共享关键点 k,该方法比较关键点图块与图像中所有其他图块之间的相似度分布。
- 它定义了一个目标分布 P(源图像中关键点的自相似度)和一个提议分布 Q(目标图像中对应关键点的交叉相似度)。
- 该损失最小化反向 KL 散度(DKL(Q∣∣P)),鼓励机器人的关键点在潜在空间中诱导出与人类关键点相似的语义结构。
- 使用指数移动平均(EMA)教师网络来稳定训练。
- Gram 损失(Lgram): 为了防止骨干网络通用视觉理解能力(例如物体识别)的灾难性遗忘,应用了 Gram 损失。它惩罚可训练编码器与 EMA 编码器之间成对特征相似度(Gram 矩阵)的偏差。这确保了在手部特征对齐的同时,其他特征(背景、物体)的相对结构保持稳定。
总损失为:L=Lalign+λLgram。
架构:
作者使用DINOv3(ViT-S)作为骨干网络实现 LACE,记为LACE-DINO。策略仅以视觉特征为条件,从而隔离了视觉领域鸿沟。
3. 主要贡献
- 潜在鸿沟的识别: 本文证明了人类与机器人具身之间的视觉鸿沟会传播到潜在视觉嵌入中,导致预训练的 SSL 模型在跨具身对应关系上失效。
- 稀疏监督框架: LACE 利用单次机器人演示的帧(甚至单个关键点标注帧)实现跨具身语义对齐,无需时间或空间对齐的数据集。
- 通用语义的保留: 通过引入 Gram 损失,该方法在不对齐特定身体部位的同时,避免了骨干网络通用视觉特征的退化,从而避免了灾难性遗忘。
- 零样本和低数据性能: 该框架使机器人策略能够在机器人数据稀缺时有效利用丰富的人类数据,在零样本迁移和泛化到分布外(OOD)环境方面取得了显著增益。
4. 实验结果
作者通过在现实世界机器人操作任务上的广泛实验验证了 LACE。
关键点对齐指标:
- 在人类 - 机器人对应关系上,LACE-DINO 将端点误差(EPE)从预训练 DINO 的87.04降低至19.36,并将余弦相似度从0.473提升至0.910。
- 这种改进泛化到了其他 SSL 骨干网络(SigLIP、I-JEPA、V-JEPA2)。
下游任务(姿态估计与定位):
- 在零样本迁移(在人类数据上训练探针,在机器人数据上测试)中,LACE-DINO 显著优于 DINO。
- 姿态估计: EPE 从 57.5 像素提升至 35.6 像素;PCK@0.2 从 28.6% 提升至 72.4%。
- 定位: LACE-DINO 的具身定位命中率为 40.5%,而 DINO 仅为 3.2%。
策略学习(物体抓取):
- 零样本模式(0% 机器人数据): LACE-DINO 在抓取目标物体时达到了60%的成功率,而 DINO 基线仅为5%。
- OOD 环境: 在机器人未见过干扰物体的环境中,LACE-DINO 达到了**65%**的成功率,而 DINO 完全失败(0%)。
- 数据效率: 即使在有限的机器人数据下(可用机器人演示的 10% 或 100%),LACE-DINO 也始终优于 DINO,表明对齐的表征可以弥补数据的稀缺。
泛化能力:
- 未见姿态: 该模型泛化到了训练期间未见过的姿态。
- 多种具身形态: LACE 成功同时对齐了四种不同的形态(人手、多指机器人手、平行夹爪、杆状末端执行器)。
- 特征质量: 消融实验证实,Gram 损失至关重要;如果没有它,由于特征漂移,下游任务性能(ImageNet 分类、ADE20K 分割)会显著下降。
5. 意义与主张
本文声称,LACE为灵巧机器人学习中的数据稀缺问题提供了一种实用解决方案。通过在潜在空间而非像素空间操作,它避免了与图像编辑方法相关的计算开销和信息损失。
作者强调,他们的方法允许机器人在机器人演示极其有限甚至不存在(零样本)的情况下,利用丰富的人类视频数据。该框架被提出作为一种通用方法,适用于任何编码语义结构的 SSL 骨干网络,提供了一条途径,无需大规模同步的跨具身数据集即可为未见过的环境和多样化的机器人形态训练鲁棒的策略。代码计划公开发布,以促进跨具身泛化领域的进一步研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。