← 最新论文
💻 computer science

LACE: Latent Visual Representation for Cross-Embodiment Learning

LACE 是一个框架,它通过基于稀疏的自动生成身体部位对应关系来对齐人类与机器人形态的潜在视觉表征,从而弥合两者之间的视觉鸿沟,使机器人即使在机器人特定训练数据稀缺的情况下,也能有效利用丰富的人类演示数据进行策略学习。

原作者: Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何拿起玩具。你拥有成千上万个人类完美执行该动作的视频,但关于机器人执行该动作的视频却寥寥无几。

问题在于,人类和机器人的外观截然不同。人手有皮肤、皱纹,以及五个以特定方式弯曲的手指。而机械手可能由金属制成,只有四根手指,或者看起来像爪子。由于外观差异巨大,机器人的“大脑”(其计算机视觉系统)会感到困惑。它在视频中看到人手时,会认为“那是人类”,但当它看到自己的金属手时,却会想“那完全是另一回事”。它无法将两者联系起来,因此无法从人类视频中学习。

本文介绍了一种名为LACE(跨形态学习的潜在对齐)的解决方案。以下是其工作原理,通过简单的类比来说明:

1. “语言”问题

将机器人的大脑想象成一名学生,它使用一种名为“潜在空间”的复杂语言。这种语言用于描述它所看到的内容。

  • 问题所在: 当机器人观察人手时,它用这种语言的一种方言来描述;当它观察自己的金属手时,则用完全不同的另一种方言来描述。尽管两者都是“手”,但机器人认为它们是完全不相关的词汇。
  • 结果: 机器人忽略了人类视频,因为它无法理解人类所使用的“方言”。

2. LACE 解决方案:通用翻译器

LACE 就像一个通用翻译器,教导机器人对人类手和机械手使用同一种方言。

LACE 并不试图让机器人的摄像头图像看起来完全像人类照片(这很难且经常失败),而是在机器人的大脑内部运作。它表示:“嘿,尽管人类拇指和机械拇指看起来不同,但它们做着同样的工作。让我们确保机器人的大脑使用完全相同的内部代码来描述它们。”

3. 如何学习:“共享部件”技巧

要训练这个翻译器,你不需要成千上万个机器人视频。你只需要一段机器人移动的视频,加上一些现成的人类视频。

  • 地图: 系统使用一张身体部位的“地图”。它知道人类拇指对应机械拇指,人类手腕对应机械手腕,等等。
  • 课程: 它选取一张人手图片和一张机械手图片。它指向两张图片中的拇指,并说:“这两个像素对机器人的大脑来说必须意味着相同的东西。”
  • 魔法: 它调整机器人的大脑,使其在看到机械拇指时,产生的“内部感觉”与看到人类拇指时完全相同。

4. 学习的两条规则

该论文提到了系统遵循的两条具体规则,以确保正确学习而不遗忘其他内容:

  • 规则 1:“媒人”(语义对齐损失): 这条规则迫使机器人匹配人类和机器人的身体部位。就像一位老师说:“如果你看到人类拇指,你必须对‘拇指性’的思维方式,与你对机械拇指的思维方式完全一致。”
  • 规则 2:“锚点”(Gram 损失): 这一点至关重要。如果你只教机器人关于拇指的知识,它可能会忘记如何识别杯子或椅子。“锚点”规则说:“保持你对世界的一般知识(比如桌子的样子)与之前完全相同。只改变你对手的思维方式。”这防止了机器人对其他事物产生困惑。

5. 结果:从零到英雄

研究人员在现实世界中测试了这种方法:

  • 没有 LACE: 如果给机器人零个机器人训练视频,只提供人类视频,机器人几乎 100% 会失败。它无法弄清楚自己的手在哪里。
  • 使用 LACE: 使用相同的设置(零个机器人视频),机器人的成功率达到了60%。它能够观看人类视频,理解该动作,并成功将其应用到自己的金属手上。
  • 低数据: 即使只给机器人极少量的自身视频(通常所需量的 10%),LACE 也能帮助其表现比以往好得多。

总结

LACE 是一种方法,它教导机器人停止将人类和机器人视为两个不同的物种。通过教导机器人的大脑对共享身体部位(如拇指和手腕)使用相同的“内部代码”,它使机器人能够从互联网上海量的人类视频数据中学习复杂的技能,即使它们从未见过机器人执行过该特定任务。它仅需极少的数据,且不需要机器人长得像人类。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →