← 最新论文
🤖 AI

Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models

本文介绍了基于预测引导的接地潜动作世界模型(Grounded Latent-Action World Models, GLAM),该框架通过学习一个共享的、以预测为引导的潜动作空间,使得从具有不同或缺失动作标签的异构数据源中进行鲁棒的模仿学习成为可能,并在模拟和现实世界的操控任务中显著优于现有基准方法。

原作者: Tianyou Wang, Anson Lei, Joe Watson, Ingmar Posner

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyou Wang, Anson Lei, Joe Watson, Ingmar Posner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要教一个机械臂如何拿起一个杯子并把它放入抽屉。传统的方法是让人类亲手引导机械臂完成这个动作数百次。这既缓慢、昂贵,又枯燥乏味。

这篇论文提出了一种更聪明的方法:让机器人从“廉价”的练习和“昂贵”的真实训练中共同学习。

以下是他们解决方案 GLAM 的拆解,使用了简单的类比。

问题所在:语言不通

想象你有两种类型的训练数据:

  1. “黄金”数据(Gold Data): 真实的机器人录像,我们确切知道电机的运动方式(即动作标签)。这种数据很稀缺,获取成本很高。
  2. “白银”数据(Silver Data): 来自其他来源的大量视频——模拟器、人类移动物体的视频,或是来自另一台不同型号机器人的数据。这些数据非常丰富且免费,但它们没有电机指令,而且看起来也不同(不同的摄像头视角、不同的机器人形状)。

如果你只是把这两者混合在一起进行教学,机器人会感到困惑。这就像试图通过一本英文教科书和一段日语讲座来教学生,却没提供翻译。机器人不知道模拟器中的“向上移动手臂”与现实世界中“向上移动手臂”是同一个目标。

解决方案:“通用翻译机”(GLAM)

作者构建了一个名为 GLAM(基于接地潜动作的世界模型,Grounded Latent-Action World Model)的系统。你可以把 GLAM 想象成一个通用翻译机,它使用一种只有“黄金”数据和“白银”数据都能理解的秘密抽象语言进行交流。

它是如何工作的呢?分为两个步骤:

第一步:学习秘密语言(世界模型)

GLAM 不再试图去匹配机器人具体的电机运动,而是专注于因果关系

  • 核心理念: 如果一个动作(比如推一下方块)导致方块在桌面上滑动,那么这个动作就具有特定的“含义”。无论这个“推”的动作是来自人类的手、模拟器,还是另一台机器人,只要对物体产生的结果是一样的,那么这个动作的“含义”就是一样的。
  • 机制: GL中建立了一个共享的“字典”(潜空间/latent space)。
    • 它观察“白银”数据(没有电机指令的视频),并追问:“是什么看不见的动作导致了这个物体的移动?”它猜出答案,并用秘密语言将其记录下来。
    • 它观察“黄金”数据(真实的机器人),并追问:“什么样的电机运动导致了这种现象?”它将该运动翻译成同样的秘密语言。
    • 神奇之处: 它强制要求这两者的翻译保持一致。它确保视频中的“推”和机器人执行的“推”在这一套秘密语言中代表完全相同的意思。

第二步:教导机器人(行为克隆)

一旦建立了这个秘密字典,机器人就可以学得更快。

  • 系统提取所有的“白银”数据(廉价且丰富的视频),并使用这种秘密语言为它们重新打上标签。现在,机器人拥有了一个庞大的指令库,尽管它从未见过原始的电机指令。
  • 随后,它训练机器人观察场景、猜测所需的“秘密动作”,然后将这个秘密动作翻译回真实的电机指令,从而执行任务。

创意类比:舞蹈教练

想象你想教一名学生(机器人)一个特定的舞蹈动作。

  • 旧方法: 你站在学生身边,亲手移动他们的肢体 1,000 次。(昂贵、缓慢)。
  • GLAM 方法: 你拥有一些专业舞者的视频(黄金数据),以及成千上万段人们在客厅、舞台或动画片里跳舞的视频(白银数据)。
    • 白银数据虽然没有分步指令,但你可以看到舞者们对地面和空气做了什么
    • GLAM 就像一位编舞师,他忽略了具体的鞋子或房间的大小。相反,他专注于节奏与流动
    • 他意识到,“踩着节拍向前迈步”这个概念,无论是专业舞者在演播室里做,还是小孩在客厅里做,都是一样的。
    • 他创造了一个代表这个动作的“节奏代码”(Rhythm Code)。
    • 现在,学生通过观看所有这些视频来学习,理解这个“节奏代码”,然后将其应用到自己的身体上。因为他们可以接触到成千上上的个例子,而不是仅仅几个,所以他们学习舞蹈的速度大大加快了。

研究发现

研究人员在五个不同的任务(如堆叠积木或撞倒瓶子)中,在计算机模拟和现实世界中都测试了该系统。

  • 结果: 使用 GLAM 训练的机器人表现显著优于仅使用昂贵的“黄金”数据进行训练的机器人。
  • 提升: 在一些困难的任务中,相比标准方法,GLAM 方案将成功率提高了近 50%
  • “物体掩码”(Object Mask)技巧: 他们发现,如果告诉 AI 只关注被移动的物体(忽略背景和机器人自身的躯干),学习会变得更加准确。这就像告诉学生:“别管房间怎么样,盯着球看就行。”

核心总结

GLAM 通过教机器人理解运动的物理特性而非仅仅死记硬背特定的电机指令,解决了“数据稀缺”的问题。它让机器人能够从廉价、杂乱且多样的数据源(如模拟器或视频)中学习,并将这些知识应用于现实世界的任务,从而在无需数千次昂贵人工演示的情况下,让机器人变得更聪明、训练得更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →