想象一下,你正试图通过向机器人展示数千小时的居家视频来教它如何行走。目标是让机器人弄清楚,视频中哪些部分是由行走者的腿部运动引起的(即“动作”),而哪些部分仅仅是背景场景的变换、摄像机的晃动或风吹树叶(即“干扰项”)。
这正是论文MaskLAM试图解决的问题。
问题:机器人容易分心
先前的方法(例如一种名为 LAPO 的系统)试图通过观察整个视频帧来进行学习。它们会问:“这一帧与下一帧之间发生了什么变化?”
在一个拥有纯白背景的完美世界里,唯一发生变化的就是机器人的移动。但在现实世界中,背景是杂乱无章的。
- 类比:想象一下,你试图通过观看一段视频来学习如何开车,视频中司机正在转动方向盘,但窗外的景色也在剧烈地飞速掠过。如果你试图通过观察整个画面来学习,你的大脑可能会感到困惑,并认为:“哦,汽车在移动是因为树木在飞速掠过!”你可能会学会去控制树木,而不是控制方向盘。
从技术术语来说,机器人的“潜在动作”(即其对“该做什么”的内部理解)会被背景噪声所污染。它学会了预测背景的运动,而不是智能体(agent)的实际控制,从而导致其在尝试行动时失败。
解决方案:戴上“眼罩”(掩膜)
作者们意识到,虽然“智能体”和“干扰项”的概念是抽象的,但在实际的视频像素中,它们通常位于不同的位置。机器人在这边;移动的背景在那边。
他们创建了MaskLAM,其工作原理如下:
- 定位智能体:在训练开始之前,他们使用一个智能的预训练 AI(称为 SAM 2.1)来在视频中仅围绕机器人或智能体绘制数字轮廓(掩膜)。这是自动完成的,无需人工标注每一帧。
- 忽略其余部分:当机器人试图从视频中学习时,系统会告诉它:“只看轮廓内部的像素。忽略轮廓之外的所有内容。”
- 结果:如果背景中的树木移动了,机器人并不在意,因为那些像素在掩膜之外。如果机器人的腿移动了,机器人能清晰地看到它,因为它在掩膜之内。
为什么这很重要
该论文声称,这个简单的技巧解决了一个巨大的问题,而无需复杂的新型架构或昂贵的人工标注。
- 无需额外作业:与其他需要机器人通过人工编写的指令(动作标签)来学习忽略背景的方法不同,MaskLAM 仅通过观察掩膜内的像素就能学会忽略背景。
- 性能更优:在他们的测试中(使用模拟环境,如奔跑的猎豹或机械臂),MaskLAM 的学习速度和准确性都远超先前的方法。
- 类比:如果先前的方法像是在嘈杂的自助餐厅里学习的学生,那么 MaskLAM 就像是戴上了降噪耳机,只让老师的声音通过。
- 鲁棒性:即使“轮廓”并不完美(例如,它漏掉了机器人脚的一小部分,或者包含了一小部分背景),该系统仍然运作良好。它对错误具有包容性。
核心结论
该论文证明,你不需要构建一个超级复杂的大脑,就能通过杂乱的视频来教机器人。你只需要教它们看向哪里。通过将学习过程限制在仅属于智能体的像素上,机器人不再试图控制背景,而是开始学习如何真正移动自身。
这使得机器人能够从互联网上海量的“无动作”视频中学习,而无需昂贵的人工标签来告诉它们该忽略什么。
技术摘要:MaskLAM——在存在干扰项的情况下引导潜在动作模型
问题陈述
潜在动作模型(LAMs)为在大规模无动作视频上预训练具身智能体提供了一条途径,其通过推断连续观测之间的潜在动作来实现。这些潜在动作随后利用少量带标签的示例解码为真实控制信号。然而,标准的 LAM(如 LAPO)依赖于全局重建目标,迫使模型编码整个场景以预测未来帧。
在包含视觉干扰项(例如动态背景、相机抖动或移动物体)的真实环境中,这种方法会失效。标准重建损失驱动潜在动作编码外源性运动(干扰项),而非智能体控制的(内源性)动态。这一现象由外源块马尔可夫决策过程(Ex-BMDP)框架形式化描述,导致潜在空间无法恢复真实动作,使得下游策略在微调时表现显著不佳。以往尝试解决此问题的方法需要改变架构、引入辅助损失,或在预训练期间依赖特权动作监督,从而增加了复杂性和数据需求。
方法论:MaskLAM
作者提出了MaskLAM,这是对 LAPO 训练目标的一种轻量级修改,旨在解决外源性污染问题,而无需改变模型架构或在预训练期间需要动作标签。
核心洞察
该方法基于以下观察:虽然内源性(智能体)和外源性(干扰项)因素在潜在空间中纠缠在一起,但它们在像素空间中通常是空间可分离的。智能体控制的变化集中在智能体像素上,而干扰项运动则发生在其他位置。
技术实现
- 零样本分割:MaskLAM 利用现成的分割基础模型(具体为 SAM 2.1)生成二元掩码(Mt)以识别智能体像素。这些掩码通过在第一帧上的单个提示(例如边界框)进行零样本获取,并沿视频序列传播。
- 掩码前向动态损失:与前向动态模型(FDM)不再重建完整观测不同,其损失被限制在智能体像素上。损失函数定义为:
LMaskLAMFDM=∥Mt+1∥11∥Mt+1⊙(o^t+1−ot+1)∥22
其中 ⊙ 表示哈达玛积。这确保了智能体掩码之外的像素(干扰项)对潜在动作 zt 不贡献任何梯度。
- 掩码条件输入:分割掩码作为额外的输入通道拼接至逆动态模型(IDM)和 FDM。这使得模型能够利用完整的场景上下文(包括智能体交互的、可能落在严格智能体掩码之外的物体),同时确保 zt 的学习信号仅源自智能体控制的动态。
- 无架构变更:该干预仅修改损失计算和输入通道,保留了底层 LAPO 架构(IDM/FDM 对)和三阶段训练流程(预训练、重标记、解码器微调)的完整性。
主要贡献
- 作为干预手段的空间可分离性:本文指出智能体与干扰项像素的空间可分离性是关键属性,它使得抽象的 Ex-BMDP 分解能够被实现为具体的训练时干预措施。
- MaskLAM 的提出:一种通过限制重建损失至智能体像素来消除潜在动作上外源梯度的方法,无需辅助损失、无需架构变更、且在预训练期间无需动作标签。
- 实证验证:在两个基准测试(Distracting Control Suite 和 Distracting Meta-World)上的广泛评估表明,MaskLAM 显著优于无标签基线,并缩小了与依赖特权动作监督的方法(LAOM-Labels)之间的性能差距。
结果
作者在两个基准测试的 14 个任务上评估了 MaskLAM,将其与 LAPO、LAOM-Labels(带有动作监督的上限)、LAOF(基于流的方法)以及 LAPO-Slots(基于对象的方法)进行了比较。
- 潜在动作质量:与 LAPO 相比,MaskLAM 将归一化线性探针均方误差(NMSE)降低了高达3.51 倍。在可视化(UMAP 投影)中,MaskLAM 生成了与真实动作对齐的平滑、单调流形,而 LAPO 则坍缩为纠缠的簇。
- 下游性能:在干扰项设置下,MaskLAM 将归一化回报较 LAPO 提高了高达4.97 倍。它达到或超过了所有无标签基线的表现,并接近使用特权动作监督的 LAOM-Labels 的性能。
- 样本效率:MaskLAM 在解码器微调阶段表现出卓越的样本效率。在 Distracting Meta-World 上,仅需2,000 个动作标签即可达到接近峰值的性能,而 LAPO 和 LAPO-Slots 则需要近两个数量级更多的标签才能缩小差距。
- 鲁棒性:
- 遮挡:即使智能体遮挡率高达75%,MaskLAM 仍保持低错误率,而未加掩码的模型则显著退化。
- 不完美掩码:即使分割掩码受到扰动(mIoU 降至 0.4–0.6),该方法依然有效,表明不需要像素级完美的分割。
- 紧凑潜在空间:MaskLAM 允许使用更小的潜在维度(例如 64 维)来实现与更大的未掩码潜在空间(256 维)相同的对齐效果,因为潜在空间不再负担编码外源方差的负荷。
意义与主张
本文主张,标准 LAM 在富含干扰项环境中的失败是由预测目标(全局重建)而非架构驱动的。通过将监督负担从稀缺的动作标签重新分配给廉价且可用的零样本分割掩码,MaskLAM 使得在嘈杂的真实世界视频上进行潜在动作预训练成为可能。
作者强调,该方法:
- 解耦了对动作标签的需求与学习解耦动态的能力。
- 保留了 LAPO 框架的简洁性,同时解决了关键的鲁棒性问题。
- 证明了源自基础模型的空间先验可以在缺乏显式控制标注的情况下有效引导表示学习。
这项工作表明,对于在复杂视觉环境中运行的具身智能体,将智能体动态与干扰项解耦所需的监督信号可以源自分割掩码而非动作标签,这有可能实现在互联网规模视频数据上的大规模预训练。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。