← 最新论文
🤖 AI

CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations

本文介绍了 CLAM,这是一个使机器人能够通过自监督动力学预测推断连续潜动作,并利用与任务无关的游玩数据将其进行锚定的框架,从而通过从无标签观测序列中学习有效的控制策略,实现与使用专家标签的行为克隆相媲美的性能,且无需昂贵的动作标签演示。

原作者: Anthony Liang, Pavel Czempin, Matthew M. Hong, Yutai Zhou, Jingzhen Wang, Erdem Biyik, Stephen Tu

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Anthony Liang, Pavel Czempin, Matthew M. Hong, Yutai Zhou, Jingzhen Wang, Erdem Biyik, Stephen Tu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人做某件事,比如堆叠积木或倒饮料。通常,教机器人的最佳方式是手把手地向它展示每一步该怎么做,同时记录下其电机进行的每一次微小运动。这就像是给学生一本在背面写好了答案的教科书。但问题在于,记录这些电机运动是非常困难、昂贵且枯燥的。这需要人类专家物理控制机器人长达数小时,既缓慢又耗时。

现在,想象另一种类型的老师。这位老师没有机器人,他只有一个摄像机。他拍摄自己完成任务的过程,或者在互联网上寻找人们做这些任务的视频。机器人可以看到“发生了什么”——积木移动了,杯子满了——但它并不知道人类是如何移动手部动作来实现这一切的。“电机信号”缺失了。这就是机器人领域科学家们试图解决的谜题:机器人如何仅通过观察那些隐藏了“如何做”指令的视频,就能学会自主运动?这篇论文正是在解决这个难题,旨在让机器人能够通过廉价、易于收集的视频进行学习,而无需依赖昂贵的、手持式的训练课程。

这项研究背后的研究人员 Anthony Liang 及其团队推出了一种名为 CLAM(连续潜动作模型,Continuous Latent Action Models)的新方法。可以将 CLAM 想象成一个超级聪明的侦探,它可以通过观察视频中连续的两帧画面,来推测导致变化的“隐形力量”。如果你在视频中看到杯子从桌子的左侧移动到了右侧,CLAM 会尝试推测在两者之间发生的具体连续运动,尽管它从未见过移动它的那只手。

神奇的过程是这样发生的:首先,机器人观看大量的无标签视频(仅包含观察结果,没有指令)。它尝试根据当前帧和一个关于“隐藏动作”的“猜测”,来预测下一帧看起来会是什么样子。如果猜测错误,预测就会失败,机器人就会学习如何调整其猜测。随着时间的推移,它建立了一个由这些“隐藏动作”组成的库,使之能够理解这个世界。但这里有一个难点:这些隐藏动作只是机器人大脑中的数字;它们目前还不是真正的电机指令。

为了解决这个问题,团队使用了第二组较小的数据集:“玩耍”(play)数据。这只是机器人在四处乱动、碰撞物体以及随机移动手臂,但这一次,计算机确实记录了电机指令。这就像机器人在没有目标的情况下玩弄粘土,但同时记录着它手指是如何移动的日记。CLAM 利用这份日记来教它如何将这些“隐藏动作”的猜测转化为真实的物理运动。这里的关键创新在于,他们将“猜测”部分和“转化”部分放在一起进行训练。这确保了猜测保持简单且有用,而不是变成机器人无法执行的混乱状态。

实验结果非常令人印象深刻。团队通过两种方式测试了 CLAM:在计算机模拟环境(类似于电子游戏世界)中,以及在一个名为 WidowX 的真实物理机械臂上。他们发现,CLAM 能够学习完成复杂任务,例如组装零件或拿起物体,其成功率比之前尝试实现相同目标的各种方法高出 2 到 3 倍。在许多情况下,即使从未真正看到过那些完美的“电机指令”数据,CLCLAM 学习到的表现也几乎达到了与使用这些昂贵、完美数据进行训练相当的水平。

至关重要的是,这篇论文表明,当“隐藏动作”是连续的(平滑且流动的)而非被拆分为细小的离散步骤,并且当机器人利用那少量“玩耍”数据来学习转化这些动作时,这种方法效果最好。如果他们试图将动作强行纳入僵化的、步进式的格式,或者试图单独训练转化部分,机器人就会陷入困境。论文证明了,通过将这种自监督的侦探工作与少量杂乱的、无标签的玩耍数据相结合,我们可以教会机器人新的技能,而无需依赖昂贵的、由专家引导的遥操作。这是朝着让机器人能够从互联网上现有的海量视频内容中学习迈出的重要一步,而不是要求我们手动记录它们的每一个动作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →