← 最新论文
💻 computer science

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM 表明,利用野外场景下的第一视角人类数据,通过使用世界动作模型(World Action Models)来训练机器人策略,能够显著优于传统的行为克隆,因为它利用了诸如 DINO 特征和 3D 运动流等抽象世界表示,从而更好地将可迁移的物理效应与不可迁移的人类特定因素区分开来。

原作者: Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个笨拙的机器人做家务,比如叠衣服或端杯子。你拥有海量的视频数据,展示了人类如何完美地完成这些任务。这看起来像是通往成功的金钥匙:只要模仿人类就行了,对吧?

没那么简单。论文 EGOWAM 指出,如果你试图通过单纯模仿人类的动作来教机器人(这种方法被称为“行为克隆”,Behavior Cloning),你实际上可能会让情况变得更糟。

问题在于:人类和机器人的构造不同。人类拥有灵活的脊椎、随之摆动的双臂以及上下晃动的头部。而机器人是僵硬的,它的摄像头固定在头部,动作带有机械的精准感。如果你强迫机器人去模仿人类精确的挥臂动作,机器人可能会尝试以它物理上无法实现的姿态扭转身体。这就像是通过看老鹰飞行的视频来教企鹅飞行;企鹅只会拼命拍打翅膀,然后摔倒在地。

作者发现,这种“模仿动作”的方法经常失败,因为机器人会被那些对任务本身无关紧要的人类特有特征(如头部晃动或身体姿态)搞糊涂。

魔法开关:预测未来,而不只是动作

研究人员并没有仅仅告诉机器人“把手臂移到这里”,而是尝试了一种不同的技巧。他们教会了机器人一个世界动作模型(World Action Model)

可以这样理解:

  • 旧方法(行为克隆): 你告诉机器人,“完全模仿我的手部动作。” 机器人感到困惑,因为你的手部运动方式与它的机械抓手不同。
  • 新方法(EGOWAM): 你告诉机器人,“观察当我移动手部时,那个杯子会发生什么变化。”

机器人学习的是如何预测世界的变化(杯子移动了、衣服叠好了),而不是仅仅模仿人类的肢体语言。这就像是教学生理解球滚下山坡的物理原理,而不是让他们死记硬背踢球的人肌肉是如何运动的。因为无论是由人还是机器人移动,杯子滚动的物理规律都是一样的,所以机器人可以从人类视频中学习,而不会被人类的身体形态所干扰。

“世界”至关重要:机器人应该预测什么?

研究人员测试了三种不同的让机器人“看见”未来世界的方式。他们把机器人的大脑比作一个正在参加考试的学生,而“考试题目”就是机器人下一步应该预测什么。

  1. “像素”测试(重构/Reconstruction): 机器人试图逐个像素地预测下一张图像。
    • 结果: 这是一个失败的尝试。机器人陷入了试图记忆衬衫精确颜色或房间光照的泥潭。它无法区分“杯子在移动”和“相机在晃动”。这就像是通过记忆路上每一粒沙子的细节来学习开车;你反而忽略了大局。
  2. “DINO”测试(语义/Semantics): 机器人预测场景的含义。它学会识别“那是一个杯子”或“那是一个袋子”,而不需要担心具体的蓝色色调或光照情况。
    • 结果: 这在应对新事物方面取得了巨大的成功。当机器人面对从未见过的杯子或背景不同的房间时,它的表现比旧方法好上 4 倍。它学习的是物体的“概念”,而不仅仅是照片。
  3. “3D 流”测试(运动/Motion): 机器人精确预测物体在 3D 空间中的运动方式,从而忽略摄像头的晃动。它过滤掉了人类的头部运动,只关注物体的移动。
    • 结果: 这是精准度的冠军。当机器人需要在熟悉的房间里将杯子放在特定位置时,它的成功率提高了 20–30%。它学习到了运动的精确几何结构。

核心启示

这篇论文表明,你不能只是把人类视频一股脑儿丢给机器人并期望它能奏效。你必须聪明地处理机器人应该从这些视频中学到什么

  • 他们排除掉的是: 仅仅模仿人类动作(行为克隆)或试图预测精确像素图像(Pixel VAE)都是较弱的方法。它们往往会让机器人的表现甚至不如仅通过机器人自身数据进行学习的效果。
  • 他们发现的是: 通过使用专注于语义(DINO)或 3D 运动(3D Flow)的“世界动作模型”,机器人可以成功地从大量杂乱、真实的现实世界人类数据中学习。

基于在真实环境下使用双臂机器人执行任务(如将杯子放在茶托上、叠衣服、装购物袋)的实际测试,作者对这些数字非常有信心。他们发现,“3D 流”方法最擅长在熟悉的环境中完成任务,而“DINO”方法则最擅长处理全新的物体和房间。

简而言之:不要教机器人跳人类的舞蹈;要教它理解世界是如何运动的,然后让机器人去寻找属于它自己的舞步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →