Masquerade: Learning from In-the-wild Human Videos using Data-Editing
Masquerade 通过编辑野外人类视频,利用机械臂修复和机器人叠加合成机器人演示,以解决机器人数据稀缺问题,从而支持一种协同训练策略,该策略在长程双机械臂任务上显著优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想教机器人做一顿复杂的饭菜,比如叠放锅具或刮土豆皮。问题在于,你并没有成千上万个机器人执行这些任务的视频。录制机器人数据既缓慢、昂贵,又需要特殊设备。
然而,互联网上充斥着数百万个人类烹饪的视频。使用这些视频的问题在于,人类的外观和动作与机器人截然不同。如果你只是让机器人观看人类手抓取勺子的视频,机器人会感到困惑,因为它没有人类的手,它有的是金属夹爪。这被称为“具身差距”(embodiment gap)。
Masquerade 是一个巧妙的技巧,用于弥合这一差距。其工作原理如下,分解为简单步骤:
1. “数字面具”(数据编辑)
将研究人员想象成戴着“化装舞会面具”的数字编辑。他们获取人类烹饪的原始视频,并通过一个特殊流程进行处理:
- 步骤 A: 他们利用人工智能精确找出每一帧中人类手的位置。
- 步骤 B: 他们使用“图像修复”(inpainting,就像魔法橡皮擦)将人类的胳膊和身体涂抹覆盖,将其从视频中移除。
- 步骤 C: 他们在人类胳膊原本所在的完全相同的位置,数字粘贴一个模拟的机械臂。
结果生成的视频看起来像是机器人在做饭,尽管原始内容是人类。他们将 67.5 万帧人类视频转化为了“机器人化”的演示。
2. “学徒”(预训练)
现在,他们拥有了一个包含这些虚假机器人视频的巨大库。他们利用这些视频来训练机器人的“大脑”(视觉编码器)。
- 课程: 机器人的大脑学习观察场景,并仅通过观看这些编辑后的视频,预测机器人的夹爪下一步将移动到哪里。
- 类比: 这就像一名学生阅读了上千本关于厨师如何移动的故事书,即使该学生从未握过刀。他们正在学习动作的概念。
3. “导师”(协同训练)
机器人仍然需要学习其自身身体在现实世界中的具体物理特性。因此,研究人员收集了极少量的真实数据:仅50 个视频,记录了一台真实机器人在一个特定厨房中执行该任务的过程。
- 转折: 他们不仅仅是基于这 50 个真实视频进行训练,而是将这 50 个真实视频与数千个编辑后的人类视频同时用于训练。
- 原因: 如果仅基于这 50 个真实视频训练,机器人会过于僵化,无法在新的厨房中成功;如果仅基于人类视频训练,机器人就无法理解它自己的金属夹爪。通过同时做这两件事,机器人从人类那里学习烹饪的通用“流程”,并从 50 个真实示例中学习其自身身体的具体“手感”。
结果:任何厨房中的主厨
研究人员在机器人从未见过的全新厨房中,测试了这项技术在三个高难度任务(叠放锅具、刮土豆皮、清扫辣椒)上的表现。
- 竞争: 他们将这种方法与其他顶级 AI 模型进行了比较,这些模型要么直接从原始人类视频(未经编辑)中学习,要么从标准图像数据集中学习。
- 胜利: Masquerade 机器人的成功率比其他模型高出 5 到 6 倍。
- 关键发现: “魔法”不仅仅在于拥有更多数据,而在于编辑。当他们尝试使用未将人类手臂替换为机械臂的人类视频时,性能急剧下降。机器人需要在视频中看到自己(或自己的版本)才能有效学习。
总结
Masquerade 就像是给机器人一个“梦”,让它看到自己执行了数百万个它从未真正做过的任务。通过将人类视频数字编辑成看起来像机器人视频的样子,然后将这些视频与极少量的真实练习相结合,机器人学会了泛化。即使只基于 50 个真实示例进行训练,它也能走进一个全新的厨房并成功烹饪。
该论文并未声称:
- 它并未声称机器人是完美的;编辑并不总是 100% 准确(例如,如果手被锅挡住,机器人看起来可能会很奇怪)。
- 它并未声称这适用于所有类型的机器人(他们使用的是特定的双臂设置)。
- 它并未声称这解决了机器人移动的问题(实验中的机器人拥有固定的摄像头和底座)。
核心信息很简单:不要只是观看人类;编辑视频以展示机器人做同样事情时的样子,你会获得更好的结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。