Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing
本文提出了一种生成框架,该框架通过双重对比目标解耦任务与具身表征,以从单个人类演示中合成连贯的机器人执行视频,从而在无需配对跨具身数据的情况下有效弥合分布差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想教一个机器人如何倒一杯水。最简单的方法是观看一段人类倒水的视频,然后说:“机器人,完全照那个人做的做。”
但这里有一个巨大的问题:人类和机器人的外观与运动方式截然不同。 人类拥有柔软、灵活的手指和可以向多个方向弯曲的手腕。而机器人可能拥有僵硬的金属爪,或者关节数量不同。如果你只是告诉机器人完全复制人类的动作,它很可能会打碎杯子或洒出水,因为它的“身体”(或具身形态)构建方式不同。
本文提出了一种巧妙的解决方案,利用一种新型视频编辑工具来弥合这种“身体鸿沟”。其工作原理通过简单的类比解释如下:
1. 问题:“纠缠”的食谱
将一段人类倒水的视频想象成一杯冰沙,其中的配料被彻底混合,无法分离。
- 配料 A: 任务(目标:“倒水”、水流的路径、被握持的物体)。
- 配料 B: 身体(人手的具体形状、人类皮肤的运动方式、人类独特的风格)。
旧方法试图从这杯冰沙中学习,但由于配料混合在一起,机器人不仅学到了任务,还学到了人类特定的手型。当机器人尝试执行时,它会感到困惑,因为它并没有人类的手。
2. 解决方案:“解耦”的厨师
作者创建了一个系统,其作用如同一个魔法厨房筛子。它将那杯混合的冰沙(人类视频)重新分离成两个独立的碗:
- 碗 1(任务): 仅包含动作的逻辑。“拿起杯子,倾斜它,倒满为止。”它不在乎手是人类还是机器人。
- 碗 2(身体): 仅包含特定演员(人手)的视觉风格。
该系统使用一种特殊的数学技巧(称为双对比学习),确保这两个碗不再混合。这就像训练一位厨师,严格区分“需要做什么”和“谁在做”。
3. 神奇组装:“适配器”
一旦系统将“任务”与“人类身体”分离,它就可以为机器人创建新视频。
- 它取任务碗(倒水的计划)。
- 它取一张机器人爪子的图片(新身体)。
- 它将两者输入到一个预训练的视频生成器(一个已经知道如何制作逼真视频的强大 AI)中。
结果呢?AI 生成了一段全新的视频,显示机器人执行与人类完全相同的任务,但其运动方式看起来符合机器人金属爪的自然特征。
4. 为什么这很重要
- 无需配对: 通常,要教机器人,你需要一段人类执行任务的视频,以及一段机器人执行相同任务的视频,两者并列展示。这极难收集。而该方法只需要一段人类视频和一张机器人的图片。其余部分由它自行推断。
- 逼真度: 论文表明,该方法生成的视频中,机器人看起来真正属于该场景,拥有正确的光照和运动,而不是简单地将机器人模型粘贴在人类视频之上(这看起来虚假且僵硬)。
- 更好的学习: 当他们使用这些生成的机器人视频来实际训练机器人控制器时,机器人学习得更快,错误更少,比直接从人类视频学习要好。
总结
本文介绍了一种充当运动通用翻译器的工具。它提取人类的动作,剥离人类身体部分,保留任务的“操作手册”,并将该操作手册重写为特定机器人身体的版本。这使得机器人能够从互联网上数十亿的人类视频中学习,而无需与人类训练者进行物理配对。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。