← 最新论文
💻 computer science

Phantom: Training Robots Without Robots Using Only Human Videos

本文提出了“幻影”(Phantom),这是一个可扩展框架,它仅通过人类视频演示,利用手部姿态估计和视觉域对齐将其转换为机器人兼容数据,从而实现通用操作机器人的零样本训练,在无需任何机器人数据或微调的情况下,于多样化任务中实现了高成功率。

原作者: Marion Lepert, Jiaying Fang, Jeannette Bohg

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Marion Lepert, Jiaying Fang, Jeannette Bohg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个机器人做家务,比如扫地或打结。通常,要教机器人,你必须物理握住它的机械臂,引导它重复动作数千次。这就像试图通过每天在街区推着孩子转上几个小时来教孩子骑自行车一样。这种方法既缓慢、昂贵,又难以适用于每一种可能的任务。

论文《Phantom》提出了一个巧妙的捷径:为什么不直接观察人类做家务,并假装机器人就是人类呢?

以下是他们如何利用简单的类比来实现这一点的:

1. “魔法照片编辑器”(数据编辑)

研究人员意识到,虽然互联网上有数百万人类做事的视频,但机器人无法直接“观看”它们。机器人感知世界的方式与人类不同;它拥有金属手臂和夹爪,而不是血肉之躯和手指。如果你用人类视频来训练机器人,机器人会感到困惑,因为“老师”看起来与“学生”毫无相似之处。

为了解决这个问题,作者构建了一个数字“魔法照片编辑器”。过程如下:

  • 第一步:橡皮擦。 他们选取一段人类伸手拿取物体的视频。利用人工智能,他们在数字层面上“擦除”人类的手臂和手,并填充背景,使其看起来手臂从未存在过。
  • 第二步:木偶师。 他们使用计算机程序精确计算出人类手部移动的位置。
  • 第三步:替换。 他们取一个机器人手臂的 3D 模型,将其“粘贴”到视频中,并使其按照人类手部移动的完全相同的方式进行移动。

结果是一段看起来像是机器人在执行任务的视频,但实际上是由人类拍摄的。他们称这种演示为“幻影”(Phantom)演示。

2. “机器中的幽灵”(零样本部署)

他们发现最令人惊讶的部分是,他们不需要向机器人展示任何一段它自己执行任务的真实视频。他们仅使用这些编辑过的“幻影”视频来训练机器人。

可以这样理解:如果你想学习打网球,你通常会观看职业选手。但如果你是一个身体结构不同的机器人,观看人类可能会令人困惑。这种方法就像拍摄一段人类网球选手的视频,在数字上将其身体替换为机器人的身体,然后让机器人通过观看这段编辑过的视频来学习打球。

当他们在真实机器人(具体为 Franka 和 Kinova 机器人)上测试时,机器人能够执行任务,无需任何预先练习或微调。这就像机器人走进房间,看到任务后,仅凭“学习”过编辑后的人类视频,就立即知道该做什么。

3. 机器人能做什么?

研究人员在各种棘手任务上测试了这种方法,证明即使环境杂乱或物体具有柔性,该方法依然有效:

  • 扫地: 移动扫帚将垃圾扫入簸箕(这涉及移动许多松散且会不可预测地弹跳的垃圾碎片)。
  • 打结: 将绳子系成特定的航海结(这非常困难,因为绳子柔软且形状多变)。
  • 堆叠: 小心地堆叠尺寸略有不同的杯子。
  • 旋转: 翻转一个盒子,而不是仅仅将其推倒。

在许多这些测试中,即使在机器人从未见过的房间里,机器人的成功率也高达92%。

4. 为什么这很重要(根据论文观点)

论文认为,这种方法消除了机器人学中最大的瓶颈:对昂贵机器人数据的需求。

  • 旧方法: 你需要一台机器人、一个实验室,以及一个人花费数小时遥操作(控制)机器人来收集数据。
  • 新方法(Phantom): 你只需要一台摄像机和一个人。你可以拍摄任何人在任何地方执行任务。计算机负责其余工作,将人类动作转化为机器人指令。

作者强调,这适用于“闭环”执行,意味着机器人可以实时对变化做出反应(例如,如果垃圾意外移动),而不仅仅是遵循预录制的脚本。

论文未声称的内容

重要的是要坚守论文实际所说的内容:

  • 他们没有声称这适用于每一种类型的机器人或每一种可能的任务。他们专注于人类可以使用“捏取”(用拇指和手指握住物体)的任务,这与他们使用的机器人夹爪相匹配。
  • 他们没有声称这是完美的。如果视频中人类的手被遮挡(occluded),计算机可能会错误地猜测手的位置,从而导致机器人困惑。
  • 他们没有声称这完全取代了对机器人的需求;仍然需要机器人来实际执行工作。他们只是消除了从机器人记录数据的需求。

简而言之,这篇论文提出了一种“幻影”方法,我们仅需使用人类视频即可训练机器人,通过在画面中将人类身体数字替换为机器人身体,使机器人能够在无需在实体机器人上进行物理演示的情况下学习复杂技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →