← 最新论文
💻 computer science

Do as I Do: Dexterous Manipulation Data from Everyday Human Videos

本文提出了“Do as I Do”,这是一种能够从单目 RGB 人类视频中重建手物交互,并将其重定向为多指灵巧机器人手可执行动作的算法,有效地弥合了人到机器人的具身差距,从而实现大规模生成操控数据。

原作者: Bhawna Paliwal, Haritheja Etukuru, William Liang, Pieter Abbeel, Nur Muhammad Mahi Shafiullah, Jitendra Malik

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Bhawna Paliwal, Haritheja Etukuru, William Liang, Pieter Abbeel, Nur Muhammad Mahi Shafiullah, Jitendra Malik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个机器人完成一项精细的任务,比如打蛋液或钉钉子。传统上,你必须坐在机器人旁边,握着它的手,亲手引导它完成每一个动作。这既缓慢又昂贵,还需要人类专家来进行引导。

这篇论文介绍了一种名为 DO AS I DO 的新方法,它试图解决这个问题:让机器人通过仅仅观看人类完成这些日常任务的视频来学习。你可以把它想象成机器人在看一段 YouTube 教程,然后尝试靠自己模仿其中的动作。

以下是该系统的运作方式,通过两个简单的类比分为两个主要步骤:

第一步:“3D 侦探”(重建)

第一个挑战是,机器人正在观看的是一段平面的、2D 的视频(就像在手机上看视频一样),但它需要理解 3D 世界才能移动手指。视频可能会出现抖动、模糊,或者手部遮挡了物体。

  • 问题: 如果你只是看一段人拿着杯子的视频,计算机可能会对杯子有多大、离得有多远,或者手指是如何环绕在杯子上的感到困惑。
  • 解决方案: 作者构建了一个“3D 侦探”系统。它观察平面的视频,并利用先进的 AI 来推测手部和物体的 3D 形状,以及它们随时间变化的运动方式。
  • 窍门: 为了防止物体在移动过程中发生“漂移”或形状怪异的变化,系统会选取一个清晰的帧来锁定物体的形状(就像给杯子拍一张完美的照片),然后仅仅追踪这个固定形状在视频其余部分中的移动。这就像是在视频上贴了一张物体的贴纸,然后只是观察这张贴纸如何移动,而不是每一秒都试图重新绘制物体。

第二步:“身体翻译官”(重定向)

一旦系统知道了人类手部在 3D 空间中的动作,它就必须将这些动作转换到机器人身上。但问题在于:人类的手和机器人的手构造不同。

  • 问题: 人类拥有修长且灵活的手指和皮肤;而机器人的手可能拥有较短、较硬的金属手指。如果你直接把人类的手指角度复制给机器人,机器人可能会以一种会导致自身手指损坏或掉落杯子的方式去抓取杯子,因为它不理解物理规律(如重力或摩擦力)。
  • 解决方案: 该系统充当了一个不仅仅是复制单词,而是翻译动作意图翻译官
    • “热身”窍门: 在机器人尝试抓取物体之前,它会在模拟器中进行一次“热身”,练习在半空中握住物体。这有助于机器人找到一个稳定的起始位置,这样在真正的动作开始时,它不会立即掉落物品。
    • “摇晃”窍门: 为了确保机器人的鲁棒性(稳健性),系统在练习过程中会模拟微小的、随机的碰撞或推力。这就像通过轻轻推搡一个孩子来教他们如何骑自行车平衡一样;这迫使机器人学习一种即使在环境稍显混乱的情况下也不会失败的抓握方式。
    • “过渡”检查: 系统会专门检查机器人从“静止”切换到“抓握”的时刻。如果机器人尝试拿起物体却未能实现接触,系统会施加惩罚,从而确保机器人是真的在“抓取”物体,而不仅仅是在物体附近挥动。

他们取得了什么成就?

团队在一个庞大的互联网视频库上测试了该方法,包括:

  • 人们拿着相机拍摄的视频(第一视角)。
  • 旁观者拍摄的视频(第三视角)。
  • AI 生成的视频。

他们发现,他们的这种方法在确定 3D 手部动作方面比之前的工具更出色。更重要的是,他们成功地将这些重建的动作应用到了真实的物理机器人手上(一个拥有 22 个活动部件的灵巧手)。机器人可以仅通过观看视频,就成功完成诸如打蛋液、倒水、除尘和拿起物体等任务。

“现实检查”(局限性)

作者诚实地说明了该系统目前无法做到的事情:

  • 它假设物体是坚硬且刚性的(它在处理像面团或布料之类的柔软物体时会遇到困难)。
  • 它只关注手部和物体,忽略了房间的其他部分。如果桌子挡住了路径,除非视频清晰展示了碰撞过程,否则机器人可能不知道要避开桌子。
  • 它依赖于物理模拟器的准确性;如果模拟器稍有偏差,真实的机器人可能会遇到困难。

核心结论

DO AS I DO 是一个将“观看”转化为“行动”的流程。它获取一段杂乱的日常视频,重建动作的 3D 物理特性,将其翻译到机器人的特定身体结构上,并生成一套真实的机器人可以遵循的指令,从而执行灵巧的任务。这是迈向让机器人从互联网现有的海量人类视频中学习,而不是需要人类手动教导每一个动作的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →