✨ 要点🔬 技术摘要
想象一下,你想教一个机器人完成一项精细的任务,比如打蛋液或钉钉子。传统上,你必须坐在机器人旁边,握着它的手,亲手引导它完成每一个动作。这既缓慢又昂贵,还需要人类专家来进行引导。
这篇论文介绍了一种名为 DO AS I DO 的新方法,它试图解决这个问题:让机器人通过仅仅观看 人类完成这些日常任务的视频来学习。你可以把它想象成机器人在看一段 YouTube 教程,然后尝试靠自己模仿其中的动作。
以下是该系统的运作方式,通过两个简单的类比分为两个主要步骤:
第一步:“3D 侦探”(重建)
第一个挑战是,机器人正在观看的是一段平面的、2D 的视频(就像在手机上看视频一样),但它需要理解 3D 世界才能移动手指。视频可能会出现抖动、模糊,或者手部遮挡了物体。
问题: 如果你只是看一段人拿着杯子的视频,计算机可能会对杯子有多大、离得有多远,或者手指是如何环绕在杯子上的感到困惑。
解决方案: 作者构建了一个“3D 侦探”系统。它观察平面的视频,并利用先进的 AI 来推测手部和物体的 3D 形状,以及它们随时间变化的运动方式。
窍门: 为了防止物体在移动过程中发生“漂移”或形状怪异的变化,系统会选取一个清晰的帧来锁定物体的形状(就像给杯子拍一张完美的照片),然后仅仅追踪这个固定形状在视频其余部分中的移动。这就像是在视频上贴了一张物体的贴纸,然后只是观察这张贴纸如何移动,而不是每一秒都试图重新绘制物体。
第二步:“身体翻译官”(重定向)
一旦系统知道了人类手部在 3D 空间中的动作,它就必须将这些动作转换到机器人身上。但问题在于:人类的手和机器人的手构造不同。
问题: 人类拥有修长且灵活的手指和皮肤;而机器人的手可能拥有较短、较硬的金属手指。如果你直接把人类的手指角度复制给机器人,机器人可能会以一种会导致自身手指损坏或掉落杯子的方式去抓取杯子,因为它不理解物理规律(如重力或摩擦力)。
解决方案: 该系统充当了一个不仅仅是复制单词,而是翻译动作意图 的翻译官 。
“热身”窍门: 在机器人尝试抓取物体之前,它会在模拟器中进行一次“热身”,练习在半空中握住物体。这有助于机器人找到一个稳定的起始位置,这样在真正的动作开始时,它不会立即掉落物品。
“摇晃”窍门: 为了确保机器人的鲁棒性(稳健性),系统在练习过程中会模拟微小的、随机的碰撞或推力。这就像通过轻轻推搡一个孩子来教他们如何骑自行车平衡一样;这迫使机器人学习一种即使在环境稍显混乱的情况下也不会失败的抓握方式。
“过渡”检查: 系统会专门检查机器人从“静止”切换到“抓握”的时刻。如果机器人尝试拿起物体却未能实现接触,系统会施加惩罚,从而确保机器人是真的在“抓取”物体,而不仅仅是在物体附近挥动。
他们取得了什么成就?
团队在一个庞大的互联网视频库上测试了该方法,包括:
人们拿着相机拍摄的视频(第一视角)。
旁观者拍摄的视频(第三视角)。
AI 生成的视频。
他们发现,他们的这种方法在确定 3D 手部动作方面比之前的工具更出色。更重要的是,他们成功地将这些重建的动作应用到了真实的物理机器人手上(一个拥有 22 个活动部件的灵巧手)。机器人可以仅通过观看视频,就成功完成诸如打蛋液、倒水、除尘和拿起物体 等任务。
“现实检查”(局限性)
作者诚实地说明了该系统目前无法 做到的事情:
它假设物体是坚硬且刚性的(它在处理像面团或布料之类的柔软物体时会遇到困难)。
它只关注手部和物体,忽略了房间的其他部分。如果桌子挡住了路径,除非视频清晰展示了碰撞过程,否则机器人可能不知道要避开桌子。
它依赖于物理模拟器的准确性;如果模拟器稍有偏差,真实的机器人可能会遇到困难。
核心结论
DO AS I DO 是一个将“观看”转化为“行动”的流程。它获取一段杂乱的日常视频,重建动作的 3D 物理特性,将其翻译到机器人的特定身体结构上,并生成一套真实的机器人可以遵循的指令,从而执行灵巧的任务。这是迈向让机器人从互联网现有的海量人类视频中学习,而不是需要人类手动教导每一个动作的重要一步。
技术摘要:DO AS I DO
问题陈述
机器人学习领域面临着一个关键瓶颈:灵巧操作(dexterous manipulation)经验数据的匮乏,特别是在多指机器人手上。虽然观测数据(人类执行任务的单目 RGB 视频)非常丰富,但将这种“观察”数据转化为机器人的“执行”数据却受到两个主要挑战的阻碍:
手物交互估计(Hand-Object Interaction Estimation): 从嘈杂、自然场景下的单目 RGB 视频中准确重建 3D 手部与物体的交互是非常困难的。现有方法在处理运动模糊、遮挡或处理多样化、非结构化物体时往往表现不佳。
具身差异与重定向(Embodiment Gap and Retargeting): 即便有了重建的人类轨迹,将其映射到形态迥异(手指长度、关节结构不同)的机器人上也并非易事。先前的重定向方法通常依赖于忽略物理特性的运动学求解器(导致穿透或不稳定),或者需要干净的、带有地面真值(ground-truth)的参考数据(例如动作捕捉),而这在互联网规模的视频中是无法获取的。
本文提出了一个问题:如何能够在不对行为、物体类别或数据模态做严格假设的情况下,缩小观测人类数据与经验机器人数据之间的差距?
方法论:DO AS I DO
作者提出了 DO AS I DO ,这是一个两阶段流水线,旨在从单目 RGB 视频中重建手物交互,并将其重定向为符合物理规律的机器人动作。
1. 重建(手物追踪)
第一阶段旨在从单视图视频中恢复手部和物体的连贯 4D(3D + 时间)轨迹。
手部追踪: 系统利用 HaWoR [45],一种鲁棒的世界空间手部运动重建模型,来追踪人类手部。
通过引导扩散进行物体追踪: 对于物体,作者改编了图像转 3D 的生成式基础模型 SAM 3D [11]。由于 SAM 3D 在每一帧生成的网格是独立的(缺乏时间连贯性),作者引入了一种**引导扩散(Guided Diffusion)**追踪机制:
他们在锚点帧固定物体的形状 x ˉ s \bar{x}_s x ˉ s 。
对于后续帧,他们通过在固定的形状和前一帧的姿态 x k − 1 p x^p_{k-1} x k − 1 p 条件下采样姿态 x k p x^p_k x k p 。
这是通过修改流匹配(flow-matching)推理过程(公式 1)实现的,利用自适应引导参数将模型的去噪更新与目标插值(固定形状和前一帧姿态)进行融合。
自适应引导(Adaptive Guidance): 姿态引导强度 α p \alpha_p α p 是根据物体估计的旋转速度(使用 2D 点追踪)动态推导的,从而防止过度僵硬或产生错误的翻转。
采样与选择: 为了处理扩散过程的随机性,系统在每一帧采样 N N N 个候选姿态,并使用基于聚类的启发式方法在加权 SE(3) 距离上进行选择,而不是使用计算量巨大的对数密度排名。
对齐(Alignment): 将独立重建的手部和物体(它们可能处于不同的尺度)对齐到一个接近度量空间的坐标系中。物体的平移相对于手部质心根据 MoGe [10] 提供的深度信息进行缩放,且轨迹通过 GeoCalib [68] 与重力方向对齐。
2. 重定向(感知动力学的优化)
第二阶段使用基于采样优化(类似 MPPI 的方式)在物理模拟器(MuJoCo Warp)中,将重建的人类轨迹映射到灵巧机器人手(Sharpa Wave)和机械臂(UR3e)上。
预热步骤(Warmup Steps): 为了解决初始帧噪声可能导致机器人处于不可恢复状态(例如立即掉落物体)的问题,系统增加了 H H H 个“预热”步骤。在此阶段,物体被固定在原处(例如悬在半空中),而机器人手则自由移动以在开始追踪之前找到稳定的抓握姿态。
随机力扰动(Random Force Perturbation): 为了增强对局部极小值和不稳定交互(例如仅靠指尖平衡)的鲁棒性,优化过程中引入了随机力和力矩。这鼓励生成对微小扰动具有鲁棒性的控制策略。
转换奖励(Transition Reward): 为了处理“静止”与“手内操作”状态之间的离散性质,系统增加了一个针对失败转换的惩罚项(例如在“手内操作”阶段缺乏手-物接触,或在“静止”阶段缺乏物体-地面接触)。
核心贡献
算法: 引入了 DO AS I DO ,这是一个能够将任意单目 RGB 视频中的行为重建并重定向到多指灵巧手的流水线,且无需假设特定的物体类别或抓握先验。
重建 SOTA: 其手物重建过程在标准基准测试(DexYCB, HOI4D)上优于现有的 SOTA 方法,并能处理多样化、嘈杂的自然场景视频(第一视角和第三视角)。
鲁棒重定向: 其感知动力学的重定向过程通过引入预热步骤、力扰动和转换奖励,改进了现有的可扩展技术,能够有效处理带有噪声的重建参考。
现实世界流水线: 这是第一个能够直接从互联网视频生成真实世界灵巧手执行过程的流水线,并在双臂机器人设置上进行了验证。
实验结果
重建: 在 DexYCB 和 HOI4D 数据集上,DO AS I DO 在 F-score (F-5, F-10) 和 Chamfer Distance (CD) 上达到了新的 SOTA 水平,超越了联合重建方法(如 MCC-HO, G-HOP)和物体追踪器(FoundationPose, Any6D)。
自然场景评估: 在 150 个互联网视频的基准测试中,人类评分者在 67% 的案例中认为 DO AS I DO 的物体追踪效果优于 FoundationPose。从定性上看,该方法在运动模糊或遮挡时仍能保持时间上的连贯性,而基准方法则会丢失物体。
重定向: 在重建的自然场景数据集上,该方法实现了 71% 的成功率,相比于基准 Annealed Sampling 方法(25%)有显著提升。“预热(Warmup)”组件被认为是主要的差异化因素。在高质量的 OakInk2 MoCap 数据集上,成功率从 72%(基准)提升至 81% ,证明了该方法即使在拥有高质量参考数据时的有效性。
部署: 该系统在真实的双手机器人设置上成功执行了 10 种不同的任务(如搅拌、倾倒、锤击)。
重要性与主张
论文声称 DO AS I DO 弥合了灵巧操作中观测数据与经验数据之间的鸿沟。通过利用 3D 计算机视觉(用于深度和 3D 生成的基础模型)和 GPU 加速的物理模拟,作者证明了通过仅仅观察人类,就可以实现机器人数据收集的规模化。
作者将这项工作定位为使人类视频成为机器人学习领域“一等公民”的一步。他们为从业者提供了一套“效能手册(efficacy playbook)”,强调原始互联网数据需要经过大量的过滤(在他们的分析中,只有约 4-5% 的采样片段被认为是有效的),但剩余的数据对于学习复杂的操控技能具有极高的价值。
承认的局限性: 该方法假设物体是刚性的,并且依赖于半准确的度量深度预测。它在处理模糊的手物距离(区分接触与遮挡)方面存在困难,并且没有对完整的场景约束(障碍物、其他物体)进行推理,而是仅关注手部和单个目标物体。此外,真实世界性能的保真度受限于物理模拟器的近似程度。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。