想象一下你正在尝试教一个机器人如何做饭。你有两种类型的信息可用:
- 真实视频: 人类实际烹饪的录像,但你只有很少的几段,因为拍摄这些视频既昂贵又耗时。
- AI 生成视频: 一个计算机程序,它能根据人类的视频素材,生成成千上万段机器人烹饪的“假”视频。
问题所在:“虚假”视频陷阱
以往的方法试图利用这些假视频,让计算机去猜测机器人的电机在视频中究竟在做什么。这就像是在看一段车祸现场的电影,然后试图仅凭像素就猜出驾驶员踩刹车踏板时的确切压力。
本文作者认为这是一个坏主意。他们称之为**“非对称保留原则”(Asymmetric Preservation Principle)**。这里有一个类比:
- 几何结构(“在哪里”): 当 AI 生成一段视频时,它非常擅长模仿形状和运动。它知道机器人的手臂从杯子移动到了盘子。这种“空间地图”在生成过程中得以保留。
- 控制指令(“如何做”): AI 非常不擅长掌握实现该运动所需的精确电机指令(即具体的电信号)。这些细节在“假”视频中会丢失或失真。
如果你试图利用这些扭曲的电机猜测来教机器人的“肌肉记忆”(动作头),那你就是在教它用一个坏掉的方向盘来开车。
解决方案:GRA(几何引导的表示对齐)
作者提出了一种使用这些假视频的新方法,称为 GRA。可以将其想象为一个分工明确的两步走训练营:
眼睛(视觉骨干): 机器人的“眼睛”需要学习观察世界并理解物体的位置。GRA 利用成千上计的假视频来训练这双“眼睛”。它并不问:“是什么电机指令产生了这个动作?”相反,它问的是:“机器人的手下一步要去哪里?”它利用假视频来学习路径(几何结构),因为路径是可靠的。
- 类比: 这就像是利用地图来学习公路旅行的路线。地图(假视频)在展示转弯处和目的地方面是非常完美的。
双手(动作头): 机器人的“双手”需要学习精确的肌肉动作。GRA 仅使用拥有的少量真实视频来训练这部分。它忽略了假视频,专门用于这项任务。
- 类比: 这就像学习开车。你可以用地图来了解路线,但你只能通过在真实教练的指导下驾驶真实的汽车,来学习如何实际转向和踩踏板。
核心秘诀:“锚点”
在第二阶段(从真实视频中学习)的过程中,存在一个风险:机器人可能会忘记它从“地图”(假视频)中学到的知识,从而产生混乱。为了防止这种情况,GRA 保留了一个“安全线”或**“锚点”**。
即使在学习真实的电机指令时,机器人也会不断地被提醒它之前学到的几何路径。这保持了它的“空间理解力”敏锐度,并防止其陷入混乱。
实验结果
当他们在真实的机械臂上进行测试时:
- 旧方法(猜测电机): 机器人的失败率比仅使用少量真实视频时还要高。假数据实际上损害了性能。
- GRA(新方法): 机器人的表现明显优于“仅使用真实视频”组。它缩小了与那些看过四倍于自身真实视频数量的机器人的差距,而使用的真实数据量却完全相同。
总结
本文认为,在使用 AI 生成的视频训练机器人时,我们应该停止尝试去猜测那些在生成过程中丢失的、不可见的“电机指令”。相反,我们应该只利用假视频来教机器人去哪里(几何结构),并坚持使用真实数据来教它如何移动。通过正确地引导信息流,我们可以得到一个更聪明的机器人,且所需的真实数据更少。
技术摘要:监督存续之物:基于几何引导的 VLA 视频合成数据适配
1. 问题陈述
视觉-语言-动作(VLA)模型需要大规模的配对视频-动作数据来学习有效的机器人策略。然而,由于硬件成本、操作员培训和采集时间的高昂代价,现实世界的遥操作数据非常稀缺。虽然“人到机器人”的视频生成为合成机器人视频提供了一个可扩展的数据源,但现有的适配方法将这些生成的视频视为包含有效动作标签的数据。这些方法通常通过从合成像素中恢复“伪动作”(例如,通过逆动力学或几何重定向)并将其输入 VLA 的动作头。
作者认为这种方法造成了根本性的失配。视频生成优化的是视觉上的合理性(visual plausibility),而非物理控制律(physical control laws)。因此,虽然任务的几何结构(空间轨迹、物体排列)在生成过程中得以保留,但底层的控制信号(精确的电机指令)却丢失或产生了幻觉。强迫 VLA 将视觉上合理但物理上存在幻觉的像素映射到僵化的现实世界控制信号上,会降低策略性能。
2. 核心原则:非对称保留(Asymmetric Preservation)
本文提出了非对称保留原则,该原则指出在“人到机器人”的视频生成过程中:
- 几何结构得以存续: 空间结构(任务的“在哪里”)被可靠地转移了。
- 控制能力被抹除: 物理执行动力学(任务的“如何做”)并未得到保留。
基于此,作者提出了一个设计规则:监督应当遵循存续之物。 生成的视频应仅用于监督视觉感知(几何结构),而控制学习必须保持在真实的演示数据中。
3. 方法论:GRA(几何引导的表示对齐)
所提出的方法 GRA 通过一个将几何监督与动作学习解耦的两阶段训练协议来实现这一原则。
3.1 几何路标点推导
GRA 不从生成的像素中恢复动作,而是从源人类视频中推导几何监督目标:
- 提取: 在人类视频上使用姿态估计(HaMeR)、检测(Grounding DINO)和分割(SAM2)。
- 重定向与仿真: 将人类手部轨迹重定向到机器人的末端执行器(EE)坐标系,并在物理仿真器(MuJoCo)中进行回放,以强制执行关节限制和碰撞检测。
- 投影: 使用校准后的相机内参/外参,将仿真的 3D EE 轨迹投影到 2D 图像坐标中。
- 结果: 一组与生成的机器人帧在时间上对齐的未来 2D EE 路标点(yt),这些点源自可靠的人类源头,而非合成像素。
3.2 两阶段训练协议
第一阶段:几何预训练
- 输入: 生成的机器人帧(Its)。
- 目标: 训练视觉骨干网络(ϕv)和一个辅助 2D 头(h2D)来预测源自人类视频的未来 2D 路标点(yts)。
- 损失函数: L2Ds(预测路标点与推导路标点之间的 MSE)。
- 范围: 仅更新视觉骨干网络和 2D 头(通过 LoRA);语言模型和动作头保持不变。
第二阶段:带有空间锚点的动作微调
- 输入: 带有真实增量动作(Δat)的真实机器人演示帧(Itr)。
- 目标: 微调动作头(ϕa)以预测真实动作,同时保持第一阶段建立的几何对齐。
- 损失函数: L=Lact+λL2Dr。
- Lact:对真实增量动作的 L1 回归。
- L2Dr:第一阶段中相同的 2D 路标点损失,现在在真实帧上进行评估。
- 机制: 辅助头 h2D 起到了空间表示锚点的作用。它在动作微调期间持续存在,以防止视觉骨干网络为了追求动作预测特征而牺牲空间结构。
4. 核心贡献
- 非对称保留原则: 对合成数据中结构性差异的形式化描述,认为生成的视频是可靠的几何见证者,但却是不可靠的控制轨迹。
- 监督路由(GRA): 一种创新的架构,通过辅助 2D 头将人类衍生的几何路标点路由至 VLA 视觉骨干网络,同时将动作学习严格限制在真实演示数据中。
- 表示锚定: 证明了在动作微调期间,持久的空间损失可以防止几何感知表示的侵蚀,这对于维持策略的空间对齐至关重要。
5. 实验结果
实验在 7 自由度的 Franka Research 3 机器人上进行,涵盖三个取放任务(方块、杯子、芒果)。
- 设置: 与使用匹配数据预算(Nreal=25 真实演示 + Nsyn=75 生成视频)的基线进行对比。
- 基线: 仅真实数据(25 演示)、DreamGen 式(通过逆动力学获取伪动作)、MimicDreamer 式(通过重定向获取伪动作)。
- 上限参考: 仅真实数据(100 演示)。
- 性能表现:
- GRA 实现了 68.9% 的平均成功率,不仅超过了匹配预算的“仅真实数据”基线(61.1%,提升了 7.8%),也显著优于伪动作基线(48.9% 和 54.4%)。
- 伪动作基线的表现甚至差于“仅真实数据”基线,证实了合成控制信号会降低性能的假设。
- GRA 将其与 100 演示“仅真实数据”上限(75.6%)之间的差距,从 14.5 个百分点(仅 25 演示时)缩小到了 6.7 个百分点,尽管使用的真实演示数量仅为 1/4。
- 诊断分析:
- 信息非对称性: 探测显示,空间信息从合成数据向真实数据转移的效果远好于控制信息。
- 动作头质量: 与“仅真实数据”相比,GRA 减少了 17% 的单步位置漂移;与 MimicDreamer 式相比,减少了 30%。这表明几何预训练在不引入合成动作噪声的前提下,强化了空间感知。
6. 意义与局限性
意义:
本文证明,通过正确路由合成数据——即仅利用其可靠保留的部分(几何结构)——比尝试重建被抹除的控制信号能更有效地弥合生成视频与机器人策略之间的鸿沟。这种方法允许 VLA 模型利用可扩展的合成数据进行视觉对齐,同时保持从稀缺真实数据中学习到的控制保真度。
局限性:
- 上游问题: 这种非对称性目前是基于经验观察的;如何在不同生成器之间刻画这种不对称性,以及将“存续之物”扩展到几何之外,仍是开放性问题。
- 下游问题: 闭环性能仍受限于真实动作数据的规模。该方法并未消除对真实演示的需求,只是减少了有效适配所需的数量。未来的工作需要能够产生可靠控制信号的生成器或解码器。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。