✨ 要点🔬 技术摘要
想象一下,你想教一个类人机器人(比如一个人形机器)在房间里走动、拿起一个橙子,然后把它放到盘子里。为了完成这个任务,机器人需要“学习”示例,就像学生向老师学习一样。
通常情况下,获取这些示例的唯一方法是让人类穿着一件特殊的套装,或者使用摇杆来物理引导机器人完成这项任务,并反复进行。这被称为遥操作(teleoperation) 。这种方式速度慢、成本高,而且会让操作的人感到精疲力竭。如果你想让机器人学习一项新任务,或者在不同的房间里工作,你就必须重新进行所有的人类引导过程。
斯坦福大学的这篇论文作者们构建了一个名为 LEGS (通过具身高斯泼溅实现的运动操控,Loco-manipulation via Embodied Gaussian Splatting)的新系统。你可以把 LEGS 想象成一个超逼真的视频游戏 ,它可以在不需要人类触碰任何控制器的的情况下,为机器人生成无限的训练数据。
以下是 LEGS 的工作原理,我将使用一些简单的类比:
1. “神奇背景” vs. “真实机器人”
想象一下你正在拍摄一部电影。
背景: 与其使用看起来很假的人造纸板搭建布景,该团队直接利用一段真实的房间视频,将其转化为一个 3D 照片马赛克 (称为 3D 高斯泼溅,3D Gaussian Splatting)。这个背景看起来极其真实,以至于如果你走进去,看起来会和现实世界一模一样。
前景: 机器人和物体(如橙子和盘子)则是数字化的 3D 模型。
诀窍: LEGS 将数字机器人放入这个真实的照片马赛克背景中。随后,它使用一种特殊的“色彩滤镜”,确保数字机器人的光影和颜色与真实背景完美匹配。这弥合了“虚拟”与“现实”之间的差距。
2. “幽灵导演”
在普通的视频游戏中,你需要按下按钮来控制角色移动。但在 LEGS 中,存在一位 幽灵导演 (程序化生成器)。
这位导演不需要人类告诉它做什么。它了解物理规则和目标(例如:“拿起橙子”)。
它会自动生成成千上万种机器人行走、抓取和放置物体的不同方式。
由于机器人的动作 是与背景 分开记录的,团队可以提取一组动作,然后只需在电脑上按一下按钮,就能瞬间将其“重新渲染”到完全不同的房间或使用不同的物体中(比如把橙子换成苹果)。
3. 结果:超越人类教师
团队在真实机器人(Unitree G1)上测试了三种不同类型的“大脑”软件(称为 VLA 模型)。他们将 LEGS 与另外两种方法进行了对比:
人类遥操作: 由人类引导机器人(昂贵且缓慢)。
传统模拟: 只有网格模型、看起来很假的视频游戏(仅基于网格的模拟)。
研究结果令人惊讶:
LEGS 击败了人类: 仅通过 LEGS 数据训练的机器人表现得同样出色,甚至比由人类引导训练的机器人表现更好。
LEGS 击败了虚假图形: 在“照片级逼真”的 LEGS 背景下训练的机器人,其成功率远高于在“卡通化”的传统模拟中训练的机器人。这证明了看到一个真实的物理世界有助于机器人更好地学习。
“魔法”般的适应能力: 当他们改变任务时(例如,“拿起苹果而不是橙子”或“移动到一个蓝色的桌子前”),经过 LEGS 训练的机器人可以通过重新渲染旧数据来实现即时适应。而人类训练的机器人则会彻底失败,因为它从未见过这些特定的物体。
核心结论
LEKS 就像是一个自动运行的机器人训练健身房 。
无需人类: 你不需要疲惫不堪的工人来引导机器人。
无限多样性: 你只需更改数字设置,就可以瞬间改变房间、家具或物体。
更便宜、更快: 与派人去实地记录相比,为新场景生成数据的成本和时间都极低。
论文得出结论:对于教导类人机器人行走和抓取物体而言,照片级逼真的模拟现在已成为现实世界人类训练的完美替代品。
技术摘要:LEGS —— 为人形机器人运动操作微调免遥操作的 VLA
问题陈述
为人形机器人运动操作(loco-manipulation)训练视觉-语言-动作(VLA)策略,目前受限于人类遥操作演示采集的高成本和高复杂性。现有方法面临显著的权衡:
遥操作(Teleoperation): 将数据采集与操作员的人力劳动和机器人运行时间绑定,由于疲劳问题导致扩展性差,且需要针对每个场景进行采集。
人类演示重定向(Human-Demo Retargeting): 虽然将机器人从循环中移除,但仍需要昂贵的、针对每个场景的以第一视角进行的人类捕捉。
模拟器鸿沟(Simulation Gaps): 传统的基于网格(mesh)的模拟器会引入视觉上的“模拟到现实(sim-to-real)”鸿沟。即使是使用 SAM3D 进行物体重建的流水线,也存在材质着色不匹配、简化光照和混叠问题,这些问题会使视觉编码器产生偏差,并阻碍向真实机器人的有效迁移。
核心挑战在于:如何在没有人类遥操作的情况下,生成高保真、带标签的运动操作数据,从而有效地微调预训练的 VLA 模型,实现向真实人形硬件的零样本(zero-shot)迁移。
方法论:LEGS 框架
作者提出了 LEGS (通过具身高斯泼溅实现的运动操作),这是一种混合模拟器,旨在弥合视觉上的模拟到现实鸿沟,并将运动生成与场景外观解耦。
1. 混合渲染架构
LEGS 将动态网格前景复合在静态、照片级真实的 3D 高斯泼溅(3DGS)背景之上:
背景(3DGS): 通过使用 COLMAP 和 3DGS 优化,从目标场景的短时长(1–2 分钟)手持视频中重建而成。这提供了新的视角,并将渲染误差最小化至与真实照片相当,从而有效地消除了静态环境中的视觉差距。
前景(Mesh): 由机器人(URDF)和可操作物体/道具(通过 SAM3D 从单张图像重建)组成。这些物体被渲染并进行深度复合,叠加在 3DGS 背景之上。
色彩校准: 为了使复合图像与部署端的摄像头对齐,LEGS 采用了确定性的两阶段校准:
逐网格缩放(R R R ): 在线性 RGB 空间中使用对角缩放,使每个网格的渲染均值与 SAM2 掩码内的手持扫描结果相匹配,从而修正 SAM3D 的反照率回归错误(例如,将褪色的灰色恢复为黑色)。
全局矩阵(M M M ): 通过在 ColorChecker 上进行最小二乘拟合得到一个 3 × 3 3\times3 3 × 3 色彩校正矩阵,将 3DGS 背景平移至部署端摄像头的色彩空间。
2. 物理与控制
物理后端: 使用 500 Hz 的 MuJoCo 在网格几何体上解析动力学,该过程独立于渲染管线。
控制器: 采用 SONIC ,一种经过强化学习训练的低层全身控制器。它接收一个 18 维指令流(6 维手腕 SE(3) 位姿 + 14 维上半身抓取/姿态 + 4 维底座指令)。该二进制文件在模拟器和真实机器人上运行一致,确保部署时无需更改策略。
3. 程序化数据生成
LEGS 使用程序化运动原语生成器取代了人类遥操作:
解耦: 运动被记录为独立于渲染输入的指令流。
原语(Primitives): 任务被分解为高层运动(行走、拾取、放置),由带有场景级参数(目标位姿、物体身份)的底层原语组成。
验证: 只有在通过验证检查时,回合(episodes)才会被保存。
重渲染: 由于运动与外观解耦,同一套数据集可以在新的背景、物体网格和相机条件下进行重渲染,其成本仅为 GPU 计算成本,无需重新采集运动数据。
核心贡献
免遥操作数据流水线: 一种程序化模拟器,可以在模拟器中完全生成带标签的运动操作数据,无需任何人类采集的演示(遥操作、种子演示或人类视频)。
用于迁移的照片级渲染: 证明了结合 3DGS 背景与网格前景以及色彩校准的方法,显著优于仅基于网格的基线,证明了照片级真实感是实现模拟到现实有效迁移的关键。
可扩展的增强方案: 一种大规模可并行的工作流,通过重渲染现有的运动数据来适应新的场景和物体。这使得适配新外观条件的边际成本从 >1.5 小时的人力劳动降低到约 0.1 小时的 GPU 时间。
广泛的真实机器人评估: 在 Unitree G1 机器人上,针对三个具有递增难度的任务,在三个最先进的 VLA 骨干网络(ψ 0 \psi_0 ψ 0 , π 0.5 \pi_{0.5} π 0.5 , GR00T N1.6)上进行了验证,总计 1,110 次试验。
实验结果
作者在 Unitree G1 上的三个拾取与放置任务上评估了 LEGS:
任务 1: 仅操作(无运动)。
任务 2: 运动操作(走向桌子,拾取,放置)。
任务 3: 复杂运动操作(行走,拾取,转向,走向矮桌,蹲下,放置)。
主要发现:
LEGS vs. 遥操作: 在所有任务和骨干网络中,纯粹基于 LEGS 数据(200 个回合)微调的策略表现与基于人类遥操作(50 个回合)微调的策略持平或更优。值得注意的是,在困难的任务 3 中,遥操作基线在所有骨干网络下的成功率都降至 0%,而 LEGS 实现了 2–6/10 的成功率。
LEGS vs. 仅网格基线: LEGS 显著优于缺乏 3DGS 背景和色彩校准的仅网格基线(SAM3D)。仅网格基线的平均成功率为 33%,而 LEGS 为 67%,且在近距离操作(拾取/放置)阶段,两者差距进一步扩大。
预算匹配: 即使在匹配的 50 个回合预算下,LEGS (50) 也匹配或超过了 Teleop (50),这证实了性能提升并非仅仅源于数据量。
对外观变化的适应性: 当测试分布外(OOD)的物体和场景变化(例如,将橙子换成苹果,将桌子换成蓝色桌子)时:
基于默认数据训练的基线(Teleop, SAM3D, LEGS)完全失败(成功率 0–1/10)。
LEGS-AUG ,通过将运动数据重渲染到新外观,保持了较高的成功率(在任务 1 上高达 100%),优于重渲染后的 SAM3D-AUG 基线。这证实了重渲染实现了适应性,而照片级真实感确保了准确性。
意义与主张
论文声称,照片级真实的渲染和程序化运动生成足以替代人形机器人的遥操作 ,用于数据采集步骤。
零样本迁移: LEGS 使微调后的预训练 VLA 模型能够实现向真实机器人的零样本迁移,表现优于使用真实世界遥操作数据训练的模型。
成本效率: 该方法将数据适配从一个受操作员限制的问题转变为一个受计算能力限制的问题,使适配新场景的成本比遥操作降低了 15 倍以上。
泛化性: 在三个不同 VLA 骨干网络上的成功表明,这种收益源于数据流水线本身,而非特定的模型架构。
作者承认存在局限性,包括对超出原始扫描分布的光照变化的敏感性、在高度反射/透明表面上的性能下降,以及对静态背景的假设。然而,他们得出结论,LEGS 为无需高昂真实世界数据采集成本的人形机器人运动操作策略训练提供了一条稳健且可扩展的路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。