让机器人能够走进房间、发现特定物体并将其捡起的梦想,长期以来一直是机器人领域的一个核心目标。几十年来,研究人员一直致力于教机器这种复杂的行为,因为这需要两种困难的技能同时协作:在空间中移动身体,以及使用双手与世界进行交互。虽然机器人在独立行走方面已经做得相当出色,但要在双腿平衡的同时增加伸手抓取物品的能力,会产生极其复杂的物理混合效应,这在编程上是非常困难的。通过这种方式教导机器人所需的采集数据也是一个巨大的障碍;如果要求人类演示每一种走向碗并捡起它的行走方式,且要在每一种可能的房间里进行,这将耗费数年时间,并面临损坏机器人的风险。为了解决这个问题,科学家们转向了计算机模拟,创建了数字世界,让机器人在无需担心损坏的情况下进行数百万次的练习。然而,一个主要问题仍然存在:完全在数字世界中训练的机器人,真的能学会处理现实房屋中混乱且不可预测的现实情况吗?
加州大学洛杉矶分校的一支研究团队,与艾伦人工智能研究所及华盛顿大学的合作者们,利用一种名为 FetchMan 的新系统应对了这一挑战。他们的工作重点是一个名为 Unitree G1 的类人机器人,其外观和动作非常接近人类。该团队想要探究的是,是否可以通过在计算机模拟中向机器人展示数千个示例,从而教会它在房间内导航并抓取目标物体,并让它在无需进一步训练的情况下,在现实世界中完美地执行任务。他们发现,仅仅向机器人展示越来越多的任务示例是不够的。即使在超过 15 万个不同场景中进行了训练后,机器人的表现仍遇到了一个瓶颈。它能够模仿数字老师,但无法学会从行走过渡到伸手抓取时所需的微妙时机。机器人经常会过早尝试抓取物体,或者过早停止行走,其失败的原因在于它试图模仿一个使用了机器人无法看到的“秘密信息”的老师。
为了突破这一障碍,研究人员在训练过程中增加了第二个阶段。他们不再只是让机器人模仿数字老师,而是让机器人在模拟中自行练习,并且只有当机器人成功完成了从行走到达物体到捡起物体的整个任务时,才会给予奖励。这种方法使用了被称为“强化学习”的技术,使机器人能够自主摸索出正确的时机和动作。它学会了在伸手之前先走近物体,从而纠正了仅靠模仿时所犯的错误。当团队在现实世界中测试这款经过改进的机器人时,结果令人瞩目。尽管在训练期间从未见过真实的房间或真实的物体,该机器人仍能在陌生的空间内行走,识别出目标碗,并以超过 73% 的成功率将其抓取。这比最初的训练方法有了显著提升,因为最初的方法在现实世界测试中的成功率仅为 57% 左右。
研究人员还探索了这种方法是否可以适用于多种不同类型的物体,而不局限于碗。他们训练了一个版本的系统,通过将物体的名称作为提示,让机器人识别并捡起面包、瓶子和书本等物品。虽然这个多物体版本并没有单物体版本那样成功,但它仍然能够在各种情况下完成任务,证明了该方法是可以扩展的。这项研究强调,虽然模仿老师是一个良好的起点,但对于掌握复杂的物理任务而言,这还远远不够。机器人需要拥有探索并从自身的成功与失败中学习的自由,才能真正理解如何在这个世界上移动。通过将海量的模拟练习与最后的自我修正阶段相结合,该团队展示了一条清晰的路径,即创造能够适应新环境、而无需人类在每一步都进行手把手指导的机器人。
技术摘要:FetchMan
问题陈述
本文解决了训练**视觉类人机器人运动操作策略(visual humanoid loco-manipulation policies)的挑战,该策略能够在无需针对特定场景进行微调的情况下,泛化到新的场景和物体。虽然模拟已成为类人机器人运动控制(行走、平衡)的标准手段,但将这一技术扩展到运动操作(loco-manipulation,即在行走的同时抓取并移动物体)**仍然非常困难。主要的障碍包括:
- 数据稀缺性: 由于需要处理全身平衡恢复和安全监督,收集真实世界的类人机器人数据成本极高且风险巨大。
- 模拟局限性: 现有的模拟方法通常依赖于受限的视觉环境或复杂的对手编写的奖励函数。
- 模仿差距(The Imitation Gap): 通过在合成数据上进行行为克隆(BC)进行训练往往会遇到性能天花板。这是因为脚本化演示者(scripted demonstrators)中存在“特权信息”(例如隐藏的相位变量),而策略无法观测到这些信息,从而导致运动不连续,并且无法学习导航阶段与操作阶段之间的正确转换。
方法论
作者提出了 FetchMan,这是一个完全在模拟中训练并在真实的 Unitree G1 类人机器人上实现零样本部署的端到端端到端 sim-to-real 流水线。该方法由四个主要部分组成:
1. 数据生成 (FetchMan-Bench)
- 规模: 该流水线在通过 MolmoSpaces 生成的程序化室内场景及多样化物体中,生成了超过 150,000 个回合(episodes)。
- 脚本化演示者: 一个拥有特权信息的全身控制器 (πctrl) 利用隐藏状态(如物体位姿、占据网格、相位索引)来完成任务。它通过 A* 路径规划进行导航,并通过离散相位序列(接近、下降、闭合、抬起)进行操作。
- 领域随机化(Domain Randomization): 为了确保视觉泛化能力,每个回合都会对纹理、光照、相机内参/外参、表面高度和动作噪声进行独立的随机化处理。
- 回合混合: 数据集包含 80% 的“获取”(fetch)回合(导航 + 抓取)和 20% 的“仅拾取”(pick-only)回合(仅抓取),以随机化初始上半身配置。
2. 策略架构
- 观测值: 策略 (πθ) 接收一个头戴式鱼眼 RGB 图像、一个腕部 RGB 图像以及一个本体感受向量(基座高度、横滚/俯仰角、上半身关节位置、夹持器开合度)。
- 模型: 一个 Flow-Matching DiT (Diffusion Transformer) 架构。
- 视觉: 使用冻结的 DINOv3 ViT 主干网络来编码视觉输入。
- 动作头: Transformer 通过交叉注意力机制(cross-attends)对视觉和状态 token 进行处理,以预测一组 15 维的动作(基座速度、基座高度、腰部/手臂关节目标、夹持器开合度)。
- 控制接口: 策略输出由预训练的 SONIC 下半身控制器(用于平衡/行走)和 PD 控制器(用于上半身)追踪的高层指令,从而将动作空间从 2 维的 29 个关节力矩简化为 15 个有意义的指令。
3. 两阶段训练流水线
该训练通过特定的两阶段过程解决了模仿差距问题:
- 第一阶段:模仿预训练(行为克隆): 策略在 15 万个合成演示数据上进行训练。这为高维控制问题提供了强大的先验,但受限于演示者的隐藏相位结构。
- 第二阶段:Flow-GRPO 精炼: 为了突破性能天花板,使用 Flow-GRPO(针对流匹配策略调整后的组相对策略优化)对策略进行微调。
- 机制: 将多组环境重置为相同的任务。策略在注入噪声的情况下进行轨迹展开。优势(advantage)是基于组相对回报(成功 vs 失败)计算的,而不是基于学习到的价值函数。
- 奖励: 使用单一的稀疏奖励(成功获取为 1,否则为 0),避免了逐步的奖励塑造(reward shaping)。
- 结果: 这一阶段允许策略学习隐式的相位转换(即导航到操作的交接),而脚本化演示者此前依赖隐藏状态来管理这种转换,从而有效地“修复”了由 BC 留下的结构性缺陷。
4. 多物体扩展
该方案被扩展到了一个文本驱动的版本,以实现多物体泛化。该模型使用 dino.txt 主干网络将物体名称(如“碗”、“锅”)与视觉 token 联系起来,从而实现对多样化物体类别的零样本抓取。
关键结果
论文在 FetchMan-Bench(模拟基准测试)上评估了 FetchMan,并在真实的 Unitree G1 上进行了部署。
- 模仿天花板: 将行为克隆从 5k 扩展到 150k 个演示数据,虽然在模拟中的成功率(SR)从 40% 提升到了 67%,但性能在 67% 处饱和,证实了仅靠增加数据无法克服特权信息差距。
- RL 突破: 对 150k BC 检查点应用 Flow-GRPO,将模拟中的运动操作成功率提升至 83%。
- 零样本现实世界表现:
- 单物体: 最终模型在未见过的场景下,在真实的 Unitree G1 上实现了 73.3% 的运动操作成功率,且无需任何真实世界训练数据。
- 消融实验: 将 DINOv3 替换为 SigLIP,或使用绝对动作目标而非增量(delta)目标,会导致现实世界性能崩溃(运动操作成功率降至 0%),这凸显了几何特征和 delta-action 参数化的必要性。
- 多物体: 文本驱动的模型在模拟中达到 62% 的成功率(由于任务复杂度,低于单物体的 83%),并在真实机器人上展示了对各种物体(如锅、面包、瓶子)的成功零样本获取。
重要性与主张
本文声称提出了第一个用于视觉类人机器人运动操作的端到端 sim-to-real 流水线,该流水线可以在无需针对每个环境进行微调的情况下,在多样化场景中实现泛化。其重要性在于:
- 揭示了合成 BC 的局限性: 它通过实验证明,由于脚本化控制器中存在隐藏相位变量,仅靠扩展合成演示数据不足以解决运动操作问题。
- 验证了 Flow-GRPO 在类人机器人领域的有效性: 它证明了通过在组相对强化学习(group-relative RL)上对克隆策略进行精炼,并使用稀疏奖励,可以突破模仿天花板,使策略能够在模拟中完全学习复杂的相位转换(行走到抓取)。
- 可扩展的方案: 它提供了一个可复现的方案(MolmoSpaces + Flow-GRPO),可以从单物体扩展到多物体通用策略,向着在大规模数据下的任务通用型类人机器人迈出了“第一步”。
- 零样本部署: 它确立了只要训练流水线能正确处理模仿学习的结构性限制,仅使用模拟数据即可在真实硬件上实现高性能的运动操作。
作者保持了谦逊的态度,指出了目前的局限性,例如策略的无状态特性(无历史记录)、固定的下半身控制器(SONIC)以及目前仅限于获取(fetch)任务,并将更复杂的操纵和长程行为留作未来研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。