← 最新论文
💻 computer science

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

该论文介绍了 FetchMan,这是一个端到端的实机迁移(sim-to-real)流水线,它通过利用 Flow-GRPO 强化学习来优化策略,克服了合成行为克隆的性能限制,使 Unitree G1 人形机器人能够在未见场景下的位移操纵任务中实现 73.3% 的零样本成功率。

原作者: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

让机器人能够走进房间、发现特定物体并将其捡起的梦想,长期以来一直是机器人领域的一个核心目标。几十年来,研究人员一直致力于教机器这种复杂的行为,因为这需要两种困难的技能同时协作:在空间中移动身体,以及使用双手与世界进行交互。虽然机器人在独立行走方面已经做得相当出色,但要在双腿平衡的同时增加伸手抓取物品的能力,会产生极其复杂的物理混合效应,这在编程上是非常困难的。通过这种方式教导机器人所需的采集数据也是一个巨大的障碍;如果要求人类演示每一种走向碗并捡起它的行走方式,且要在每一种可能的房间里进行,这将耗费数年时间,并面临损坏机器人的风险。为了解决这个问题,科学家们转向了计算机模拟,创建了数字世界,让机器人在无需担心损坏的情况下进行数百万次的练习。然而,一个主要问题仍然存在:完全在数字世界中训练的机器人,真的能学会处理现实房屋中混乱且不可预测的现实情况吗?

加州大学洛杉矶分校的一支研究团队,与艾伦人工智能研究所及华盛顿大学的合作者们,利用一种名为 FetchMan 的新系统应对了这一挑战。他们的工作重点是一个名为 Unitree G1 的类人机器人,其外观和动作非常接近人类。该团队想要探究的是,是否可以通过在计算机模拟中向机器人展示数千个示例,从而教会它在房间内导航并抓取目标物体,并让它在无需进一步训练的情况下,在现实世界中完美地执行任务。他们发现,仅仅向机器人展示越来越多的任务示例是不够的。即使在超过 15 万个不同场景中进行了训练后,机器人的表现仍遇到了一个瓶颈。它能够模仿数字老师,但无法学会从行走过渡到伸手抓取时所需的微妙时机。机器人经常会过早尝试抓取物体,或者过早停止行走,其失败的原因在于它试图模仿一个使用了机器人无法看到的“秘密信息”的老师。

为了突破这一障碍,研究人员在训练过程中增加了第二个阶段。他们不再只是让机器人模仿数字老师,而是让机器人在模拟中自行练习,并且只有当机器人成功完成了从行走到达物体到捡起物体的整个任务时,才会给予奖励。这种方法使用了被称为“强化学习”的技术,使机器人能够自主摸索出正确的时机和动作。它学会了在伸手之前先走近物体,从而纠正了仅靠模仿时所犯的错误。当团队在现实世界中测试这款经过改进的机器人时,结果令人瞩目。尽管在训练期间从未见过真实的房间或真实的物体,该机器人仍能在陌生的空间内行走,识别出目标碗,并以超过 73% 的成功率将其抓取。这比最初的训练方法有了显著提升,因为最初的方法在现实世界测试中的成功率仅为 57% 左右。

研究人员还探索了这种方法是否可以适用于多种不同类型的物体,而不局限于碗。他们训练了一个版本的系统,通过将物体的名称作为提示,让机器人识别并捡起面包、瓶子和书本等物品。虽然这个多物体版本并没有单物体版本那样成功,但它仍然能够在各种情况下完成任务,证明了该方法是可以扩展的。这项研究强调,虽然模仿老师是一个良好的起点,但对于掌握复杂的物理任务而言,这还远远不够。机器人需要拥有探索并从自身的成功与失败中学习的自由,才能真正理解如何在这个世界上移动。通过将海量的模拟练习与最后的自我修正阶段相结合,该团队展示了一条清晰的路径,即创造能够适应新环境、而无需人类在每一步都进行手把手指导的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →