← 最新论文
💻 computer science

Now You See That: Learning End-to-End Humanoid Locomotion from Raw Pixels

本文提出了一种端到端框架,用于实现鲁棒的基于视觉的人形机器人运动,该框架通过高保真深度仿真和行为蒸馏克服仿真到现实的差距,同时借助专门的奖励塑造和多网络学习实现多样化的地形适应。

原作者: Wandong Sun, Yongbo Su, Leoric Huang, Alex Zhang, Dwyane Wei, Mu San, Daniel Tian, Ellie Cao, Baoshi Cao, Yang Liu, Finn Yan, Ethan Xie, Zongwu Xie

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Wandong Sun, Yongbo Su, Leoric Huang, Alex Zhang, Dwyane Wei, Mu San, Daniel Tian, Ellie Cao, Baoshi Cao, Yang Liu, Finn Yan, Ethan Xie, Zongwu Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下教一个机器人像人类一样行走。这听起来很简单,但对于机器人而言,世界却是一个充满混乱信息的雷区。如果你给机器人一张完美的、计算机生成的地面地图,它可以轻松行走。但在现实世界中,它的“眼睛”(摄像头)却杂乱无章。它们会变得模糊,会遗漏某些区域,还会错误地报告物体的距离。

这篇题为《现在你看到了》的论文,讲述的是如何仅利用机器人杂乱无章的真实世界摄像头“眼睛”,教会人形机器人自信地行走,而无需完美的地图或人类的搀扶。

以下是他们是如何做到的,通过简单的类比来解释:

1. 问题:“完美学生”与“现实世界”

通常,机器人工程师会在视频游戏(仿真环境)中训练机器人,那里的世界是完美的。机器人学会在 pristine 的数字楼梯上行走。但当他们把那个机器人放到现实世界中时,它会绊倒并摔倒。为什么?因为真实的摄像头存在“故障”(噪声、图像中的空洞、不良光照),而这些是视频游戏中所没有的。

这就像在天气完美的飞行模拟器中训练一名飞行员,然后突然把他们扔进真正的暴风雨中。他们会惊慌失措,因为真实的暴风雨感觉截然不同。

2. 解决方案 A:“假故障”工厂

为了解决这个问题,研究人员在计算机内部构建了一个超逼真的“故障工厂”。

他们不再仅仅向机器人展示清晰的图像,而是故意破坏图像,使其看起来完全像廉价真实摄像头所看到的那样。他们添加了:

  • 空洞:就像摄像头无法看到无纹理的墙壁时那样(模拟“立体匹配伪影”)。
  • 噪点:就像电视雪花,随着距离变远而加剧。
  • 畸变:就像透过扭曲的哈哈镜看东西。

类比:想象你在学习开车。你的驾驶学校没有让你在完美、空旷的赛道上练习,而是让你坐在一辆挡风玻璃起雾、摄像头抖动、GPS 偶尔撒谎的车里。等到你参加真正的驾驶考试时,你已经精通了在任何混乱环境中驾驶。这就是这个“故障工厂”为机器人所做的一切。

3. 解决方案 B:“专业教练”团队

在平滑的山坡上行走与在陡峭的楼梯上行走不同,而跳过空隙又与这两者不同。单一的“教练”(标准的人工智能大脑)往往在试图同时学习所有这些不同技能时会感到困惑。这就像试图在一个小时内教会一个学生同时成为游泳运动员、攀岩者和马拉松选手。

研究人员给机器人配备了三位专业教练协同工作:

  • 教练 1:专攻楼梯和平台。
  • 教练 2:专攻跳过空隙。
  • 教练 3:专攻崎岖不平的岩石地面。

类比:机器人拥有的不是普通教师,而是一支“梦之队”。当机器人看到楼梯时,它听从教练 1 的指令;当它看到空隙时,它听从教练 2 的指令。这防止了机器人在应该“迈步”时却试图“跳跃”的困惑。

4. 解决方案 C:“师生”交接

机器人分两个阶段学习,就像一位大师厨师教导学徒。

  • 阶段 1(大师):机器人首先利用“上帝视角”(完美、干净的数据)学习行走。它确切地知道每一步的位置。这就是教师。
  • 阶段 2(学徒):然后,机器人必须仅利用杂乱、充满故障的摄像头图像来学习行走。这就是学生。

学生试图模仿教师的动作,但教师看着的是清晰的地图,而学生看着的是模糊的照片。为了帮助学生,研究人员添加了一条特殊规则:“即使画面模糊,你大脑中对地面的内在感知也必须与教师清晰的感知相匹配。”

类比:想象一位大师钢琴家(教师)完美地演奏一首曲子。学生(机器人)戴着播放噪点的降噪耳机。学生必须通过感受节奏和观察大师的手来学习演奏同一首曲子,忽略耳中的杂音。研究人员教会了机器人忽略杂音,专注于核心动作。

结果:机器人实际上做了什么?

研究人员在两种不同的人形机器人上测试了这一系统。它们不仅仅在平坦的地板上行走,还攻克了“跑酷”风格的挑战:

  • 长楼梯:上下行走长长的楼梯(双向)。
  • 高平台:踏上台阶登上高箱子。
  • 空隙:跳过地板上的宽洞。
  • 碎片:走过成堆的垃圾和崎岖的岩石。

结果:
机器人成功完成了98.9%的尝试。它行走平稳,没有摔倒,并且高效地利用了能量。最重要的是,它在离开计算机后无需任何人工调整就做到了这一点。它在“充满故障”的仿真环境中学习,并立即在现实世界中完美运行。

一个小局限

论文指出了其中一个特定的弱点:走下楼梯。
虽然机器人向上走楼梯时表现完美,但向下走时稍逊一筹。

  • 为什么? 当你向下走时,重力会将你向前拉。如果你犯了一个小错误,比向上走时更难恢复。此外,机器人的脚往往会遮挡住它向下看下一级的视线,使得“充满故障”的摄像头更加困惑。

总结

这篇论文提出了一种教机器人行走的新方法,通过:

  1. 在训练期间伪造现实世界的摄像头错误,以免机器人感到惊讶。
  2. 为不同类型的地形聘请专业教练。
  3. 使用师生系统,将知识从完美数据转移到杂乱数据。

其结果是一个机器人,它可以观察杂乱无章的真实世界环境,并像人类一样自信地走过楼梯、空隙和岩石。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →