← 最新论文
🤖 machine learning

Learning Reach-Avoid Task with Reinforcement Learning: Vectorized Simulation and Benchmark

本文介绍了首个针对机械臂到达-规避任务的全面开源基准测试,通过使用向量化 MuJoCo 模拟来证明,尽管深度强化学习智能体在简化设置中能够取得较高的成功率,但其性能在现实且复杂的场景中会显著下降,这表明仍需进一步研究以稳健地解决这些任务。

原作者: Jonas Weihing, Shahram Eivazi

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Jonas Weihing, Shahram Eivazi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一只机械臂玩“给驴子贴尾巴”的游戏,但那头驴子在移动,房间里到处是家具,而且机械臂必须在不撞到自己手肘或撞倒花瓶的情况下完成任务。这就是深度强化学习 (Deep Reinforcement Learning, DRL) 在机器人领域的应用。把 DRL 想象成一位超级强大的电子游戏教练。你不需要为每一种可能的动作编写严格的规则手册,而是让机器人在计算机模拟中尝试数百万次动作。每当它发生碰撞时,它会得到一个“游戏结束”的提示,并从中学习什么是不该做的;每当它成功时,它会得到一次“击掌鼓励”(奖励)。随着时间的推移,机器人会学会一套复杂的动作舞步,以安全地达到目标。

科学家们一直提出的核心问题是:这只机器人能否在狭小、空旷的练习室里学会跳出一支完美的舞,然后立即在杂乱、拥挤的客厅里表演同样的舞蹈?多年来,研究人员一直在简化的、平坦的“桌面级”世界中测试机器人,那里的障碍物很少,机器人的动作也受到限制。但现实生活是混乱的,充满了自我碰撞(比如机器人的手肘撞到了自己的肩膀)和不可预测的障碍物。如果机器人只能在练习室里跳舞,那么它还没有准备好面对真实世界。这篇论文提出了疑问:我们最终能否打造出一个能够学习并应对其真实工作空间中完整且复杂性的机器人,还是说我们仍有很长的路要走?

这篇论文的大实验:荒野中的机器人

在这项研究中,研究人员构建了一个庞大、高速的数字游乐场来测试这一点。他们不仅仅是模拟一张小桌子;他们模拟了两个真实世界机器人——UR5eFranka Emika 机器人整个可达空间。他们使用了一个超快速的物理引擎 (MuJoCo MJX) 运行在单个图形卡上,这使得他们能够同时运行数千个机器人模拟。这就像是在一个数字健身房里,有一千个机器人在同时练习动作,并在眨眼之间从错误中学习。

他们设置了两个主要挑战:

  1. 到达任务 (The Reach Task): 机器人必须将手移动到特定的绿色目标点,同时不能撞到自己。
  2. 到达-避障任务 (The Reach-Avoid Task): 机器人必须到达同一个绿色目标点,但这一次,一个巨大的红色障碍物(一个球体)漂浮在路径中间,机器人必须在不发生碰撞的情况下躲避它。

他们的发现:“练习室”陷阱

结果既有“了不起的进展”,也有“等等看”的保留。

好消息: 机器人确实可以学会。当研究人员使用最佳设置时,机器人的表现非常出色。

  • 对于简单的到达任务,Franka 机器人的成功率达到了 98.8%,UR5e 的成功率达到了 96.1%
  • 对于更难的到达-避障任务(带有障碍物),Franka 依然实现了 95.2% 的成功率,而 UR5e 则达到了 86.8%

这些数字令人印象深刻,但论文揭示了一个关键的陷阱:机器人在哪里学习,比学习算法本身有多聪明更重要。

坏消息(“崩溃”现象):
研究人员测试了那些在小型、简单环境(例如以往研究中使用的微型“PandaGym”练习室)中进行训练,然后被投入到大型、杂乱的全尺寸工作空间的机器人。结果是:彻底失败。

  • 一个在微型练习室中训练并随后被测试在全尺寸工作空间中的机器人,成功率仅为 4%
  • 即使是一个在中型房间中训练的机器人,在移动到全尺寸工作空间时,成功率也降到了 64.5%

这就像是你教了一个学生在空旷的停车场里开车,然后突然把车钥匙交给他,让他去应对交通高峰期中混乱的城市。他僵住了。论文表明,以往声称机器人已经“解决”了这些任务的研究,可能只是解决了简化版的简单问题。一旦移除这些简化条件,机器人的表现往往会崩溃

秘诀:如何教导机器人

这篇论文并不仅仅是发现了问题,它还总结出了如何解决问题的方法,为这些机器人在现实世界中的训练提供了一份“速查表”:

  • 不要从小开始: 你不能在一个小盒子里训练机器人,然后期望它能在大房间里工作。机器人必须从第一天起就在全尺寸工作空间中进行训练。如果你在全尺寸空间中训练它,它可以轻松应对较小的空间。但反之则不然。
  • “稠密”奖励 (The "Dense" Reward): 过去,科学家认为只在机器人完成任务时给予奖励(“稀疏”奖励)是最好的。这篇论文发现,对于大型、复杂的房间,这种方法会失效,因为机器人永远无法获得足以学习的奖励。相反,给予机器人“稠密”奖励——即每当它靠近目标时就给予一点点赞扬——有助于它学得更快、更准确。
  • 相对运动 vs. 绝对运动: 论文测试了两种告诉机器人该做什么的方式。告诉它“将你的关节移动到精确的 45 度”(绝对运动)会让它变得抖动且容易撞到自己。而告诉它“在当前位置的基础上稍微移动一点”(相对运动)则会让机器人的动作更加平滑、精准,且不太可能撞到自己的身体。
  • 感知障碍物: 对于“到达-避障”任务,机器人需要知道其身体各部分距离障碍物有多远。当研究人员向机器人提供这种具体的距离信息时,它撞击障碍物的次数减少了近一半。

结论:尚未解决

作者们非常谨慎,并未宣布胜利。他们在模拟实验中取得了最先进的结果,到达任务的成功率在 96% 左右,避障任务的成功率在 87-95% 之间。然而,他们指出这些仍然是模拟实验。机器人尚未在真实的物理世界中接受测试,且模拟中的障碍物是简单的静态球体,而不是移动的人或移动的家具。

论文的结论是,虽然深度强化学习非常强大,但我们不能断言“到达-避障”问题已经得到了解决。在“能玩转简化版视频游戏的机器人”与“能应对杂乱现实厨房的机器人”之间,仍然存在着巨大的鸿沟。为了取得进步,研究人员不能再把机器人困在微小的、简单的盒子里,而必须开始在它们注定要栖身的完整且混乱的现实中进行训练。在此之前,这只机器人仍然只是一个表现优异、但尚未通过最终考试的学生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →