← 最新论文
💻 computer science

Zero-shot Transfer of Reinforcement Learning Control Policies for the Swing-Up and Stabilization of a Cart-Pole System

本文通过结合带宽感知滤波、灵敏度引导的领域随机化以及线性课程学习调度,以确保鲁棒的能量注入与扰动抑制,展示了将强化学习策略从仿真环境到硬件端的倒立摆摆起与稳定控制实现成功的零样本迁移。

原作者: Nikki Xu, Hien Tran

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikki Xu, Hien Tran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人用手平衡一根扫帚。这就是“倒立摆”(Cart-Pole)问题:一个小车在轨道上前后移动,上面连接着一根可以转动的杆子。机器人有两个任务:

  1. 摆动上升(Swing-Up): 让杆子从垂直向下变为垂直向上。
  2. 稳定(Stabilization): 让它保持直立而不倒下。

北卡罗来纳州立大学的研究人员希望使用**强化学习(Reinforcement Learning, RL)**来教机器人完成这项任务。把强化学习想象成训练一只狗:你让狗尝试各种动作,如果它做得好,你就给它奖励(零食);如果它搞砸了,就没零食吃。最终,它会学会最棒的招式。

然而,有一个巨大的问题:“模拟到现实”的差距(Sim-to-Real Gap)
你可以在计算机模拟(就像玩电子游戏的世界)中完美地训练机器人,但当你把同一个“大脑”放入真实的机器人时,它往往会失败。为什么?因为现实世界有摩擦力、摇晃的传感器和不完美的电机,而这些是计算机模拟中没有考虑到的。这就像是在一个平静、完美的泳池里训练游泳者,然后突然把他们丢进波涛汹涌的大海;他们可能会溺水,因为环境完全不同。

问题所在:机器人把自己弄坏了

在开始阶段,研究人员尝试使用标准的计算机模拟来训练机器人摆动杆子上升。

  • 结果: 计算机认为机器人的表现非常出色。但当他们尝试在真实机器上运行时,机器人却变得疯狂。
  • 类比: 想象一个在电子游戏中学习驾驶的人。在游戏中,他可以瞬间将油门从 0 踩到底到 100。但在现实生活中,如果你这样做,轮胎会打滑,你会失去控制,甚至可能撞坏汽车。
  • 发生了什么: 计算机学到的“大脑”命令真实的电机在瞬间从全速前进切换到全速后退。这种剧烈的抖动震碎了小车的塑料轮子。机器人太“抖”了。

解决方案:三步走配方

为了解决这个问题,研究人员开发了一个特定的配方,让计算机训练出的“大脑”能够在无需额外调试的情况下直接在真实机器上运行(这被称为“零样本迁移/Zero-Shot Transfer”,意味着它可以像即插即用设备一样直接工作)。

1. “奶昔”过滤器(动作平滑化/Action Smoothing)

  • 问题: 计算机大脑给出的指令过于生硬且快速,就像每分钟 1000 拍的鼓点独奏。
  • 解决方法: 他们添加了一个“低通滤波器”。把这想象成机器人指令的奶昔搅拌机。如果大脑想要大喊“向左走!”然后紧接着“向右转!”,搅拌机会将这些指令平滑处理成“向左走,然后慢慢转向右边”。
  • 为什么重要: 这保护了物理轮子不被损坏,也防止了机器人因自身剧烈抖动而散架。

2. “辅助轮”(课程学习/Curriculum Learning)

  • 问题: 如果你立刻让学生参加一场很难的考试,他们可能会惊慌失措并失败。
  • 解决方法: 他们使用了“课程”。他们不是在一个完美、简单的世界里训练机器人,而是从一个稍微有点乱的世界开始,然后逐渐让这个世界变得越来越乱。
  • 类比: 这就像学骑自行车。你从有辅助轮的平地上开始。一旦你掌握了,就把轮子拆掉。然后你在小坡上练习。最后,你在颠簸的路上练习。通过这种方式,当机器人“毕业”时,它已经在模拟器中见过各种各样的“颠簸”,以至于现实世界对它来说变得很简单。

3. “针对性”随机化(敏感度引导的领域随机化/Sensitivity-Guided Domain Randomization)

  • 问题: 如果你尝试随机化所有变量(小车的重量、风力、摩擦力、天空的颜色),机器人会感到困惑并无法学习。
  • 解决方法: 研究人员进行了“敏感度分析”。这就像医生检查人体哪些部位对某种疾病最敏感。他们发现,机器人电机的三个特定部分(旋转部件的重量以及两个电学常数)才是真正起作用的关键。
  • 策略: 他们只在训练期间随机化这三个特定部分。他们没有乱动其他任何东西。这让训练保持了专注,同时也足够鲁棒,能够应对现实世界。

最终幕:交接

机器人有两个不同的“大脑”(策略):一个用于摆动上升,一个用于保持平衡。

  • 挑战: 你不能直接从“摆动上升大脑”切换到“平衡大脑”。如果在错误的时刻切换,杆子就会倒下。
  • 解决方案: 他们创建了“切换逻辑”。想象一个红绿灯。当杆子几乎垂直且小车处于正确位置时,“摆动上升大脑”会驾驶车辆,然后交通灯变绿,“平衡大脑”接管控制。他们确保了这个切换过程非常平滑(没有“颠簸”),这样机器人就不会受到惊吓。

结果

  • 有效的部分: “奶昔”过滤器(防止损坏)、针对性随机化(学习正确的知识)以及课程学习(循序渐进地学习)的结合,让机器人能够从悬挂状态过渡到站立状态并保持稳定。
  • 无效的部分: 如果他们随机化了太多的东西,或者没有使用过滤器,机器人即使在计算机里看起来很完美,在现实实验室里也会失败。
  • 核心启示: 你不能仅仅在完美的视频游戏中训练机器人,然后指望它能在混乱的现实世界中工作。你必须在学习过程中教会它如何处理“噪声”和“抖动”,并采用温和、循序渐进的方法。

简而言之,他们构建了一个机器人,通过在一个混乱的模拟教室里进行训练,通过平滑指令来防止它折断自己的腿,并让它在准备好之后才切换到“平衡模式”。并且,当他们在实验室打开电源时,它立即就能正常工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →