← 最新论文
🤖 machine learning

Proximal Policy Optimization with Evolutionary Mutations

本文介绍了 POEM,一种通过集成由停滞检测触发的自适应进化突变来增强近端策略优化(PPO)的新型强化学习算法,该算法在四个测试的 OpenAI Gym 环境中的三个环境中,实现了相对于标准 PPO 在统计学上显著的性能提升。

原作者: Casimir Czworkowski, Stephen Hornish, Alhassan S. Yasin

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Casimir Czworkowski, Stephen Hornish, Alhassan S. Yasin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人开车、走钢丝或者让太空船着陆。你使用了一种名为 PPO(近端策略优化)的智能学习系统。你可以把 PPO 想象成一个非常谨慎、小心翼翼的学生。它通过对行为进行微小且安全的调整来进行学习。如果它尝试了新事物并得到了糟糕的结果,它会立即退缩回来。

问题:“舒适区”陷阱
论文解释说,虽然 PPO 很稳定,但它有一个缺陷:它会陷入“舒适区”。因为它太害怕犯大错,所以过早地停止了尝试新事物。它满足于一个“足够好”的方案,而从未发现那个“完美”的方案。这就像一个司机学会了在直路上慢速驾驶,但从未学会如何快速过弯,导致每次尝试赛车时都会撞车。

解决方案:POEM(“进化型”学生)
作者创建了一个新版本,叫做 POEM(带有进化突变的近端策略优化)。他们给了这个学生一个特殊的“唤醒机制”,其灵感来源于自然界中物种进化的方式。

以下是 POEM 的工作原理,使用一个简单的类比:

  1. 记忆手册: POEM 保留了一本记录了它近期所学一切的“记忆手册”(它过去自我的移动平均值)。
  2. 无聊度计: 每隔一段时间,它会检查:“我现在的表现和刚才相比有什么不同吗?”它使用一种叫做 KL 散度 的数学工具来衡量这一点。
    • 如果数值很高,意味着机器人在尝试新事物。这很好!
    • 如果数值很低,意味着机器人陷入了循环,一直在重复做完全相同的事情。它感到无聊且停滞不前。
  3. “进化式”跳跃: 当机器人卡住时(无聊度计归零),POEM 会触发一次突变。想象一下机器人突然剧烈抖动全身,或者随机调整大脑的设置。它强迫自己去尝试一个完全不同的、略带混乱的动作。
    • 如果这次随机跳跃效果更好,机器人就会保留它。
    • 如果失败了,机器人就会回到谨慎的状态。

实验:四项挑战
研究人员在四个类似电子游戏的场景中,将这个新的 “POEM” 机器人与旧的 “PPO” 机器人进行了对比测试:

  • 赛车游戏: PPO 机器人在转弯时总是卡住并撞车。而 POEM 机器人凭借其“震荡调整”,学会了平滑地导航赛道,并几乎完成了每一场比赛。
  • 山地车(Mountain Car): PPO 机器人无法积累足够的动力来冲出山谷。而 POEM 机器人学会了通过前后摇摆来逃离。
  • 双足行走机器人(Bipedal Walker): PPO 机器人不断摔倒。而 POEM 机器人学会了稳健行走并完成全程。
  • 月球着陆器(Lunar Lander): 这是一个难点。两个机器人表现都不错,但 POEM 平均而言略胜一筹。有趣的是,POEM 通过提前俯冲并在接近地面时修正航向来实现着陆,而 PPO 则是在高处盘旋,这有时会导致它耗尽燃料并坠毁。

结果
论文声称,在四个游戏中,POEM 以明显的优势赢得了其中的三个。它证明了通过在机器人变得过于舒适时偶尔强迫它“打破常规”,可以帮助它找到更好的解决方案,同时不会失去让 PPO 如此受欢迎的稳定性。

简而言之
POEM 就像一位老师在告诉学生:“你用同样的方法做同一个作业题已经一个小时了。你不再进步了。停下来,深呼吸,尝试用一种完全不同的、奇特的思维方式来解决它。如果奏效了,太棒了;如果不行,就回到你原来的方法。” 这个简单的技巧帮助 AI 逃离了局部陷阱,并学得更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →