← 最新论文
🤖 machine learning

Evolutionary Bilevel Reward Shaping for Generalization in Reinforcement Learning

本文提出了通过进化奖励塑造实现泛化(GERS),这是一种双层优化框架,它通过使用 CMA-ES 根据仅有的标量验证反馈来优化奖励塑造参数,从而在受限场景下增强强化学习的泛化能力,进而通过无需获取验证环境轨迹访问权限的方式,超越标准基准线并达到领域随机化的性能水平。

原作者: Ekasit Usaratniwart, Xilin Gao, Marc Ong, Youhei Akimoto

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Ekasit Usaratniwart, Xilin Gao, Marc Ong, Youhei Akimoto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人走路。通常情况下,你在一个完美的、受控的健身房里教它:地板总是平整的,空气是静止的,机器人的腿部重量也恰到好处。机器人在这种健身房里学会了完美的行走。

但随后,你把机器人送到了现实世界。突然间,地板变得湿滑,风在吹,机器人的腿感觉变重了。因为机器人只学过“完美健身房”版本的行走方式,它立刻就摔倒了。它对健身房产生了过拟合(overfitted),并且未能实现向现实世界的泛化(generalize)

这篇论文介绍了一种名为 GERS(通过进化奖励塑造实现泛化)的新方法来解决这个问题,特别是在一种棘手的场景下:你无法看到机器人在现实世界中是如何失败的,你只能看到它失败了这一事实。

以下是使用简单类比进行的详细拆解:

1. 问题所在:“黑盒”验证器

在许多现实场景中(例如,在客户的私有网络上测试安全 AI),你拥有两种类型的环境:

  • 训练健身房(The Training Gym): 你对这里拥有完全的访问权限。你可以看到机器人的每一步动作、每一个错误以及生成的每一条日志。
  • 验证黑盒(The Validation Black Box): 你拥有其他一些环境(例如真实的客户网络),但出于隐私或安全原因,你无法看到机器人的具体步骤。你只能在最后看到一个数字:“它成功了吗?这是得分。”

标准的 AI 训练方法通常需要看到机器人在验证环境中的步骤(即“轨迹”)才能学习如何改进。由于你在黑盒中看不到步骤,标准方法会陷入停滞。它们无法从黑盒中学习,因此会不断对训练健身房产生过拟合。

2. 解决方案:“调节旋钮”(奖励塑造)

作者提出了一个聪明的变通方法。他们不再尝试直接利用黑盒分数来教机器人,而是决定调整游戏规则

把机器人的“奖励函数(Reward Function)”想象成一个正在打分的老师:

  • 标准老师: “如果你向前迈出腿,你得 1 分。”
  • 问题在于: 机器人学会了一种奇怪、抽搐的迈腿方式,这种方式能在健身房里拿到 1 分,但在现实世界中会失败。
  • GERS 老师: 系统会在评分系统中加入一个“调节旋钮”(在数学上是一个向量 ν\nu)。它稍微改变了规则:“如果你平稳地向前迈步,你得 1.5 分;如果你抽搐,你得 0 分。”

目标是找到这个调节旋钮的完美设置,使得机器人学到的行走风格不仅适用于健身房,也适用于黑盒环境。

3. 双层博弈(双层优化)

论文使用了一个“两层游戏”来寻找完美的调节旋钮:

  • 第一层(学生): 机器人(使用一种称为 PPO 的算法)尝试使用当前的调节旋钮设置,在训练健身房中学习如何行走。它学习的是一种策略(一组行走规则)。
  • 第二层(教练): 另一个算法(称为 CMA-ES,类似于进化生物学家)观察这个调节旋钮。它会问:“如果我们稍微改变这个旋钮,机器人在黑盒中的得分会更高吗?”
    • 教练并不关心机器人在黑盒中的具体步骤。它只关心最终的得分
    • 如果机器人在黑盒中获得了更高的分数,教练就会保留当前的调节旋钮设置。如果分数下降,教练就会再次改变旋钮。

教练会重复这个过程数千次,不断进化这个“调节旋钮”,直到找到一个版本,能够迫使机器人学习一种足够鲁棒(robust)的行走风格,使其即使从未真正见过黑盒环境,也能在黑盒中生存下来。

4. 结果:战胜挑战

作者在四个不同的机器人任务上测试了该方法(如平衡杆、跳跃、跑步和四足行走)。

  • 基准线(标准 AI): 仅在健身房中训练。它成为了健身房里的冠军,但一旦物理特性发生变化(例如腿部变重或地面变滑),它就会立即崩溃。
  • “领域随机化(Domain Randomization, DR)”方法: 这是目前的行业标准。它同时在许多个不同的健身房中训练机器人(模拟所有可能的现实情况)。它效果非常好,但是,它需要你能访问所有这些不同的健身房并看到机器人的所有步骤。
  • GERS(新方法): 它只拥有一个训练健身房和黑盒得分的访问权。
    • 结果: GERS 的表现几乎与“领域随机化”方法不相上下,尽管它拥有的信息要少得多。它仅通过“塑造”单个健身房中的奖励,就成功实现了向未见过的复杂环境的泛化。

总结类比

想象你正在训练一位厨师烹饪一道菜。

  • 标准训练: 你只允许他们在你自己的厨房里用你的炉灶烹饪。他们学会了完美地使用你的炉灶。当他们去另一家餐厅使用不同的炉灶时,食物就会烧焦。
  • 领域随机化: 你让他们在 100 个不同厨房里的 100 个不同炉灶上烹饪。他们学会了适应任何环境。(但这需要你能进入 100 个厨房)。
  • GERS: 你只允许他们在你的厨房里烹饪。然而,你有一个在另一家秘密餐厅里的“秘密品鉴员”。你看不见他们在秘密餐厅里是如何烹饪的,但你会得到一个分数:“美味”或“难吃”。
    • GERS 就像一个聪明的副厨,他会根据“秘密品鉴员”给出的分数来调整食谱指令(奖励塑造)。
    • 最终,食谱指令发生了足够的改变,使得厨师学会了即便在任何厨房里,也能做出美味佳肴,尽管他练习时始终只在你的厨房里。

论文证明了,你不一定需要看到机器人在现实世界中失败的每一个步骤;你只需要一种聪明的方法,根据最终结果来调整训练规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →