← 最新论文
🤖 machine learning

Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying

本文介绍了 ReMax,这是一种将探索形式化为多次尝试中的期望最大回报的策略梯度目标函数,并由此开发出了 RePPO——一种通过利用连续重试参数来优化该目标,从而在无需显式奖励项的情况下实现有效且涌现式随机探索的 PPO 变体。

原作者: Soichiro Nishimori, Paavo Parmas, Sotetsu Koyamada, Tadashi Kozuno, Toshinori Kitamura, Shin Ishii, Yutaka Matsuo

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Soichiro Nishimori, Paavo Parmas, Sotetsu Koyamada, Tadashi Kozuno, Toshinori Kitamura, Shin Ishii, Yutaka Matsuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一次从未去过的城市里,寻找前往一家新咖啡馆的最佳路线。你手里有一张地图,但地图并不完整。

旧方法(标准强化学习 RL):
大多数强化学习(RL)智能体表现得像个焦虑的游客。它们尝试一条路径,得到一个坏结果,然后立即陷入恐慌。为了防止它们陷入停滞,研究人员通常会给它们一个“奖励”或“甜头”,仅仅是为了鼓励它们尝试新的、奇特的路径。这就像一位家长说:“如果你尝试不同的街道,我就给你一块饼干,”即便那条街可能通向死胡同。智能体之所以进行探索,是因为“饼干”,而不是因为它足够聪明。

新想法(ReMax):
这篇论文提出了一种不同的方法,叫做 ReMax。ReMax 不再是给智能体一个“饼干”来鼓励尝试新事物,而是改变了智能体对“成功”的理解方式。

其核心思想很简单:不要只根据一次尝试来评判你的决策;要根据你多次尝试中的“最佳”尝试来评判。

“重试”比喻

想象你正在参加一场多项选择题考试。

  • 标准强化学习: 你选了一个答案,然后就结束了。如果你选错了,你就得零分。因此你害怕猜测,只会选择那些你百分之百确定的答案(即便那个答案是错的)。
  • ReMax: 想象老师说:“你可以选一个答案,但如果你选错了,你有权最多重试 5 次。你的得分将基于这 5 次尝试中的最佳答案。”

突然间,策略发生了变化!

  • 如果你百分之百确定,你会每次都选那个答案。
  • 但如果你不确定(比如在两个选项之间犹豫不决),你不会只选一个并祈祷。你会分散赌注。你尝试一个选项,如果失败了,你就尝试另一个。因为你可以保留最好的结果,所以尝试一个冒险的选项变成了一个明智之举。你进行探索并不是因为“饼于”,而是因为重试让冒险的路径变得更安全。

论文中的实现方式

由 Soichiro Nishimori 和 Paavo Parmas 领导的作者们将这种“重试”直觉形式化为一个数学公式,称为 ReMax

  1. “M”因子: 他们引入了一个数字 M,代表你可以“重试”或采样动作的次数。

    • 如果 M = 1,就是旧方法:一次机会,一次得分。智能体会变得贪婪并停止探索。
    • 如果 M > 1,智能体会意识到,如果它尝试几种不同的事物,它可能会撞大运获得高奖励。这自然地鼓励了智能体去尝试不同的动作(探索),而不需要添加任何额外的“奖励”分数。
  2. “连续性”转折: 在现实世界中,你并不总是能精确地重试 2 次或 3 次。因此,他们将重试次数变成了一个平滑的刻度(连续数字 m)。

    • 调高刻度(更高的 m)会让智能体变得更具冒险精神,更愿意尝试奇特的事物。
    • 调低刻度(较低的 m)会让智能体变得更谨慎,专注于它已知的事物。
    • 这为 AI 提供了一个关于“好奇心”的精细控制旋钮。
  3. “RePPO”引擎: 为了在复杂的视频游戏(如 MinAtar 和 Craftax)中实现这一目标,他们构建了一个流行 AI 算法的新版本,并将其命名为 RePPO

    • RePPO 不再添加“好奇心奖励”(例如访问新地点时的虚假奖励),它只是针对“M 次尝试中的最佳结果”进行优化。
    • 结果: 在实验中,RePPO 学习玩游戏的效果优于标准方法。它能够自然地保持其“好奇心”(即选择的高随机性),而不需要依赖其他方法所依赖的额外“饼干”奖励。

核心结论

论文声称,探索不需要通过外部奖励来强迫。 如果你仅仅是将目标改为“在几次重试中实现你的最佳可能结果”,智能体会自然而然地发现,尝试不同的事物是获胜的最聪明方式。

这就像告诉一个孩子:“你不必第一次就做对;只要在几次尝试后展示出你的最佳尝试即可。”这个孩子自然会开始尝试用不同的方法来解决谜题,不是因为你贿赂了他们,而是因为游戏的规则让“实验”成为了获胜的策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →