← 最新论文
🤖 AI

Retry Policy Gradients in Continuous Action Spaces

本文通过引入路径导数估计器,将基于重试的 ReMax 目标函数扩展到了连续动作空间,从而得出了 ReMAC 算法,该算法通过重塑策略梯度景观,在无需显式熵正则化的情况下促进了随机探索,并实现了与 SAC 相当的性能。

原作者: Soichiro Nishimori, Paavo Parmas

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Soichiro Nishimori, Paavo Parmas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人走路穿过房间。这个机器人被蒙上了眼睛,只能靠猜测来决定下一步往哪走。在人工智能领域,这被称为强化学习(Reinforcement Learning)。机器人尝试不同的动作,如果做得好就会得到一个“分数”(奖励),并从错误中学习。

这里有一个巨大的问题:探索(Exploration)。如何让机器人去尝试事物,而不是仅仅重复那些安全、枯燥的步骤?

旧方法:添加“噪声”

传统上,为了让机器人进行探索,科学家会在它的脑中加入一点“噪声”或随机性。这就像是在告诉机器人:“嘿,有时候就随机扭动一下你的腿!”这确实有效,但就像是在做菜时加入一种你必须仔细测量并在最后将其去除的香料,否则菜的味道会变得很奇怪。

新思路:“重试”策略

这篇论文介绍了一种教导机器人的新方法,叫做 ReMax(意为“重试最大化”,Retry Maximum)。

与其告诉机器人要保持随机,ReMax 改变了游戏的规则。想象一下你在参加考试:

  • 旧方法: 你只有一次回答问题的机会。你选出你认为最好的答案,那就是你的得分。
  • ReMax 方法: 对于同一个问题,你可以参加 M 次(比如 4 次或 8 次)考试。你写下所有 8 个答案,从中挑选出最好的那一个,那才是你的得分。

机器人会学到,如果它保持自己的选择空间是开放的(即具有一定的“随机性”或变动性),它就有更大的机会在多次尝试中偶然发现一个绝佳的答案。它不需要特殊的“噪声”指令;通过寻找多次尝试中的“最优解”这一渴望,自然而然地迫使它去探索。

在连续空间中会发生什么?

这篇论文关注的是连续动作空间(continuous action spaces),这是一个高级说法,指的是机器人的关节可以移动到任何角度,而不只是“左”或“右”。

作者发现这种“重试”策略如何改变了机器人的学习路径,其结果令人惊讶:

  1. “推力”(方向): 当机器人远离目标且动作僵硬(低随机性)时,“重试”策略的数学逻辑会自然地推动它变得更加随机。这就像机器人意识到:“我被困在角落里了;我需要更多地扭动才能找到出路。”
  2. “刹车”(幅度): 当机器人接近完美解决方案时,“重试”策略就像一个温柔的刹车。它减慢了学习速度。这很好,因为它防止了机器人冲过头,直接略过了那个完美的点。它让机器人在定型之前保持更长时间的探索。

“ReMAC”机器人

作者构建了一个特定的机器人大脑,称为 ReMAC(ReMax Actor-Critic),用来测试这一理论。他们采用了一个标准且非常成功的机器人大脑(称为 SAC),并简单地将“噪声”指令替换成了“重试”指令。

结果显示:

  • 性能: ReMAC 机器人的学习效果与世界上最优秀的机器人(SAC)一样出色。
  • 探索: 在不需要额外“噪声”香料的情况下,ReMAC 机器人自然地在更长时间内保持了更多样化的动作(更高的熵),这完全符合理论预测。
  • 代价: “重试”方法需要机器人同时模拟多个结果,这会消耗更多的计算能力。

Adam 优化器的转折

论文还注意到,用于训练机器人的计算机工具(称为 Adam)有一个微小的设置(一个“稳定参数”),它就像一个音量旋钮。

  • 如果旋钮调得较低,“重试”策略的“刹车”效应就会减弱,机器人学习得很快,但可能会过快地沉淀下来。
  • 如果旋钮调得较高,刹车效应会更强,让机器人保持更长时间的探索。

总结

这篇论文表明,你不需要通过添加噪声来强迫 AI 变得随机。相反,如果你教导 AI 去针对多次尝试中的最优解进行优化,它自然会发现,保持一点点不可预测性是找到最佳解决方案的最聪明方式。这是一种巧妙的、内置的方法,可以在不需要额外规则的情况下激发好奇心。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →