← 最新论文
🤖 AI

Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning

本文介绍了熵缩放信任区域(Entropy-Scaled Trust Regions, ESTR),这是一种新颖的异步强化学习方法,它通过基于 Token 熵动态调整离策校正阈值,以区分有害的采样噪声与合法的探索,从而在不牺牲准确性的情况下,实现了比同步 GRPO 更高的训练稳定性以及 2.6 倍的加速。

原作者: Guanqun Zhao, Zijun Xie, Binbin Zheng, Enlei Gong, Jiafeng Lu, Yehan Yang, Aoqi Hu, Zeyu Chen

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Guanqun Zhao, Zijun Xie, Binbin Zheng, Enlei Gong, Jiafeng Lu, Yehan Yang, Aoqi Hu, Zeyu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何解决复杂的谜题,比如走迷宫或做高级数学题。为了变得更厉害,机器人需要通过尝试、观察结果并从这些尝试中学习来进行练习。这个过程被称为“强化学习”。通常情况下,如果机器人在尝试的同时也进行学习,利用其最新的知识,它会学得最好。但问题在于,如果机器人正在尝试解决一个非常漫长且复杂的谜题,这需要花费大量时间,那么等待一次尝试完成后再开始下一次尝试会极其缓慢。这就像一位厨师做完一顿饭,品尝一下,写下一份新食谱,然后等待厨房冷却下来后才开始做下一顿饭。

为了提高速度,工程师们使用了一种“异步”学习的技巧。与其等待,不如让机器人在其“大脑”(优化策略)同时根据旧的尝试进行更新时,继续生成新的尝试(即“展开”过程)。这就像一个繁忙的厨房,主厨在烹饪新菜肴的同时,副厨正在品尝五分钟前开始制作的一道菜。问题在于,“旧”的菜肴在制作过程中使用的食谱可能与主厨当前使用的食谱略有不同。如果厨师在没有意识到食谱在中途发生了变化的情况下,试图从这道旧菜中学习,他们可能会感到困惑,学到错误的教训,甚至开始做出糟糕的食物。这种困惑就是研究人员所说的“离策”(off-policy)数据,它会导致机器人的性能崩溃。

这篇题为《解构离策比例:用于异步强化学习的熵缩放置信区域》(Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning)的论文,正是针对这种崩溃问题进行的探讨。来自百度和几所顶尖大学的研究团队发现,通常用来解决这种困惑的方法是有缺陷的。他们发现,标准方法就像一个僵化的保安,无论情况如何,只要有人看起来“太不一样”,就会阻止他们。研究人员意识到,在异步学习这个混乱且快节奏的世界里,“看起来不一样”并不总是坏事。有时,与众不同实际上是健康探索的标志,尤其是在机器人不确定该做什么的时候。

该团队引入了一种新方法——ESTR(熵缩放置信区域)。ESTR 不再使用单一、僵化的规则来决定保留哪些数据,而是像一位理解情境的智者。它会观察机器人在任何给定时刻的“不确定性”或“困惑程度”(一个被称为的概念)。如果机器人非常有信心(低熵),这位导师就会很严格:任何微小的错误都会被视为危险的噪声并被丢弃。但如果机器人处于不确定和探索阶段(高熵),导师就会很宽容:允许大的变化,因为这些变化可能是找到更好解决方案的关键。

通过使用这种灵活的、具备上下文感知能力的方法,研究人员发现 ESTR 可以保持训练的稳定与快速。在测试中,它使机器人的学习速度比旧的、缓慢的同步方法快了 2.6 倍,同时仍能达到同样高的准确度水平。他们证明了,通过根据机器人的不确定程度来缩放规则,他们可以过滤掉危险的噪声,而不会误将那些通往突破的、有价值的勇敢探索给丢弃掉。事实证明,在教导人工智能的竞赛中,你不仅需要速度,还需要一种聪明的方法,知道何时该严格,以及何时该让机器人去探索。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →