Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization
本文将大语言模型强化学习中的探索崩溃识别为 PPO-Clip 在欧几里得度量与策略内在黎曼流形之间的几何失配,并提出了黎曼等距策略优化(RIPO)来纠正这一缺陷,从而在多个基准测试中实现了显著提升的性能和稳定性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一个超级聪明的机器人去解决极其困难的数学谜题。你希望这个机器人尝试新的、古怪的、具有创造性的方法来解决问题,而不仅仅是死守着它已经掌握的老套路。这被称为“探索”(exploration)。但问题在于,目前用于教导这些机器人的标准方法(称为 PPO-Clip)存在一个隐藏的缺陷。这就像是用一把会根据道路繁忙程度而伸缩的尺子来测量两座城市之间的距离。
缺陷:“一刀切”的尺子
当前的方法将机器人做出的每一次改变都视为同样的大小,而不管机器人最初做出该动作的可能性有多大。
- 高概率陷阱: 如果机器人已经有 80% 的把握采取某种路径,标准方法会让它激进地向前冲,使这条路径变得更加占据主导地位。这就像学校里的风云人物得到了更多的关注,而安静的孩子却被忽视了。
- 低概率陷阱: 如果机器人只有 1% 的把握去尝试一条罕见的、可能极具启发性的路径,标准方法几乎不允许它进行任何移动。这就像试图用羽毛去推动一块沉重的巨石。即使那条罕见的路径是解开谜题的关键,机器人也会因为过于胆怯而不敢尝试。
作者发现,这种“一刀切”的方法在数学上是错误的。他们发现,这些机器人决策所处的空间并不是像纸张一样平坦(欧几里得空间),而是像地球表面一样弯曲(黎曼流形)。在一个弯曲的表面上,同样大小的一步看起来会完全不同。旧的方法忽略了这个曲率,导致机器人陷入僵局,失去了探索的能力。这就是论文中所说的“探索崩溃”(exploration collapse)。
解决方法:“智能尺子”(RIPO)
为了修复这个问题,作者创建了一种名为 黎曼等距策略优化(Riemannian Isometric Policy Optimization,简称 RIPO) 的新方法。把 RIPO 想象成一把“了解地形的智能尺子”。
- 对于热门路径: 它会收紧绳索,防止机器人变得过于自负并只固守一种解决方案。
- 对于罕见路径: 它会放松绳索,允许机器人采取更大胆、更强力的步伐去探索那些隐藏的、具有创造性的解决方案。
通过这样做,RIPO 确保了机器人所走的每一步在其实际行进的弯曲决策图上都是“公平”的。这让机器人保持平衡:既保留使用有效方法的能力(利用),也从未停止寻找更好方法(探索)。
论文说了什么(以及没说什么)
作者非常明确地说明了他们的发现。他们排除了仅仅通过微调旧方法中的数值(例如让针对罕见动作的“绳索”稍长一点)就能解决问题的观点。他们认为,以往试图修复该问题的尝试只是“对症治疗”,比如在断掉的腿上贴创可贴,而不是修复骨头。论文表明,如果不修复底层的几何结构(即决策空间的形状),机器人最终总会陷入一种乏味、缺乏创造力的状态。
结果:巨大的飞跃
团队在四种不同规模的机器人大脑(大语言模型 LLMs)上测试了这种新的“智能尺子”,并将它们与七种顶尖的训练方法在七场超难的数学竞赛(如 AIME24、AMC23 和 HMMT25)中进行了对决。
结果令人震惊。在 AIME24 基准测试中,新方法(RIPO)将 GRPO 算法的性能提升了高达 60%。事实上,在 Qwen3-8B 模型上,RIPO 在 AIME24 中得分 43.8,而排名第二的方法(DCPO)仅得到了 36.3。
但这不仅仅关乎数学。论文还展示了该方法在编程任务(如 Codeforces)和搜索任务(如 TriviaQA)上的表现,证明了这种“弯曲地图”问题是机器人面临的普遍问题,而不仅仅是一个数学问题。
为什么这很重要
论文并不仅仅说“它效果更好”。作者测量了机器人的“熵”(一个描述其选择多样性的专业术语),旧方法中的机器人选择会崩塌至接近于零(它停止了创造性思考),而 RIPO 则保持了机器人选择的多样性和健康度。他们还观察了“梯度范数”(衡量学习过程是否剧烈波动),旧方法就像是带有剧烈波峰的过山车,而 RIPO 则是一段平稳、稳定的旅程。
简而言之,论文表明,通过尊重机器人决策的真实弯曲形状,我们可以阻止它们陷入停滞,并帮助它们解决以前无法解决的问题。这是一种从使用一把破碎的平直尺子到使用一把完美的弯曲尺子的转变,而数据表明,这对于提升机器人的智能水平有着巨大的影响。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。