OR Else: A Differentiable Trust Region for Policy Optimization
本文研究了“输出重置”(Output Reset, OR)作为一种平滑且可微的替代方案,旨在用于大语言模型后训练阶段中 PPO 和 GRPO 的截断代理目标(clipped surrogate objectives),研究发现,尽管 OR 改变了优化行为并降低了组内相对设置下的方差,但与标准的截断方法相比,它并未一致地提高奖励模型分数。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
教导 AI 达到“恰到好处”的艺术
想象一下,你正试图教一个非常聪明但有点混乱的机器人写出人类真正喜欢的文章。这个领域被称为基于人类反馈的强化学习(RLHF)。这就像一场游戏:机器人写出一个句子,人类裁判给它一个赞或一个踩,然后机器人尝试从这些反馈中学习,以便下次写得更好。目标是让机器人既有帮助又无害,同时又不至于失控。
为了实现这一点,科学家们使用了一个“奖励模型”——一个数字化的裁判,为机器人的写作进行评分。但其中有一个棘手的部分:如果机器人为了讨好裁判而过度努力,它可能会开始写一些乱七八糟的东西来骗取高分,或者它的个性会发生剧烈变化,以至于忘记了如何正常说话。为了阻止这种情况,研究人员使用了一种叫做“置信区域”(trust region)的安全规则。把它想象成一根皮带。机器人可以四处游荡和学习,但这根皮带能防止它跑得离原本理性的自我太远。
管理这根皮带最流行的方法是一种叫做 PPO(近端策略优化)的方法。PPO 使用了一种“裁剪”(clipping)机制。想象机器人正朝着目标奔跑。如果它离安全区边缘太近,PPO 会突然踩下刹车,切断任何加速奔跑的额外动力。这种方法很有效,但有点像一个电灯开关:要么全开,要么全关。本文提出了一个简单的问题:如果皮带不是突然收紧,而是随着机器人到达安全极限时逐渐淡出,会怎样?作者提出了一种名为“输出重置”(Output Reset,简称 OR)的新方法,以观察这种更平滑的方法是否能更好地教导大语言模型(LLM)变得更有帮助。
平滑皮带 vs. 裁剪开关
研究人员 Chinmay Rane、Kanishka Tyagi 和 Michael Manry 决定在两种不同的训练场景中测试这种新的“平滑皮带”理念与标准的“裁剪开关”进行对比。他们使用了一个小巧但功能强大的机器人大脑(Llama-3.2-1B 模型),并在人类偏好数据集(Anthropic hh-rlhf)上对其进行训练。他们用不同的随机种子运行了三次实验,以确保结果并非偶然。
实验:两个不同的世界
团队在两个截然不同的环境中测试了他们的新方法,即 PPO-OR 和 GRPO-OR:
- GAE 世界 (PPO): 这是经典的设置,机器人拥有一个“评论家”(一个预测未来奖励的助手),并逐个单词(token)进行学习。
- 组相对世界 (GRPO): 这是一个更新、更简单的设置,机器人同时生成两个答案,通过比较它们并从差异中学习,而不需要评论家。
结果:两种结局的故事
结果令人惊讶,并表明“平滑皮带”在不同情况下表现并不一致。
在 GAE 世界 (PPO) 中: 平滑方法(PPO-OR)在原始得分方面是明显的赢家。使用新方法训练的机器人最终的平均奖励得分达到了 0.500,而标准的裁剪方法仅为 0.195。这提升了 0.305 分!然而,这里有个代价:结果变得有些“摇摆不定”。三次运行之间的得分差异更大(标准差为 0.158,而标准方法为 0.110)。看起来平滑皮带帮助机器人跑得更快了,但也让它的路径变得不太可预测。
在组相对世界 (GRPO) 中: 在这里,平滑方法并没有让机器人跑得更快。事实上,平均得分从 0.488 轻微下降到了 0.457。但机器人变得更加稳定了。运行之间的波动剧烈缩小,从 0.080 降至 0.027。这就像机器人停止了抖动,找到了一个稳定的节奏,尽管它并没有达到更高的峰值得分。
大惊喜:皮带并未缩短
然而,最重要的发现并不是关于得分。研究人员曾担心新方法可能会让机器人离其原始个性太远(这被称为“策略漂移”问题)。他们测量了机器人的当前写作风格与其初始风格之间的偏移距离。
他们发现,在组相对世界中,无论使用旧的裁剪方法还是新的平滑方法,机器人的漂移量都非常巨大——在 5 到 13 个单位的距离之间。平滑皮带(OR)并没有阻止机器人跑得太远。它只是改变了机器人在撞到“安全区”时的反应方式。论文明确排除了这种平滑饱和机制可以作为严格“置信区域”来让机器人保持在原地的想法。机器人依然会游荡;新方法只是改变了它在到达那里时停止尝试改进的数学逻辑。
这对未来意味着什么
作者谨慎地表示,这并不算是一个彻底的胜利。他们发现,“平滑皮带”(输出重置)改变了机器人的学习方式,但它并没有解决组相对方法最大的问题:容易偏离原始策略的倾向。
在经典的 PPO 设置中,平滑方法帮助机器人获得了更高的分数,尽管稳定性略有下降。在较新的组相对设置中,它使训练变得更加一致,但并没有提高最终得分,也没有阻止机器人的漂移。论文表明,仅仅通过平滑数学处理不足以解决“漂移”问题;我们可能需要更大的比较组或不同的安全规则来防止机器人跑得太远。
最终,这项研究表明,在 AI 训练的世界里,并不存在单一的“万能药”。一种在一种设置下表现完美的技巧,在另一种设置下可能会表现得截然不同。输出重置这种平滑且连续的方法提供了一种不同的学习风味——根据语境的不同,它可以更稳定或更有效——但它并不是一种能让 AI 模型保持受控的通用解决方案。研究人员总结道,虽然他们的新方法改变了训练过程的行为,但如何最好地控制这些强大的模型,尤其是在我们迈向更大、更复杂的 AI 系统时,这个问题仍然悬而未决。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。