← 最新论文
🤖 machine learning

Parameter Exploration for RLVR via Variational Learning

本文介绍了扰动参数策略优化(3PO),这是一种通过探索参数空间以生成多样化策略来增强大语言模型强化学习的方法,从而与 GRPO 等标准动作空间探索技术相比,提升了下游性能和训练稳定性。

原作者: Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何解决一个棘手的谜题,比如一个复杂的数学问题或编写一段代码。你不能只是坐在那里把答案展示给它;相反,你让机器人去尝试,如果它做对了,你就给它一个击掌(即“奖励”)。如果它做错了,你就温柔地对它说“再试一次”。这就是所谓的强化学习(Reinforcement Learning)。困难之处在于,机器人必须自己摸索出如何获得那个击掌。有时,它会陷入一种惯性思维,不断重复同样的错误,因为它不敢尝试任何新事物。为了解决这个问题,科学家们通常会尝试让机器人的思维变得更加“混乱”或“随机”,希望它能偶然撞见一个天才般的解决方案。

长期以来,增加这种混乱性的标准方法是调整机器人的“温度”(temperature)。这就像是调大收音机静电音的音量:它让机器人的选择变得有些不可预测,但它并不会改变机器人所“知道”的内容或它的思考方式;它只是稍微打乱了它进行猜测的顺序。这就像是告诉一位厨师在汤里多撒点香料,却不改变食谱本身。问题在于,有时候汤的味道依然很糟糕,机器人也只是以不同的顺序重复着同样的错误猜测。这篇论文探讨了一个更激进的想法:如果我们不仅仅是打乱香料,而是直接调整厨师的大脑呢?如果我们为每一次尝试都赋予机器人一点点临时的“脑雾”或轻微的“性格转变”呢?这能让机器人探索全新的思考方式,而不仅仅是新的猜测方式。

这项研究背后的研究人员 Vatsal Venkatkrishna、Nico Daheim 和 Iryna Gurevych,决定在大型语言模型(即那些编写文本和解决问题的 AI)上测试这种“大脑调整”的想法。他们将这种新方法家族称为 3PO(扰动参数策略优化,Perturbed Parameter Policy Optimization)。3PO 不仅仅是让机器人的猜测变得随机(动作空间探索),它实际上是在机器人的内部权重中加入了一点噪声(参数空间探索)。想象一下你有一支由 16 名厨师组成的团队正在尝试解开一个谜题。旧的方法(称为 GRPO)会让这 16 名厨师使用完全相同的食谱书,只是进行随机猜测。如果他们都失败了,整个团队就会陷入僵局。

3PO 团队尝试了三种不同的方式来打破僵局。首先,B3PO 就像是给整个团队一份略有不同的、带有“脑雾”版本的食谱书,并在整个回合中使用它。第二,M3PO 就像是让团队接连尝试四个不同的“脑雾”版本食谱,然后取其平均结果。但真正的明星是 C3PO。在 C3PO 中,团队被分开了。与其让每个人都使用同一本书,不如将 16 名厨师分成小组,每个小组都会得到一份完全不同的“脑雾”版本食谱书。这意味着团队正在同时探索许多不同的“宇宙”中的解决方案。

结果非常令人鼓舞。当他们在困难的数学问题(如 AIME 竞赛)和编程挑战上测试这些方法时,C3PO 方法始终优于标准方法。论文指出,通过使用这些不同的“脑雾”版本模型,团队能够找到标准方法错过的正确答案。具体来说,C3PO 成功“挽救”了更多原本会成为死胡同(即所有尝试都得到同一个错误答案)的尝试组。它产生的“格式错误”(malformed)答案也更少——那些是机器人只会重复胡言乱语的奇怪且破碎的响应。

有趣的是,论文认为仅仅让机器人变得更随机(比如调高温度)是不够的。事实上,他们发现让机器人过于随机往往只会导致产生更多的垃圾答案。关键在于探索的“结构”:让多个不同版本的模型在同一个组内协同工作。虽然论文并未声称这是一种能解决一切问题的“灵丹妙药”,但它强烈表明,调整模型的内部参数是一个强大的新工具。这就像是意识到,为了寻找隐藏的宝藏,你不仅需要向随机方向行走;你还需要派出一整支探险队,每人拿着一张略有不同的地图,以覆盖更广阔的区域。研究人员发现,这种方法在不需要显著增加计算能力的情况下也能运作良好,这使得它成为了训练更聪明 AI 的一种实用的升级方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →