← 最新论文
💬 NLP

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

本文针对可验证奖励强化学习(RLVR)中的熵崩溃问题,提出了一种新颖的动态裁剪机制,该机制利用保持梯度的视角,通过经验验证的策略精确控制策略熵,从而防止过早的过度自信并提升大语言模型的推理性能。

原作者: Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对这篇论文的解读。

全局概览:“过度自信的学生”问题

想象你正在训练一位才华横溢的学生(大型语言模型)来解决高难度的数学问题。你使用了一种名为“可验证奖励强化学习(RLVR)”的系统。你可以把它想象成一位严格的教练,只有当学生答对答案时才会给分。

起初,学生充满好奇。他们尝试多种不同的解题方法,虽然会犯错,但能从中学习。这种“好奇心”被称为“熵”。高熵意味着学生正在探索多种可能性。

然而,随着训练继续,问题出现了。学生变得“过度自信”。他们不再尝试新方法,只是重复那几种他们知道有效的答案,即使这些答案并不完美。他们停止了探索。用术语来说,他们的“熵崩溃”了。

一旦发生这种情况,学生就停止学习,因为他们不再冒险。他们陷入了“局部最优”——一个让他们自以为表现极佳、实则错失最佳解决方案的舒适区。

根本原因:过于紧绷的“安全网”

论文将罪魁祸首锁定为一种名为“梯度保持截断(Gradient-Preserving Clipping)”的机制。

想象教练有一个安全网(“截断阈值”),用来防止学生做出疯狂且危险的猜测。

  • 如果学生尝试一个新的、低概率的想法,安全网通常会接住它并说:“不,别往那里走。”
  • 问题在于,这张网是“静态”(僵化)的。它对所有情况一视同仁。它过于严厉地切断了学生探索低概率想法的能力,同时也未能让他们在高概率想法上施加足够的力度。

由于这张网过于僵化,学生的信心(熵)下降得太快,导致“梯度”(指引学生如何改进的信号)消失。学生因此停止学习。

解决方案:一位“智能且灵活的教练”

作者提出了一种管理学生信心的新方法。他们不使用僵化的安全网,而是采用“动态截断阈值”。

这就像一位能根据学生当前状态调整规则的教练:

  1. 当学生不确定时(低概率): 教练放松安全网。“去吧,试试那个奇怪的想法!即使可能性不大,我们也看看会发生什么。”这鼓励了探索,并保持了学生的好奇心(熵)处于高位。
  2. 当学生过于确信时(高概率): 教练稍微收紧安全网。“你对这个答案已经非常自信了;别太自满。让我们确保没有忽略其他可能性。”这防止了学生过早变得过度自信。

通过使规则“依赖于概率”,系统可以精确控制学生探索与专注的比例。

三种训练策略

这篇论文不仅修复了安全网,还设计了三种不同的“训练计划”(策略),用于随时间使用这种灵活的安全网:

  1. 先增后减(ID):

    • 类比: 从“狂野孩童”阶段开始。让学生探索一切,尝试疯狂的解决方案。一旦他们打下了良好的基础,就慢慢收紧规则,帮助他们专注并打磨技能。
    • 适用场景: 那些已经受过一定训练、需要在最终定型前爆发创造力的模型。
  2. 先减后增再减(DID):

    • 类比: 先让学生冷静下来(减少混乱)。然后,给他们第二次机会,让他们多探索一点(增加好奇心),以避免陷入僵局。最后,再次让他们冷静下来,锁定最佳答案。
    • 适用场景: 那些在开始时非常混乱或“原始”、需要在安全探索前获得片刻稳定的模型。
  3. 振荡衰减(OD):

    • 类比: 一场有节奏的舞蹈。教练在整个训练过程中不断在“探索模式”和“专注模式”之间切换。如果学生变得太无聊(熵太低),教练会说:“去探索吧!”如果他们太狂野(熵太高),教练会说:“专注!”
    • 适用场景: 长时间的训练过程,学生可能会陷入死胡同;这种方法能让他们时刻保持警觉。

结果

作者在数学问题(如 AIME 和 MATH 基准测试)上测试了这些方法。

  • 结果: 他们的灵活方法防止了“熵崩溃”。学生没有过早变得过度自信。
  • 得分: 使用这些新策略训练的模型比标准方法正确解决了更多的数学问题。他们更擅长找到正确答案,因为他们没有过早放弃探索新路径。

总结

论文认为,要让 AI 变得更聪明,我们既不能让它随机学习,也不能强迫它过于僵化。我们需要一位“动态教练”,它确切知道何时鼓励狂野的探索,何时要求专注,并实时调整规则,以保持 AI 的好奇心但又不陷入混乱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →