← 最新论文
🤖 machine learning

Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

本文介绍了 Entrocraft,这是一种简单且无需正则化的拒绝采样方法,能够精确控制熵调度,以防止大语言模型强化学习中的性能饱和,从而显著延长训练寿命并提升泛化能力与输出多样性。

原作者: Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama, Ruqi Zhang

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama, Ruqi Zhang

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《通过精确熵曲线控制解决大语言模型强化学习的性能饱和问题》(Entrocraft)的通俗解释,辅以日常类比。

核心问题:“单音”天才

想象你正在训练一位非常聪明的学生(大语言模型),通过奖惩系统(强化学习)来解数学题。

起初,这位学生会尝试多种不同的解题方法。他们可能会走一条漫长曲折的路径,尝试捷径,或者进行富有创意的猜测。这被称为探索

然而,随着训练继续,学生会“陷入僵局”。他们发现了一种能得高分的特定方法,便开始做这一种。他们不再尝试新事物。他们变成了一位“单音”天才:能完美解决完全相同的问题,但只要问题稍有变化,就会失败。

用术语来说,这被称为性能饱和。学生不再变得更聪明,因为他们停止了探索。论文指出其根本原因是熵崩溃。将“熵”理解为学生的“好奇心”或“尝试新事物的意愿”的度量。当熵崩溃时,好奇心消亡,学生只是反复重复同一个安全的答案。

失败的修复方案:试图强行激发好奇心

以往的方法试图通过添加“正则化”(像温和的推动)或“截断”(像限速)来强迫学生保持好奇心。

作者将这种方法比作试图通过随机地踩油门和刹车来保持车速稳定。它短期内有效,但最终车辆开始抖动,要么加速过快,要么减速过猛。“好奇心”曲线变得不稳定,学生的性能停止提升。

解决方案:Entrocraft(“智能过滤器”)

作者提出了一种名为Entrocraft的新方法。他们不是试图推动学生,而是使用过滤器(拒绝采样)来决定学生能从哪些答案中学习。

类比:严格的编辑
想象学生为一道数学题写出了 10 个不同的答案。

  • 标准训练:老师查看所有 10 个答案,说:“那些答对的答案做得很好!现在,让我们确保你下次做那一种。”这会扼杀创造力。
  • Entrocraft:老师扮演一位有特定目标的严格编辑。
    • 如果学生过于自信(熵低,只做同样的事),编辑会扔掉“完美”的答案,说:“不,要从你的错误奇怪的猜测中学习。”这迫使学生去探索。
    • 如果学生过于混乱(熵高,胡乱猜测),编辑会扔掉“奇怪”的猜测,说:“不,要从你最好的尝试中学习。”这迫使学生聚焦。

通过有选择地决定哪些答案算数,Entrocraft 能够精确控制学生在每一步保持多少好奇心。

秘诀:“退火”计划

论文发现,你不能永远将学生的好奇心维持在一个固定水平。如果你试图让他们永远保持 100% 的好奇心,他们会感到困惑;如果你让他们保持 0% 的好奇心,他们会陷入僵局。

最佳策略是线性退火计划(一种 fancy 的说法,意为“计划的、渐进的变化”)。

  • 开始:高好奇心。让学生尝试一切。
  • 中期:逐渐降低好奇心。让他们更多地专注于最佳解决方案。
  • 结束:保持略低但稳定的好奇心水平。

作者发现,这种“计划的下降”比试图保持好奇心水平恒定要有效得多。这就像节食:你不会永远每天吃同样多的食物;随着你接近目标,你会调整摄入量。

结果:小模型击败大模型

该论文在数学推理任务上测试了这种方法。结果令人印象深刻:

  1. 打破天花板:标准训练在达到某一点后停止提升(饱和)。而 Entrocraft 持续提升了4 倍的时间。
  2. 规模无关紧要:使用 Entrocraft 训练的较小模型(40 亿参数)表现实际上优于使用标准方法训练的更大模型(80 亿参数)。
  3. 更多样化的答案:该模型不仅找到了一个正确答案,还找到了许多不同的正确答案(将"pass@K"分数提高了 50%)。这意味着当你要求它生成多个选项时,它更可靠。

总结

Entrocraft 是一个简单的工具,充当 AI 的“好奇心恒温器”。它不是让 AI 陷入重复同一答案的循环,而是过滤掉那些让 AI 过于自信或过于混乱的答案。通过精心规划 AI 在训练每个阶段应拥有多少“好奇心”,它防止了 AI 撞上性能墙,甚至让较小的模型能够超越较大的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →