How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization
本文提出了名为 DynaMO 的理论驱动框架,通过基于伯努利方差的序列级动态 rollout 分配和基于梯度的 Token 级优势调制,有效解决了大语言模型强化学习中的资源分配不均及策略优化不稳定问题,从而在数学推理基准上显著提升了性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一种名为 DynaMO 的新方法,旨在让大型语言模型(LLM)在解决数学推理问题时变得更聪明、更稳定。
想象一下,你正在训练一个天才学生(AI 模型)参加数学奥林匹克竞赛。目前的训练方法(就像传统的教练)存在两个主要问题,而 DynaMO 就是为了解决这两个问题而设计的“超级教练”。
问题一:资源分配不均(“大锅饭”式的训练)
现状:
现在的训练方法就像给每个学生发同样数量的练习题。
- 对于太简单的题,学生早就做对了,再练也是浪费时间。
- 对于太难的题,学生完全不会,做再多也是瞎猜,学不到东西。
- 只有那些难度适中(学生有点会,但经常做错)的题,才是提升的关键。
目前的“大锅饭”做法,把宝贵的时间浪费在了简单和过难的题目上。
DynaMO 的解决方案:动态分配“练习量”
DynaMO 像一个精明的教练,它会观察学生的表现:
- 如果学生在某类题目上忽对忽错(方差大),说明这里最有“学习潜力”。教练就会加大这类题目的练习量。
- 如果学生已经稳操胜券或者完全没戏,教练就会减少这类题目的练习。
- 比喻: 就像给植物浇水。不需要给已经长满水的植物浇水,也不需要给枯死的植物浇水,而是把水精准地浇给那些“渴得刚刚好、喝了就能长高”的植物。
问题二:学习动力失衡(“太自信”和“太激进”的副作用)
现状:
在训练过程中,模型对每个答案都有一个“自信度”。
- 太自信的正确答案: 当模型非常确定某个答案是正确的(比如 99% 把握),传统的算法会觉得“既然你都这么确定了,那就不需要再改进了”,导致学习信号变弱,模型学不到更深层的东西。
- 太激进的错误修正: 当模型非常不确定或者犯了大错时,算法可能会给它一个巨大的修正信号,试图一下子改过来。但这就像用力过猛,容易把模型“教坏”,导致训练过程不稳定,甚至前功尽弃。
DynaMO 的解决方案:智能调节“学习力度”
DynaMO 引入了两个机制来平衡这种状态:
- 给“自信者”加油(梯度补偿): 即使模型很自信,如果它做对了,DynaMO 也会额外奖励它,告诉它:“你做得很好,但我们要让你更完美,所以再加强一点学习信号。”这防止了模型因为太自信而停止进步。
- 给“激进者”刹车(更新稳定): 当模型因为巨大的错误修正而变得“情绪激动”(熵值剧烈变化)时,DynaMO 会踩刹车,把修正力度降下来,防止模型“走火入魔”。
- 比喻: 就像开车。
- 对于老司机(高自信),教练会鼓励他:“你开得稳,但我们要挑战更完美的路线,所以稍微加点油门(补偿)。”
- 对于新手(高不确定/大错误),教练会提醒:“别急,刚才那个急转弯太猛了,容易翻车,我们慢点开,稳住方向(稳定)。”
总结:DynaMO 是怎么工作的?
DynaMO 就像一位既懂战略又懂战术的超级教练:
- 战略层面(序列级): 它不再平均分配时间,而是把 80% 的精力花在那些“最有挑战性、最能提分”的题目上。
- 战术层面(Token 级): 它在每一个具体的解题步骤中,精准控制学习的力度。既不让自信的学生“躺平”,也不让犯错的学生“崩溃”。
结果如何?
论文通过在多个数学竞赛数据集(如 AIME、AMC 等)上的测试证明,使用 DynaMO 训练的模型,解题准确率更高,训练过程更平稳。它不仅在 15 亿参数的小模型上有效,在 70 亿甚至 140 亿参数的大模型上效果更明显。
一句话总结:
DynaMO 让 AI 学习数学时,不再“平均用力”,而是“好钢用在刀刃上”;不再“盲目自信”或“鲁莽纠错”,而是“张弛有度,稳扎稳打”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。