← 最新论文
💬 NLP

Efficient Reinforcement Finetuning via Adaptive Curriculum Learning

本文介绍了 AdaRFT,这是一种自适应课程学习方法,它通过根据奖励信号动态调整问题难度,显著提升了大型语言模型强化微调的效率与准确性,从而将训练时间缩短了高达 2 倍,并提高了数学推理性能。

原作者: Taiwei Shi, Yiyang Wu, Linxin Song, Tianyi Zhou, Jieyu Zhao

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Taiwei Shi, Yiyang Wu, Linxin Song, Tianyi Zhou, Jieyu Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人解决复杂的数学问题。你拥有一个巨大的题目库,范围从“2+2等于几?”到“证明一个人类天才花了50年才解开的定理”。

在过去,当研究人员尝试训练这些机器人(大语言模型)使用**强化微调(Reinforcement Finetuning, RFT)**时,他们经常犯一个错误:他们直接把机器人扔进深水区。他们给出的题目混合了太容易(无聊且没用)和太难(不可能完成且令人沮丧)的内容。机器人会把时间浪费在它已经掌握的简单问题上,并卡在它无法破解的难题上,这使得整个训练过程既缓慢又昂贵。

这篇论文介绍了一种名为 ADARFT(自适应课程强化微调)的新方法。你可以把 ADARFT 想象成一个智能、自适应的私人导师,它会实时观察机器人的表现,并据此调整作业的难度。

以下是它的工作原理,我们使用简单的类比来解释:

1. “金发姑娘”区域(适中区间)

核心思想是,学习在任务难度恰到好处时效果最好——既不太容易,也不太难。

  • 太容易: 如果机器人每次都能解决问题(成功率100%),它就没有学到新东西。这就像一个学生一直在做他已经掌握多年的乘法表。
  • 太难: 如果机器人每次都做错(失败率100%),它只是在随机瞎猜。这就像让一个一年级小学生去解决博士级别的物理问题。
  • 恰到好处: 这个“甜点位”是机器人大约能答对 50% 的题目。这就是“建设性挫折”区域,也是大脑(或模型)真正成长的时刻。

2. ADARFT 如何扮演导师角色

ADARFT 并不是遵循一个僵化的、预先写好的进度表(比如“第一周:简单,第二周:中等”),它是动态的

  • 反馈循环: 在每一批次的练习题结束后,导师会检查机器人的得分。
  • 调整机制:
    • 如果机器人表现出色(得分远高于50%),导师会说:“做得好!这里有一些稍微难一点的题目。”
    • 如果机器人表现糟糕(得分远低于50%),导师会说:“让我们退后一步。这里有一些更简单的题目来建立你的信心。”
    • 如果机器人徘徊在50%左右的水平,导师则保持难度不变。

3. “难度分”

为了实现这一点,系统需要知道每个问题的难度。作者并没有要求人类去为每一个题目打分(那会耗费大量时间)。相反,他们使用了一个“裁判”(另一个 AI 模型)在训练开始前,为每个数学问题给出了一个 0 到 100 的难度评分。

  • 类比: 想象图书馆里的每一本书书脊上都有一个“阅读等级”标签。ADARFT 不需要读完这些书就能知道它们的等级;它只需查看标签,并挑选出符合学生当前阅读能力的图书。

4. 为什么这意义重大

论文声称,这种简单的“导师”方法使训练速度快了一倍,并造就了更聪明的机器人

  • 效率: 通过避开“太容易”和“太难”的问题,机器人停止了时间的浪费。这就像一名跑步者只以能够锻炼肌肉的配速奔跑,而不是在慢动作慢跑或在力竭前拼命冲刺。
  • 准确性: 因为机器人始终在完美的难度水平下接受挑战,它学得更好,并在高难度的数学竞赛中表现出更高的准确率。
  • 无需重型改造: 最棒的一点是,ADARFT 不需要改变机器人的大脑或游戏规则。它是一个“即插即用”的升级版,可以叠加在现有的训练方法之上。

总结

简而言之,ADARFT 是一种不再将所有训练数据视为一堆平铺的石头的训练方法。相反,它将石头按大小分类,并将它们逐一递交给学习者,确保学习者拿到的重量既足以锻炼力量,又不至于重到根本举不起。这使得训练过程更快、更便宜、也更有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →