← 最新论文
💬 NLP

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling

本文介绍了 Prefix-RFT,这是一种混合微调方法,它通过前缀采样将监督微调与强化微调协同结合,以克服各自单一方法的局限性,并在数学推理任务上展现出更优越的性能与鲁棒性。

原作者: Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位非常聪明但缺乏经验的学生如何解复杂的数学谜题。你有两种主要的教学方法,但每种方法单独使用时都存在一个重大缺陷。

两种有缺陷的教学风格

  1. “模仿者”方法(监督微调或 SFT):
    你让学生坐在一本充满完美解法的教科书前。你说:“读它,背下来,然后原封不动地写下来。”

    • 优点: 学生能非常快地学会正确的格式和事实。
    • 缺点: 学生变成了机器人。如果他们看到稍微不同的谜题,就会僵住,因为他们只知道如何模仿,不知道如何思考。他们模仿书本,但并不真正理解其中的逻辑。
  2. “试错”方法(强化微调或 RFT):
    你把学生扔进深水区。你说:“去解这些谜题。如果你答对了,就给你一颗金星;如果你答错了,就什么都得不到。”

    • 优点: 学生学会创造性思考并找到新解法。他们变得非常擅长解决从未见过的难题。
    • 缺点: 没有指导,学生可能会养成奇怪的坏习惯。他们可能会开始混合使用多种语言,或者为了得到金星而走上荒谬且低效的路径。此外,如果他们一开始就养成了坏习惯,就很难戒除。

新方案:“前缀”教练(Prefix-RFT)

本文作者提出了一种名为 Prefix-RFT 的新方法。你可以把它想象成一位使用“起始提示”策略的混合型教练。

以下是其工作原理,使用一个简单的类比:

想象学生正在尝试解一个迷宫。

  • 旧方法(SFT): 你给他们一张整个迷宫的地图,让他们背下路径。
  • 旧方法(RFT): 你蒙住他们的眼睛,让他们一直走直到找到出口。
  • 新方法(Prefix-RFT): 你给他们一张地图,但只覆盖迷宫的前 20%。你说:“严格按照这张地图所示开始。一旦到达这个点,就把地图收起来,自己解决迷宫的其余部分。”

为什么这很巧妙?

  1. 提供安全的起点: 通过强迫学生在开始时遵循专家的路径,你防止了他们立即误入死胡同(解决了 RFT 中“奇怪习惯”的问题)。
  2. 迫使独立思考: 因为学生必须自己解决迷宫的其余部分,所以他们不会仅仅成为模仿者。他们必须动脑筋来完成工作(解决了 SFT 中“缺乏泛化能力”的问题)。
  3. “金星”逻辑: 如果学生既遵循了专家的起始步骤,又为剩余部分找到了极佳的解决方案,他们就会获得巨大的奖励。这教会模型:专家的起始是个好主意,但学生自己的收尾同样有价值。

“熵”过滤器(安全阀)

文中提到了一个棘手的技术细节,称为“基于熵的裁剪”。以下是简化版:

有时,专家的地图与学生已知的内容差异太大,如果学生试图模仿,可能会感到困惑甚至“崩溃”(在数学上,即“梯度”变得过大)。

为了解决这个问题,教练只允许学生复制那些他们不确定的地图部分。

  • 如果学生已经完美掌握了第一步,教练会说:“跳过那个,你已经知道了。”
  • 如果学生对某一步感到困惑,教练会说:“看看专家在这里的举动,这就是你需要学习的地方。”

这确保了学生只在真正需要帮助的地方向专家学习,而不会被压垮。

结果说明了什么

作者在数学问题(如 AIME 竞赛)上测试了这种方法。

  • “模仿者”(SFT) 表现尚可,但无法应对困难的新问题。
  • “试错”(RFT) 表现不错,但有时会卡住或养成坏习惯。
  • “前缀”教练(Prefix-RFT) 击败了前两者。它既学习了专家的模式,又保留了探索新解法的能力。

事实上,当他们让模型尝试极多次(例如 2,048 次)来解决单个难题时,Prefix-RFT 是唯一一种显著提高了找到解法可能性的方法。事实证明,这种方法不仅让模型更擅长模仿,实际上还提升了模型所能达到的能力上限。

一言以蔽之
Prefix-RFT 就像给学生在旅程的前半段装上“辅助轮”,然后在后半段取下,让他们独自骑行。它将指导的安全性与探索的自由度相结合,培养出一个既博学又富有创造力的学习者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →