← 最新论文
💬 NLP

Proximal Supervised Fine-Tuning

该论文提出受强化学习信任区域策略优化启发的“近端监督微调”(PSFT)方法,通过约束策略漂移,在保持领域内性能的同时显著提升了大模型的泛化能力、训练稳定性及后续优化潜力。

原作者: Wenhong Zhu, Ruobing Xie, Rui Wang, Xingwu Sun, Di Wang, Pengfei Liu

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenhong Zhu, Ruobing Xie, Rui Wang, Xingwu Sun, Di Wang, Pengfei Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 PSFT(近端监督微调) 的新方法,旨在解决大模型在“特训”(监督微调,SFT)后容易“变傻”或“钻牛角尖”的问题。

为了让你轻松理解,我们可以把训练大模型想象成培养一个天才学生

1. 背景:传统的“特训”有什么毛病?

想象一下,你有一个博古通今的天才学生(基础大模型),他什么都会,但还没经过专业训练。
现在,你想让他成为数学竞赛冠军。于是,你给他做了一套高强度的特训(这就是传统的 SFT,监督微调)。

  • 传统 SFT 的做法:就像老师拿着标准答案,让学生死记硬背。学生为了拿高分,拼命模仿老师的解题步骤。
  • 出现的问题
    1. 死记硬背(过拟合):学生只学会了做这套题,换个稍微不同的题目(泛化能力差)就懵了。
    2. 思维僵化(熵崩溃):为了追求完美答案,学生变得不敢尝试任何新想法,思维变得极度狭窄,甚至失去了原本那种天马行空的创造力。
    3. 后续难教:如果之后还想用更高级的“强化学习”(RL,类似让他在实战中自我进化)来进一步提升,发现他已经被教得太死板,根本学不动了。

2. 核心方案:PSFT(近端监督微调)

为了解决这个问题,作者们从强化学习(RL)中借来了一个聪明的策略,叫**“近端”(Proximal)**。

通俗比喻:带着“安全绳”的特训

想象一下,传统的特训是让学生**“放手去跑”**,结果学生跑得太快,直接冲出了跑道(偏离了原本的知识体系)。

PSFT 给学生的训练加了一根**“安全绳”**(信任区域约束):

  • 怎么练? 老师依然教数学题,但规定:“你可以学新东西,但每一步都不能离你原来的思维模式太远。”
  • 具体操作:如果学生想出一个新解法,这个解法必须和原来的解法“长得差不多”。如果新解法太离谱(概率变化太大),老师就会说:“停!这个步子迈太大了,退回去一点。”
  • 效果:学生既学会了做数学题,又保留了原本灵活的思维方式。他不会因为过度追求标准答案而变成“做题机器”。

3. 这个方法好在哪里?(三大亮点)

论文通过大量实验证明,PSFT 就像给特训加上了“防弹衣”:

  1. 既专又博(在域内强,在域外也强)

    • 传统方法:数学题做得好,但问点常识题(比如“如何写邮件”)就变笨了。
    • PSFT:数学题做得一样好,而且问常识题时,依然保持聪明灵活,没有“变傻”。
  2. 防止“思维僵化”(避免熵崩溃)

    • 传统方法:学生变得只会一种解法,思维多样性(熵)急剧下降。
    • PSFT:学生的思维依然活跃,保留了多种解题思路的可能性。这就像给大脑留了“呼吸空间”。
  3. 为未来留后路(利于后续强化学习)

    • 这是最关键的一点。因为 PSFT 没有把学生教“死”,保留了探索能力。
    • 如果在特训之后,再让他进行强化学习(RL)(比如让他参加真实的数学竞赛,自己总结经验),PSFT 出身的学生进步神速,最终成绩远超传统特训的学生。而传统特训的学生,因为思维太僵化,后续很难再提升。

4. 总结:为什么要用 PSFT?

如果把训练大模型比作**“打磨一块璞玉”**:

  • 传统 SFT 像是用强力胶水把玉石强行粘成特定形状,虽然形状对了,但玉石内部的纹理(通用能力)被破坏了,而且很难再改回来。
  • PSFT 像是用**“柔性模具”**去塑造玉石。它允许玉石在保持原有纹理和弹性的前提下,慢慢适应新的形状。

一句话总结:
PSFT 是一种更聪明的“特训”方法,它让大模型在学会新技能的同时,不忘本、不僵化,并且为未来的自我进化留足了空间。这就像教学生时,不仅教他“怎么做题”,还保护了他“怎么思考”的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →