← 最新论文
💬 NLP

Gradients Must Earn Their Influence: Unifying SFT with Generalized Entropic Objectives

该论文提出了一种名为动态熵微调(DEFT)的参数化无关目标函数,通过利用广义变形对数族统一监督微调框架,并基于模型预测的不确定性动态调节梯度信任门控,从而有效平衡了探索与利用,解决了传统负对数似然方法在噪声抑制与置信度强化之间的矛盾。

原作者: Zecheng Wang, Deyuan Liu, Chunshan Li, Yupeng Zhang, Zhengyun Zhao, Dianhui Chu, Bingning Wang, Dianbo Sui

发布于 2026-02-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zecheng Wang, Deyuan Liu, Chunshan Li, Yupeng Zhang, Zhengyun Zhao, Dianhui Chu, Bingning Wang, Dianbo Sui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 DEFT(动态熵微调)的新方法,旨在解决大语言模型在“微调”(SFT)阶段遇到的一个核心难题:如何既学会新知识,又不忘掉旧本领,同时还能把已经掌握的知识练得更精准?

为了让你轻松理解,我们可以把训练大模型想象成**一位老练的厨师(预训练模型)在进修新菜谱(微调数据)**的过程。

1. 传统方法的困境:要么“太较真”,要么“太敷衍”

目前的微调方法(标准 NLL 损失函数)就像一位死板的考官,他对所有题目一视同仁:

  • 遇到不会的题(低概率): 考官会疯狂给分(梯度很大),强迫厨师死记硬背。
    • 问题: 如果这道题本身是错的(比如数据噪声,或者考官出题出错了),厨师就会把错误的做法刻在脑子里,甚至把以前做得很好的菜(原有知识)给忘了。这就叫“灾难性遗忘”。
  • 遇到会的题(高概率): 考官觉得厨师已经会了,就随便给点分(梯度很小)。
    • 问题: 厨师虽然会做,但可能做得不够完美(比如火候差一点)。因为考官不重视,厨师就没有动力去精益求精,导致技能无法“ sharpen(锐化)”。

总结: 传统方法就像“一刀切”,不管你是真不懂还是假不懂,也不管你是真会还是只会个大概,它都用同一套标准,导致厨师在“学新东西”和“练旧手艺”之间左右为难。

2. DEFT 的核心理念:聪明的“信任门”

这篇论文提出,我们需要一个聪明的考官,他手里有一个**“信任门”(Trust Gate)。这个门的大小不是固定的,而是根据厨师当下的自信程度**动态调整的。

核心比喻:信任门(The Trust Gate)

想象厨师在答题前,心里会先估摸一下:“这道题我有几成把握?”

  • 情况 A:厨师很迷茫(低置信度,不确定性高)

    • 考官反应: 打开“信任门”。
    • 逻辑: “既然你都不确定,那这道题可能是个全新的知识点,也可能是个陷阱。为了保险起见,我们先全盘接受你的学习信号,让你大胆去试错,确保不漏掉任何新知识。”
    • 效果: 就像在探索新大陆,保持**探索(Exploration)**能力,防止因为太保守而学不到新东西。
  • 情况 B:厨师很有信心(高置信度,确定性高)

    • 考官反应: 关闭“信任门”,只留一条缝。
    • 逻辑: “既然你很有把握,那如果题目和答案对不上,大概率是题目错了(数据噪声)。这时候要保护你原有的正确知识,不要让你为了迎合错误题目而改变做法。但如果题目是对的,我们要严厉要求你做到完美。”
    • 效果: 就像在打磨艺术品,保持**利用(Exploitation)**能力,把已有的技能练到极致,同时过滤掉噪音。

3. DEFT 是怎么做到的?(魔法原理)

论文里用了一些高深的数学(比如凯莱变换 Cayley Transform 和熵),我们可以用更通俗的方式解释:

  1. 动态调整(Dynamic):
    传统的考官是“死”的,DEFT 的考官是“活”的。他会实时观察厨师的整体状态(不仅仅是看这一道题,而是看厨师对整个知识体系的把握程度,即“分布的集中度”)。

    • 如果厨师脑子里乱糟糟的(熵高,不确定),考官就大开绿灯,鼓励学习。
    • 如果厨师脑子里条理清晰(熵低,确定),考官就严格把关,只允许微调细节,防止被带偏。
  2. 无缝切换(Seamless Interpolation):
    这个“信任门”不是突然开关的,而是像调光开关一样平滑过渡。

    • 从“完全不懂”到“完全精通”,考官的态度是平滑变化的:从“全听你的(像 NLL)”慢慢变成“只信你的核心部分(像概率损失)”。
    • 这就解决了“既要学新,又要练旧”的矛盾。
  3. 不需要额外参数(Parameter-free):
    很多新方法需要人工设置很多参数(比如“什么时候该保守,什么时候该激进”),这很难调。DEFT 很聪明,它自己就能算出什么时候该激进,什么时候该保守,不需要人去操心。

4. 实验结果:真的好用吗?

论文在数学、医疗、推理等多个领域做了测试,结果非常亮眼:

  • 在“强手”领域(模型本来就很强): DEFT 能防止模型被数据里的噪声带偏,把原本就好的技能练得更纯熟(比如数学题做得更准)。
  • 在“弱手”领域(模型本来不懂): DEFT 能大胆地让模型吸收新知识,不会因为怕犯错而不敢学。
  • 在“混合”领域(既有懂的又有不懂的): DEFT 表现得最均衡,既没有因为学新东西而忘掉旧东西,也没有因为保守而学不到新东西。

总结

DEFT 就像给大模型配备了一位“因材施教”的私人教练。

  • 当你迷茫时,它鼓励你大胆尝试,确保你学到新东西(覆盖不确定性)。
  • 当你自信时,它帮你去伪存真,防止你被错误信息带偏,并督促你精益求精(锐化确定性)。

这种方法让大模型在微调过程中,既能稳健地吸收新知识,又能牢固地守住旧本领,最终达到一个完美的平衡点。这就是为什么它能在各种复杂的任务中表现更好的原因。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →