← 最新论文
💬 NLP

Beyond Log Likelihood: Probability-Based Objectives for Supervised Fine-Tuning across the Model Capability Continuum

该论文通过大规模实验与理论分析揭示了模型能力连续体是决定监督微调目标函数有效性的关键维度,指出在强模型端优先采用降低低概率 Token 权重的“先验偏向”目标函数能超越传统的负对数似然(NLL),而在弱模型端 NLL 仍占主导,从而为根据模型能力自适应选择优化目标提供了原则性依据。

原作者: Gaotang Li, Ruizhong Qiu, Xiusi Chen, Heng Ji, Hanghang Tong

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Gaotang Li, Ruizhong Qiu, Xiusi Chen, Heng Ji, Hanghang Tong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的问题:当我们已经训练好一个很聪明的“大语言模型”(LLM)后,在教它做具体任务时,是不是应该一直用同一种“教学方法”?

传统的做法是,无论教什么,都用一种叫“负对数似然(NLL)”的方法。这就好比老师教学生,不管学生是天才还是初学者,也不管题目是简单的还是全新的,老师都只用同一种严厉的打分标准:你答错了,我就狠狠扣分,而且越离谱的错扣得越狠。

但这篇论文发现,这种“一刀切”的方法并不总是最好的。作者提出了一个核心概念:“模型能力连续体”(Model-Capability Continuum)

我们可以把大模型想象成一个学生,把不同的任务想象成不同的学科。这篇论文告诉我们,根据这个学生原本的知识储备(预训练知识)和当前任务的难度,我们需要切换不同的“教学策略”

1. 核心比喻:三种不同的学生与三种教学策略

作者把任务分成了三类,就像面对三种不同状态的学生:

第一类:学霸模式(Model-Strong)

  • 场景:比如数学题。这个学生(大模型)在上学(预训练)时已经读了海量的数学书,脑子里全是数学公式和解题思路。现在老师(SFT)给他一道新的数学题,他其实大概率已经知道怎么做了,只是偶尔会在某个步骤上犹豫一下。
  • 传统方法(NLL)的问题:传统的“负对数似然”方法,就像是一个吹毛求疵的考官。哪怕学生答对了 99%,只要有一个小步骤概率稍微低了一点点,考官就拼命扣分,强迫学生去关注那些他本来就不太可能犯错的“低概率”细节。这反而让学生乱了阵脚,甚至把原本正确的思路给改歪了。
  • 新策略(Prior-leaning):作者建议用一种**“信任学霸”的方法(比如 p-p 目标)。这种方法会忽略那些学生觉得“不太可能”的错误选项**,只关注那些学生觉得“很有可能”的正确选项。
    • 比喻:就像老师对学霸说:“你这道题思路是对的,别管那些乱七八糟的干扰项,把你觉得最对的那个答案再坚定一点就行。”
    • 结果:在数学这种“学霸”领域,这种**“少扣分、多鼓励”**的方法效果最好,成绩提升明显。

第二类:学渣模式(Model-Weak)

  • 场景:比如看图猜字谜(Figfont Puzzles)。这个学生以前从来没在课本里见过这种奇怪的字体,脑子里完全没有相关概念。现在让他猜,他完全是瞎蒙,每个答案的概率都差不多低。
  • 传统方法(NLL)的优势:这时候,传统的“负对数似然”方法反而成了救星。因为它会严厉地惩罚每一个错误的猜测,强迫学生去关注每一个可能的选项,哪怕概率很低。
    • 比喻:就像老师对完全不懂的学生说:“你完全不知道答案,所以你必须把每一个可能的选项都仔细检查一遍,哪个错了就狠狠改哪个,不能放过任何线索。”
    • 结果:在完全陌生的领域,这种**“全面纠错、严厉鞭策”**的方法(NLL)最有效。如果用“信任学霸”的方法,学生可能会因为盲目自信而坚持错误的直觉,导致学不到新东西。

第三类:中等生模式(Model-Intermediate)

  • 场景:比如医疗诊断。学生学过一些医学常识(预训练),但没专门学过这个特定的病例。他有点感觉,但又不敢确定。
  • 结果:这时候,不管是“信任学霸”还是“严厉纠错”,效果都差不多。因为学生处于中间状态,两种方法谁也说服不了谁。这时候可能需要更好的教材(数据),而不是换教学方法。

2. 论文的核心发现:没有万能钥匙

这篇论文最重要的结论是:没有一种“万能”的数学公式(损失函数)能通吃所有情况。

  • 当模型很强(有丰富背景知识)时:我们要**“做减法”**。忽略那些低概率的噪音,强化模型已有的正确直觉。
  • 当模型很弱(缺乏背景知识)时:我们要**“做加法”**。严厉地纠正每一个错误,强迫模型从所有可能性中学习。

3. 生活中的类比

想象你在教一个老练的厨师(强模型)和一个刚入行的学徒(弱模型)做一道新菜:

  • 教老厨师:他已经有丰富的经验了。如果你拿着放大镜,因为他切葱时慢了 0.1 秒就严厉批评他(NLL),他可能会手抖,反而把菜做砸了。你应该说:“你切葱的手法很稳,保持这个节奏,别管那些细枝末节。”(这就是Prior-leaning策略)。
  • 教小学徒:他连刀都拿不稳,完全不知道切葱该多快。这时候如果你说“别管细节,凭感觉来”,他肯定切得乱七八糟。你必须拿着尺子,严格纠正他每一个动作,告诉他“切慢了不行,切快了也不行,必须按标准来”(这就是NLL策略)。

总结

这篇论文就像给 AI 训练师们发了一张**“因材施教”的指南**:

在训练大模型时,不要死守一种“负对数似然”的教条。

  • 如果模型底子好、知识多,就少批评、多肯定,让它发挥特长。
  • 如果模型底子差、没概念,就严要求、多纠错,逼它从头学起。

通过这种**“看人下菜碟”**的策略,我们可以让大模型在更多领域表现得更好。这就是论文标题《超越对数似然》的真正含义:根据模型的能力,灵活选择最适合的训练目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →