← 最新论文
💬 NLP

LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure

本文提出了 LP-SFT,这是一种通过局部归一化 KL 散度在非目标标记之间保留预训练模型固有的多模态熵结构的监督微调方法,从而在提高下游性能的同时,减轻对既有能力和采样多样性的退化。

原作者: Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个才华横溢、博学多识的机器人如何遵循指令。这个机器人已经阅读了几乎整个互联网的内容,学习了语言的节奏、数学的逻辑和代码的结构。这个初始学习阶段被称为“预训练”(Pretraining)。现在,你想教它一项特定的工作,比如解决数学问题或编写计算机代码。你向它展示正确答案的示例,机器人会调整它的脑回路以匹配这些示例。这个过程被称为“监督微调”(Supervised Fine-Tuning,简称 SFT)。

然而,这里有一个陷阱。当机器人学会完美胜任这项新工作时,它有时会忘记如何成为一名优秀的通用对话者。它会变得如此痴迷于你展示给它的那个唯一的“正确”答案,以至于忘记了句子还有其他所有有趣且合理的结尾方式。这就像一个学生为了背诵某个数学题的特定答案而过度努力,结果导致他无法解决一个稍有变体的问题;或者像一个作家,只知道一种开始故事的方式。这个领域的一个大问题是:我们如何在教机器人新工作的过程中,又不让它忘记原有的丰富知识?

这正是论文《LP-SFT》所解决的问题。作者们是一群来自顶尖大学的研究人员,他们注意到目前教这些机器人的标准方法(称为“交叉熵”,Cross-entropy)有点过于粗暴。它告诉机器人:“只看我正在展示给你的这一个词;忽略其他一切。”问题在于,机器人的原始大脑其实拥有一张包含许多可能的“好”词汇的地图,而不仅仅是一个。通过强迫机器人只关注这一个目标词,我们无意中抹去了所有其他可能性的地图,导致了创造力的丧失,以及一种被称为“灾难性遗忘”(Catastrophic Forgetting)的现象——即机器人忘记了它原本拥有的技能。

研究人员发现了关于这些机器人思维方式的一些迷人之处。他们发现,机器人的大脑并不只是选择一个词,它经常在几个同样好的选项之间徘徊,形成一种“多模态熵结构”(Multimodal Entropy Structure)。把它想象成一个分叉路口。有时,机器人看到两条或三条路径,它们都是同样有效的。标准的训练方法却强迫机器人只选一条路径,并烧毁其他路径,即便其他路径原本也是完全合理的。

为了解决这个问题,团队提出了一种名为 LP-SFT(局部保持监督微调,Local-Preserving Supervised Fine-Tuning)的新方法。LP-SFT 不再只是对着机器人大喊“选这个词!”,而是说:“选这个词,但请不要忘记另外那三个或四个也挺不错的词。”

它是如何运作的呢?我们可以用一个简单的类比来理解:想象你在训练一只狗去捡特定的球。标准的方法是,只有当狗叼回那颗“确切的球”时才给予奖励,并忽略其他所有东西。久而久之,这只狗可能会停止寻找其他玩具。LP-SFT 则像是说:“把红球(目标词)给我拿来,但与此同时,也要记得蓝球和绿球也是很有趣的捡拾对象。”该方法创建了一个由机器人原本可能选择的前 10 个词组成的“安全区”。它移除了你正在教它的那一个词(以免产生混淆),然后轻轻地引导机器人,使其保持剩余九个词的相对受欢迎程度与之前保持一致。

这种方法的成果非常令人期待。当研究人员在不同的模型(如 Qwen 和 Llama)以及不同任务(数学、编程和通用聊天)上测试 LP-SFT 时,他们发现它比旧方法表现得更好。经过 LP-SFT 训练的机器人不仅能很好地完成所教的具体任务(在数学和编程测试中获得高分),而且还保持了多样性和创造力。它们不像其他方法那样容易丢失通用知识。事实上,该方法在“得到正确答案”与“保留多种可能方案”之间实现了最佳的平衡。

论文表明,通过尊重机器人原有的“可能性地图”,我们可以在不破坏其大脑的前提下教会它新技能。这提醒我们,有时为了教会机器变得完美,你必须让它保留一点点它的“不确定性”。研究人员证明,这种局部保持(Local Preservation)有助于防止机器人陷入枯燥、单一的思维模式,使其保持聪明、灵活,并为接下来的任何挑战做好准备。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →