← 最新论文
🤖 machine learning

One Algorithm, Two Goals: Dual Scoring for Parameter and Data Selection in LLM Fine-Tuning

本文介绍了 DualSFT,这是一种单次算法,它通过从双层优化框架中推导出共享的基于梯度的评分规则,统一了大语言模型微调中的参数与数据选择,从而实现了比传统独立策略更高效、更协调的协同选择。

原作者: Xinrui Chen, Liu Yang, Ou Wu

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinrui Chen, Liu Yang, Ou Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一座庞大且训练有素的知识图书馆(即大型语言模型,或 LLM),它知晓世间万物。现在,你想教会这座图书馆一项特定的新技能,比如编写计算机代码或解决数学问题。这个过程被称为“微调”。

通常,要教会这座图书馆,你有两种选择:

  1. 重读图书馆里的每一本书(使用所有数据)。
  2. 重写图书馆里的每一页(更新所有参数)。

这两种方法都极其昂贵、缓慢,且需要巨大的计算能力。为了节省成本,研究人员通常只尝试在一个方面提高效率:要么只挑选最好的书来阅读(数据选择),要么只挑选最重要的页来重写(参数选择)。

问题在于?只做其中一件事,就像试图通过只读最好的书却重写每一页来学习一门新语言,或者只重写最好的页却重读每一本书。这仍然是一种浪费。

论文的核心思想:"DualSFT"
本文作者提出了一种名为DualSFT的新方法。你可以将其想象为一位“智能图书管理员”,用一个巧妙的技巧同时解决这两个问题。

以下是其工作原理,使用一个简单的类比:

1. “一站式”评分卡

想象你正在为一个大型项目招聘团队。你需要挑选最好的工人(数据),并决定他们应使用哪些工具(参数)。

  • 旧方法: 你雇佣一位“工人侦察员”来寻找最佳人选,再雇佣一位独立的“工具侦察员”来寻找最佳工具。他们互不沟通。他们可能会挑选出一位需要某种工具的出色工人,而该工具却是工具侦察员未曾选择的,反之亦然。这既混乱又冗余。
  • DualSFT 方法: 作者意识到,“最佳工人”和“最佳工具”实际上是相互关联的。他们创建了一张单一的评分卡,能够同时审视这两者。

2. “交互矩阵”(秘密武器)

论文指出,数据(书籍)与参数(页面)之间存在一种隐藏的数学关系。

  • 想象一个巨大的网格,其中代表你的训练样本(书籍),代表模型的参数(页面)。
  • 作者找到了一种方法,可以计算该网格中每一个单元格的“分数”。
  • 如果你将某一行中的所有分数相加,你就能立即知道哪些书籍最有价值。
  • 如果你将某一列中的所有分数相加,你就能立即知道哪些页面最需要更新。

这就像拥有一张单一的魔法地图。如果你水平地看这张地图,它会告诉你哪里可以挖掘黄金(数据);如果你垂直地看它,它会告诉你哪里需要修建道路(参数)。你不需要两张不同的地图;你只需要以不同的方式阅读同一张地图即可。

3. “一次性”技巧

通常,为了挑选最佳的数据和参数,你可能需要运行训练过程,然后停止,检查结果,挑选新数据,再次运行,如此循环往复。这非常耗时。

DualSFT 是一种**“一次性”**方法。

  • 步骤 1: 模型进行一次快速的“热身”行走(一个简短的练习环节),以感受任务。
  • 步骤 2: 它查看上述的“魔法地图”(梯度交互矩阵)。
  • 步骤 3: 只需一眼,它就能挑选出前 10% 的书籍来阅读,以及前 5% 的页面来重写。
  • 步骤 4: 它直接使用这些被选中的书籍和页面进入最终训练阶段。

4. 铭记过去(不忘却)

教会一个智能模型新技能的一个常见问题是,它开始忘记旧技能(例如如何写诗或回答一般性问题)。这被称为“灾难性遗忘”。

DualSFT 包含一个名为CWSD的特殊“记忆守卫”。

  • 想象模型是一个正在学习数学的学生。“记忆守卫”则是一位老师,它低声说道:“嘿,在学习数学的时候,别忘了如何写故事!”
  • 这位守卫使用一种特殊技术,确保模型在学习新任务的同时保持其原有的个性和通用知识,而无需重新阅读整个原始书籍图书馆。

结果

作者在从 30 亿到 90 亿个“神经元”不等的不同规模模型上测试了该方法。

  • 效率: 与标准方法相比,他们使用了更少的数据,并更新了更少的参数。
  • 性能: 尽管使用资源更少,但这些模型在新任务(如编程和数学)上的表现实际上优于那些试图使用更多资源但不够智能的模型。
  • 平衡: 他们在学习新技能(可塑性)与保持旧技能(稳定性)之间找到了完美的平衡。

总结

简而言之,DualSFT是一种新算法,它不再将“选择数据”和“选择参数”视为两项独立的工作。相反,它将它们视为同一枚硬币的两面。通过利用单一的数学技巧同时为两者打分,它节省了时间、节省了资金,并产生了更智能、更高效的 AI 模型,这些模型不会忘记它们已经掌握的知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →