← 最新论文
💬 NLP

InstructDiff: Domain-Adaptive Data Selection via Differential Entropy for Efficient LLM Fine-Tuning

InstructDiff 是一个统一的框架,它通过利用微分熵自适应地选择最优训练样本,增强了高效的大语言模型微调,在仅使用 10% 数据的情况下,在推理和通用指令遵循领域均实现了相对于全数据训练的显著性能提升。

原作者: Junyou Su, He Zhu, Xiao Luo, Liyu Zhang, Hong-Yu Zhou, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Junyou Su, He Zhu, Xiao Luo, Liyu Zhang, Hong-Yu Zhou, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一名才华横溢但略显困惑的学生(一个大语言模型)去做特定的工作,比如解决数学问题或编写代码。你拥有一个庞大的教科书库(训练数据)。

传统的教学方式是让学生阅读每一页所有的书。这既耗时又费钱,消耗大量的电力,而且学生往往会因为信息量过大而感到厌烦或困惑,即使读了大量内容,学习效果也不如仔细挑选的几页。

问题在于,“好”的页面取决于不同的学科。

  • 对于数学,最好的页面是那些能让学生思考得更深入、探索更多解题路径的页面。
  • 对于通用对话,最好的页面是那些能帮助学生停止猜测并坚持清晰、标准答案的页面。

现有的方法试图挑选“好”页面,但它们就像是一种“一刀切”的工具。一个旨在挑选最佳数学页面的工具,往往会选出最差的对话页面,反之亦然。

新思路:“InstructDiff”

这篇论文的作者提出了 InstructDiff,一种更聪明的挑选正确页面的方法。他们使用了一个叫做“微分熵”(Differential Entropy)的概念,这听起来很复杂,但如果用类比来看其实非常简单。

类比: “前后”快照

想象你有一个即将学习新技能的学生。

  1. 基础模型(Base Model): 这是学生在开始特定课程之前的状态。他们拥有通识知识,但还不是专家。
  2. 校准模型(Calibration Model): 在挑选最终的学习材料之前,老师先给学生一个课程的极小随机样本(例如 10 页)来让他们热身。这就是“校准”。

现在,老师观察学生在大脑处于两个状态时的变化:之前(基础模型)和之后(校准模型)。老师会问:“对于这个特定主题,学生的确定性发生了多少变化?”

  • 熵(Entropy) 只是一个高级词汇,意指“不确定性”或“学生正在考虑多少种不同的答案”。
  • 微分熵(Differential Entropy) 是“之前”和“之后”状态之间不确定性的差值

神奇的发现:两种任务,两种规则

论文发现了一个有趣的模式:“最好的”页面总是那些导致不确定性变化最小的页面,但具体表现形式取决于任务。

  1. 针对数学与推理(“扩张”阶段):

    • 目标: 你希望学生探索许多路径。
    • 信号: 最好的数学题是那些在热身之后,学生的确定性增加(他们开始想到更多的可能性)的题目。
    • 结果: 论文发现,挑选那些不确定性上升(其特定的数学变化为负)的题目,会让学生成为更好的解题者。
  2. 针对通用对话与医疗建议(“压缩”阶段):

    • 目标: 你希望学生变得自信且精准。
    • 信号: 最好的通用问题是那些在热身之后,学生的确定性减少(他们停止猜测并锁定正确答案)的问题。
    • 结果: 挑选那些不确定性下降的问题,会让学生成为更好的对话者。

统一规则: 在这两种情况下,该方法都会挑选那些不确定性变化最小(最接近于零,无论是微小的增加还是微小的减少)的样本。并不在乎数值是正还是负,重要的是它是否是最“平静”的变化。

实际操作流程

该系统分为两个快速步骤:

  1. 热身: 它提取数据的一个极小随机切片(10%)并对模型进行短暂训练。这创造了“校准模型”。
  2. 筛选: 它针对图书馆中的每一条数据,对比“之前”和“之后”的模型。
    • 它丢弃掉奇怪的内容(太简单或太令人困惑的数据)。
    • 它根据不确定性变化最小的原则对剩余数据进行排名。
    • 它选取变化最小的前 10% 的数据。

结果:更少的数据,更高的成绩

论文在四个不同的“学科”上测试了该方法:数学、通用对话、医疗问题和编程。

  • 效率: 他们仅使用了总数据的 10% 到 20%
  • 表现:
    • 数学方面,模型的表现比学习整个图书馆的内容要高出 17%
    • 通用对话方面,表现高出 52%
    • 它击败了所有其他方法,包括那些基于长度或难度来挑选数据的算法。

为什么这很重要(撇开术语不谈)

这就像是在调收音机。旧的方法试图寻找“声音最大”或“信号最清晰”的频道,并基于一个固定的规则。InstructDiff 则是通过倾听当你轻转旋钮时,无线电信号是如何变化的。它意识到,对于某些频道,你需要让信号变得稍微模糊一点(以进行探索),而对于另一些频道,你需要让信号变得更锐利(以进行聚焦)。

通过寻找导致产生最少静电干扰的那种特定的“旋钮转动”,它能自动知道应该播放哪些歌曲(数据点)来匹配特定的流派(任务)。

简而言之: 你不需要读完整部百科全书才能学习。你只需要阅读那些能让你的大脑对不确定性的改变最小的特定页面——无论这意味着打开心扉接受新想法,还是将思维收敛到单一的正确答案。这种方法能自动实现这一点,在节省时间、金钱的同时,获得更好的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →