← 最新论文
🤖 machine learning

Distill on a Diet: Efficient Knowledge Distillation via Learnable Data Pruning

该论文提出了 IF-Beta,一种高效的知识蒸馏框架,它利用影响函数和一种可学习的基于 Beta 分布的采样策略来优化数据剪枝,使得在显著减少的数据和计算量下训练的学生模型,能够超越在全量数据集上进行蒸馏的模型。

原作者: Yifan Wu, Yiqi Wang, Xichen Ye, Wenjing Yan, Xiaoqiang Li, Cheng Jin, Xiangyu Yue, Weizhong Zhang

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Wu, Yiqi Wang, Xichen Ye, Wenjing Yan, Xiaoqiang Li, Cheng Jin, Xiangyu Yue, Weizhong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:用“饮食控制”来教导学生

想象一下,你是一位大师级厨师(教师模型),正试图教导一名学徒(学生模型)如何烹饪出一道完美的菜肴。通常情况下,为了教好学徒,你需要让他们练习你那本厚重食谱中的每一道菜谱。这不仅耗时极长,而且会消耗大量的燃料(计算能力),让人精疲力竭。

**知识蒸馏(Knowledge Distillation, KD)**就是大师引导学徒的过程。目标是让学徒变得足够优秀,能够做得几乎和大师一样好,但速度更快,且使用的设备更少。

然而,这篇论文指出一个问题:尽管最终的学徒模型很小且高效,但在训练过程中仍然非常庞大,因为学徒必须阅读整本食谱。作者们问道:“如果我们能只给学徒一份精心挑选的、最重要的‘食谱饮食’,他们能否学得同样好,但更快、更省力?”

这就是**“以饮食进行蒸馏”(Distill on a Diet)**的核心思想。


现有方法的问题

在这篇论文之前,人们尝试通过两种主要方法来为学徒挑选“最佳”食谱,但这两种方法都有缺陷:

  1. “重新训练”法: 为了知道哪些食谱难或易,你必须先看着学徒把整本书做一遍。这违背了节省时间的初衷!这就像是雇佣一名侦探,盯着学徒看了一个月,仅仅是为了搞清楚该给他们看哪些食谱。
  2. “经验法则”法: 有些人只是使用简单的规则,比如“挑选难度适中的食谱”。但这种方法很僵化。有时候“中间难度”的食谱并不一定是最好的;有时候你需要的是极易和极难食谱的混合。这就像是一个死板的饮食计划,不管你的身体实际需要什么,它都只按部就班。

解决方案:IF-Beta

作者提出了一种名为 IF-Beta 的新系统。它结合了两个聪明的想法,可以在不需要预先重新训练模型的情况下,挑选出完美的“饮食”。

1. “影响函数”(水晶球)

想象你有一个水晶球,它能告诉你:“如果我们把食谱中的这一道特定菜谱拿掉,学徒的厨艺会变差还是变好?”

在论文中,这被称为影响函数(Influence Function, IF)

  • 旧方法: 这个水晶球通常是坏的,或者使用成本太高。
  • 新方法: 作者找到了一种让这个水晶球高效运作的方法。他们使用了**平坦验证极小值(Flat Validation Minima, FVM)**技术。你可以把它理解为“磨练”教师的直觉。通过让教师知识的景观(landscape)变得更“平坦”且更稳定,水晶球可以准确预测哪些数据点真正重要,而无需先观察学徒在挣扎中学习的过程。

2. “Beta 策略”(灵活的厨师)

一旦你知道哪些食谱是重要的(通过水晶球),该如何挑选它们呢?

  • 旧方法: 使用一把僵硬的尺子。“取前 10% 最难的”或“取分数在 5 到 7 之间的所有内容”。这就像是一个饮食计划说“每天吃且仅吃 3 个苹果和 2 根香蕉”,完全不顾你是否饥饿。
  • 新方法: 作者使用了一个 Beta 策略。想象一个灵活、有弹性的网,它可以改变形状。它不再使用僵硬的尺子,而是学习如何捕捉最佳数据的“完美形状”。它可以拉伸以捕捉大部分困难样本,或者大部分简单样本,或者根据特定的教师和学生需求,捕捉一个完美的混合比例。这是一个“可学习”的饮食方案,能适应各种情况。

它是如何工作的(“双层”舞步)

该系统通过两步舞步来寻找完美的饮食:

  1. 内环(练习): 系统快速模拟学徒在少量临时数据(即“饮食”)上的学习过程。为了实现超高速运行,它不会训练一个全新的大脑,而是在教师冻结的知识之上,只训练一个简单的“线性头”(就像是一个快速的心理笔记)。
  2. 外环(教练): 系统检查学徒在这份临时饮食上的表现。如果饮食很好,那么“教练”(Beta 策略)就会调整“网”的形状,以便下次捕捉到更好的数据。如果饮食不好,教练就会重新塑造这张网。

这个过程运行得非常快,使得系统能够在没有沉重训练成本的情况下,找到最优的数据子集。

结果:食量更少,厨艺更精

论文在著名的图像数据集(如 CIFAR 和 ImageNet)上测试了该方法。结果令人惊讶:

  • 优于全量数据: 在许多情况下,仅使用 50% 到 70% 数据(使用 IF-Beta 饮食)训练出的学徒,其表现甚至比使用 100% 数据训练出的学徒更好
  • 更快、更便宜: 由于使用了更少的数据,训练所需的时间和计算能力显著降低。
  • 击败竞争对手: IF-Beta 击败了所有其他方法,包括那些需要昂贵重新训练或依赖僵化规则的方法。

核心启示

这篇论文认为,数据的质量比数量更重要。就像人类可以通过少数高质量的导师和范例,比读完图书馆里所有的书更快地掌握一项技能一样,机器学习模型如果能对其训练数据进行精心策划,也能学得更好。

作者称之为**“以饮食进行蒸馏”(Distill on a Diet)**,因为他们是在给学生模型喂食一份更小、营养更丰富且经过精心挑选的“数据分量”,从而让它比被强行喂食整个数据集时成长得更强壮、更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →