← 最新论文
💻 computer science

Towards Consistent and Efficient Dataset Distillation via Diffusion-Driven Selection

本文提出了一种新颖的数据集蒸馏框架,该框架利用预训练扩散模型,基于预测噪声损失和类内聚类来选择具有代表性的图像块,从而实现了一种比现有基于生成的方法在大型数据集上表现更优的流线型单步过程。

原作者: Xinhao Zhong, Shuoyang Sun, Zhaoyang Xu, Xulin Gu, Bin Chen, Min Zhang, Yaowei Wang

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinhao Zhong, Shuoyang Sun, Zhaoyang Xu, Xulin Gu, Bin Chen, Min Zhang, Yaowei Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正试图教一名学徒烹饪一场盛大且复杂的宴会(就像一个包含数千道菜品的完整 ImageNet 数据集)的大厨。通常情况下,你必须向学徒展示每一道菜、每一种食材以及每一个步骤。这既耗时,又需要巨大的厨房(内存),还会消耗大量的燃气(计算能力)。

数据集蒸馏(Dataset Distillation) 的概念就是制作这样一个精巧的“小抄”或“精简菜单”,它如此完美,以至于学徒只需通过研究这寥寥几例,就能掌握整场宴会的精髓。

过去“小抄”存在的问题

过去,科学家们尝试通过两种方式来制作这些精简菜单:

  1. 逐像素优化(Pixel-by-Pixel Optimization): 试图通过数学手段去微调几张图像中的每一个像素,使其达到完美。这就像是用手去雕刻一件杰作,速度极慢,而且只适用于小型、简单的菜品(如 CIFAR-10)。当你试图处理像 ImageNet 这样庞大的宴会时,整个厨房都会因为复杂度过高而“爆炸”。
  2. AI 生成(AI Generation): 使用强大的 AI(扩散模型)从零开始“发明”看起来像真实菜肴的新图像。问题在于,这个 AI 是在与你的菜单不同的“菜单”(互联网)上训练出来的。它可能会发明出一只看起来像“云朵”的“金毛寻回犬”,或者一只看起来像“长着翅膀的鱼”的“鲨鱼”。这造成了分布偏移(distribution shift)——这些“伪造食物”的味道并不完全符合真实食物的味道。

全新的解决方案:“扩散驱动的选择”(Diffusion-Driven Selection)

本文作者提出了一种聪明的新方法来制作这份小抄。他们不是要求 AI 去创造新的食物,而是要求 AI 充当评论家,去寻找厨房里现有的真实食物中最精华的部分。

以下是他们的方法是如何运作的,我们用一个简单的类比来说明:

第一步:“盲测品鉴”(第一阶段)

想象你有一张真实的金毛寻回犬的大照片。你想知道:“这张照片中哪一部分最像‘金毛寻回犬’?”

  • 你使用一个预训练好的 AI(Stable Diffusion),并让它猜出将一张空白屏幕变成“金毛寻回犬”所需的噪声(静态噪声)。
  • 然后,你再让它猜出将一张空白屏幕变成“一只狗”(不强调具体品种)所需的噪声。
  • 神奇之处在于: 通过对比这两个猜测,AI 会标出哪些像素让这只狗看起来特指为“金毛寻回犬”。这就像是 AI 用激光笔指向了狗的垂耳和金色的毛发,并说道:“这部分才是重点!”
  • 他们从真实的图像中裁剪出这些被“激光指向”的局部块(patches)。他们并不是在制作新图像,而是在切割真实图像中最精华的部分。

第二步:“分组派对”(第二阶段)

现在你拥有了成千上万个这样的“精华片段”。有些是耳朵,有些是尾巴,有些是鼻子。

  • 如果你只是把它们乱丢进一个袋子里,那会非常混乱。
  • 因此,作者使用了一种聚类技术(就像按颜色和图案来分类袜子一样)将相似的局部块组合在一起。
  • 他们从每个组中挑选出最具代表性的那只“袜子”,以确保最终的精简菜单既具有多样性(diversity),又能捕捉到每个类别的本质。

为什么这是一个游戏规则的改变者

该论文声称取得了三大胜利:

  1. 不再有“伪造食物”: 因为他们是从真实图像中切割碎片,而不是生成虚假的图像,所以数据分布与原始数据完全一致。不存在“幻觉”或奇怪的伪影。
  2. 单步流程: 旧的方法通常在你想要改变图像数量或类别类型时,必须重新运行整个过程。而这种新方法就像是一个“一键式”按钮。你只需运行一次,就能得到适用于多种不同设置的数据集。
  3. 速度与规模: 它可以在大规模数据集(如 ImageNet-1K)和复杂模型(如 ResNet-101)上运行,而之前的各种方法在这些场景下要么失败,要么耗时过长。

结果

在实验中,这种“剪切与粘贴”的方法(由 AI 识别特征进行引导)始终优于现有的顶尖方法。它产生的小型数据集在训练模型时,表现得与庞大的原始数据集一样好(甚至更好),且无需承担尝试优化像素或从头生成新图像所带来的沉重计算成本。

简而言之: 这个方法不是要求 AI 去一幅新的狗的画像,而是要求 AI 指向真实照片中最像狗的部分,将其剪切出来,并整理成一份精简且完美的学习指南。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →