← 最新论文
💻 computer science

Condensing Large-Scale Datasets Directly with Minimal Information Loss

本文介绍了 CIM,这是一个新颖的指标驱动框架,它消除了现有数据集蒸馏方法中导致信息丢失的双重压缩范式,从而在 ImageNet-1K 等大规模数据集上以极低的计算开销实现了最先进的性能。

原作者: Xinyi Shang, Peng Sun, Bei Shi, Zixuan Wang, Tao Lin

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyi Shang, Peng Sun, Bei Shi, Zixuan Wang, Tao Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个包含数百万本书籍的巨大图书馆(一个像 ImageNet 这样庞大的数据集)。你想教一名学生(AI 模型)学习图书馆里的所有知识,但你没有足够的时间、空间或资金让他们读完每一本书。

旧方法:“总结、重写与猜测”问题

以往的方法试图通过一个被称为“挤压、恢复与重新标记”(Squeeze, Recover, and Relabel)的三步过程来解决这个问题。

  1. 挤压(Squeeze): 他们试图将数百万本书中的所有知识压缩进一个单一的、微小的、压缩后的摘要(预训练模型)中。
  2. 恢复(Recover): 然后,他们尝试将这个压缩后的摘要“展开”,从而生成一些新的、合成的图像。
  3. 重新标记(Relabel): 最后,他们要求负责“展开”过程的计算机观察这些新图像,并猜测它们应该拥有什么样的标签(名称)。

论文的发现:“模糊照片”效应

该论文的作者发现,CIM 揭示了这种旧方法的一个重大缺陷。他们意识到,“挤压”和“恢复”步骤的作用就像一台糟糕的复印机。

  • 信息泄露: 当你将数据挤压进一个模型,然后又试图将其作为图像提取出来时,你会丢失大量的细节。这就像是仅仅通过向一个必须凭记忆绘画的人描述一幅高清晰度画作,然后让他重新画出来。结果会是一个模糊且扭曲的混乱物。
  • 失效的标记器: 由于新图像变得如此扭曲(看起来与原始图像不同),用于“重新标记”的计算机会感到困惑。这就像是要求一位只认识原著书籍的图书管理员去为一张模糊的复印件贴标签。管理员会猜错,给出错误的标签。这破坏了整个学习过程。

新解决方案:CIM(“直接复制粘贴”法)

与其将数据揉皱后再试图展开,作者提出了一种名为 CIM 的新方法。

把 CIM 想象成一个聪明的拼贴画制作师

  1. 挑选最佳页面: CIM 不再试图总结整座图书馆,而是首先从原著中挑选出一组代表最重要信息的、完美的少量页面。
  2. 直接对齐: CIM 不再尝试从模型中“恢复”图像,而是直接将原始页面与新的合成拼贴画进行对比。它会询问:“这个新的拼贴画看起来和感觉起来是否与原始页面完全一致?”
  3. 填补差距: 它不断调整拼贴画,直到“信息差距”归零。它确保纹理(纸张的纹理)和含义(故事的内容)都能被完美地保留下来。

为什么这很重要

因为 CIM 跳过了混乱的“展开”步骤,所以它不会丢失信息。

  • 速度更快: 作者声称,他们仅需在单个强大的计算机芯片上花费 80 分钟,就能将整个 ImageNet-1K 数据集(一个包含 120 万张图像的庞大集合)浓缩成一小组合成图像。
  • 更聪明: 生成的合成图像质量极高,以至于当学生 AI 学习这些图像时,其表现优于那些使用以往方法生成的图像进行训练的学生。
  • 更灵活: 即使学生 AI 的“大脑结构”(架构)与制作图像的模型不同,该方法依然表现出色。

简而言之

该论文认为,试图通过压缩再解压缩数据来创建训练图像,就像是试图通过先将蛋糕变成液体、冻结、然后再将其融化回来的方式来制作一个完美的蛋糕——你会丢失味道。CIM 跳过了融化和冻结的过程;它只是直接提取原始蛋糕中最好的食材,并将它们直接排列成一个新的、完美的、微小的蛋糕,且味道完全相同。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →