← 最新论文
💻 computer science

Geometry-Aware Dataset Condensation for Diffusion Model Training

本文提出了几何感知数据集压缩(GADC),该方法通过使用单侧部分最优传输和语义正则化,将真实子集选择重新表述为一个几何感知分布对齐问题,旨在构建能够保留有效扩散模型训练所需的几何结构和分布保真度的紧凑数据集。

原作者: Xiao Cui, Yulei Qin, Mo Zhu, Wengang Zhou, Hongsheng Li, Houqiang Li

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiao Cui, Yulei Qin, Mo Zhu, Wengang Zhou, Hongsheng Li, Houqiang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一位大师级厨师(一个扩散模型)如何烹饪出一顿完美的佳肴。传统上,你会给他们提供一个包含数百万份食谱和食材的海量图书馆(全量数据集)。虽然这种方法可行,但阅读所有内容需要耗费极长时间,成本高昂,且需要一个巨大的厨房来进行处理。

数据集压缩(Dataset Condensation) 的理念是创建一个仅包含几十份完美食谱的微型“速查表”,在没有冗余负担的情况下,教会厨师所需的一切知识。

然而,以往尝试制作这些速查表的尝试都面临两个大问题:

  1. 合成伪造: 有些人试图从零开始发明新的食谱。结果是?这些食谱看起来很怪异,吃起来感觉很假,让厨师感到困惑。
  2. 糟糕的选择: 另一些人则试图直接挑选现有的“最佳”食谱。但他们是基于单一、简单的评分(比如“这个食谱有多难?”)来进行挑选的。这忽略了大局,导致遗漏了重要的变化并产生了偏差。

本论文提出了一种构建这种速查表的新方法,称为几何感知数据集压缩(Geometry-Aware Dataset Condensation)。以下是其工作原理,使用简单的类比进行说明:

1. 问题所在:“一维化”错误

想象一下,完整的数据集是一个巨大的、复杂的城市,拥有街区、公园和摩天大楼(数据分布)。

  • 旧方法 (D2C): 这种方法试图通过基于“难度”的一条直线来对最好的房子进行排名。这就像是试图通过仅仅观察高度来挑选一个三维城市中的最佳房屋。你可能会选出一座高耸却空旷的摩天大楼,却错过了一间温馨且必不可少的农舍。你丢失了城市的形状
  • 目标: 我们需要挑选一小组能够完美代表整个城市整体形状的房屋,保持公园、街道和街区的完整性。

2. 解决方案:“单侧部分传输”

作者使用了一个名为**最优传输(Optimal Transport)**的数学工具,它就像一家物流公司,试图将货物从一个仓库(全量数据集)转移到一个较小的仓库(压缩后的子集)。

  • 旧方式(平衡传输): 旧规则规定:“你必须将大仓库里的每一粒沙子都搬运到小仓库里,并完美匹配重量。”
    • 缺陷: 由于小仓库非常小,这迫使物流公司不得不把城市边缘(低密度区域)那些沉重且无用的沙子也拖到小仓库里,以填满重量配额。这扭曲了地图。
  • 新方式(单侧部分传输): 作者说:“我们只需要搬运重要的货物。我们不需要搬运那些空旷、低密度郊区的沙子。”
    • 益处: 这使得小仓库能够完全专注于城市的“核心”——繁忙的街道和受欢迎的街区。它确保了小规模子集能够捕捉到原始数据的真实几何结构(形状和结构),而不会被噪声所拖累。

3. 安全网:“统计正则化”

仅仅搬运货物是不够的;我们需要确保新的仓库仍然感觉像原来的城市。作者添加了两个“安全网”:

  • 均值-方差检查: 他们确保小仓库中建筑物的平均“高度”和“分布范围”与大城市相匹配。如果大城市有高有矮的建筑组合,那么小仓库也必须具备同样的组合。
  • 置信度检查: 他们确保所选的房屋是清晰可辨的。如果一座房子看起来像个模糊的团块,分不清是谷仓还是车库,他们就会将其剔除。这确保了“厨师”不会被模棱两可的例子所迷惑。

4. 策略:“贪婪构建 + 交换优化”

你如何实际挑选出这些特定的房屋?你不能检查所有可能的组合(组合数量太多了!)。因此,他们使用了两步走的策略:

  1. 贪婪构建: 从一片空地开始,逐一添加房屋,每次都选择当前对地图提升最大的那一个。这就像是一块一块地拼凑拼图。
  2. 交换: 一旦拼图完成,他们就开始寻找错误。“嘿,这个角落里的房子不太行,让我们把它和外面的那个换一下。”他们不断进行交换,直到地图变得尽可能完美。

实验结果

当他们在 ImageNet(一个包含 140 万张图像的庞大数据库)上测试这种方法以训练 AI 图像生成器时:

  • 更好的质量: 与之前的方法相比,他们生成的图像看起来更清晰、更多样化(具有更低的“FID”分数)。
  • 高效性: 他们仅使用 0.8% 的原始数据(10,000 张图像而非 140 万张)即可进行训练,并且效果甚至优于使用原始数据的随机切片。
  • 速度: 选择这 10,000 张图像的过程比之前的方法要快得多。

总结:
这篇论文告诉我们,要用一个小数据集来训练强大的 AI,你不应该仅仅挑选“最难”或“最容易”的样本。相反,你应该通过数学手段挑选出一组微小的图像,它们能完美地保留原始庞大数据集的形状、结构和多样性,同时忽略掉那些空旷、嘈杂的边缘。这就像是在策划一场博物馆展览,仅用一个房间就捕捉到了整个艺术史收藏的灵魂。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →