问题:AI 艺术中的“强者恒强”现象
想象一所艺术学校,老师(AI)需要学习画 1,000 种不同的主题。
- “头部”类别: 对于像“狗”或“汽车”这样的主题,老师拥有 10,000 张照片的素材库。他们因此成为了这些主题的专家。
- “尾部”类别: 对于像“红酒”或“某种特定类型的蠕虫”这样罕见的主题,老师只有 一两张 照片。
因为老师看到这些罕见主题的次数极少,他们就会陷入僵局。当被要求画“红酒”时,他们只会一遍又一遍地复制那唯一的一张照片。他们无法想象出不同的瓶身、不同的光影或不同的角度。在 AI 术um中,这被称为模式崩溃(mode collapse):AI 变得偷懒,对于稀有类别只能生成重复、单调的图像。
解决方案:CCUA(“两步舞法”)
作者提出了一种名为 CCUA(对比条件-无条件对齐)的新训练方法。你可以把它想象成一套“两步舞法”,旨在教导 AI 如何在不忘记如何绘制常见主题的前提下,对罕见主题进行创意创作。
第一步:“盲画草图”(对齐损失)
比喻: 想象 AI 正在尝试画一瓶“红酒”(条件)和一团“随机色块”(无条件)。
- 洞察: 在绘画过程的最开始几秒钟(即画布大部分还只是噪声和静电干扰时),一张红酒的照片看起来非常像一团随机色块。它们最初都是模糊、低分辨率的混乱状态。
- 技巧: 作者告诉 AI:“在绘画的前几步,假装你不知道自己在画什么。只需画出一个通用的、高质量的‘色块’。”
- 为什么有效: 由于 AI 拥有数以千计的“色块”案例(来自所有常见类别),它学会了如何以一种丰富且多样化的方式开始绘画。通过强制要求 AI 在开始画“红酒”时的起手式与开始画“色块”时保持一致,AI 能够从常见类别中“借用”其创造力和多样性,并将其应用到罕见类别中。
第二步:“排斥力”(无监督对比损失)
比喻: 想象 AI 已经完成了草图,现在正在添加细节。
- 问题: 如果没有帮助,AI 可能仍会试图模仿那唯一的一张“红酒”照片,导致生成 100 张一模一样的画作。
- 技巧: 作者增加了一条规则:“每当你画一瓶‘红酒’时,你必须确保它看起来与你在这一批次中刚刚画过的其他‘红酒’是不同的。”
- 运作方式: 他们使用了一种数学上的“排斥力”。如果两张生成的图像看起来过于相似,AI 就会受到惩罚。这迫使 AI 在想象力中将这些图像推开,从而创造出多样性(不同的角度、颜色、形状),即使它在训练过程中只有一个参考样本。
两者如何协同工作
魔法发生在结合这两个步骤的时候:
- 对齐(Alignment) 让罕见类别在创作的早期阶段能够“窃取”通用知识和多样性。
- 对比损失(Contrastive Loss) 确保一旦 AI 开始添加细节,它就不会只是简单的复制粘贴,而是会主动尝试让每一张图像都独一无二。
实验结果
作者在名为 ImageNet-LT 的大规模数据集(包含许多稀有类别)上测试了该方法。
- 之前: AI 在绘制罕见物品时表现挣扎,经常产生模糊或与训练中仅有的几张照片完全相同的重复图像。
- 之后(使用 CCUA): AI 生成的罕见图像不仅更清晰(高保真度),而且更加多样化(高多样性)。即使在训练期间只见过一个例子,它也能以多种不同的方式画出“红酒”。
总结
本文通过教导 AI 以相同的方式开始每一幅画(借鉴通用知识)并强制要求最终结果各不相同(利用排斥力),解决了 AI “不擅长处理稀有事物”的问题。这使得 AI 能够在不需要更多训练数据的情况下,为罕见类别生成高质量且多样化的图像。
技术摘要:用于长尾扩散模型的对比式条件-无条件对齐 (CCUA)
问题陈述
用于类别条件图像合成的训练数据通常呈现长尾分布,其特征是“尾部”类别的图像数量远少于“头部”类别。这种不平衡导致扩散模型在为这些代表性不足的类别生成图像时,会出现**模式崩塌(mode collapse)**和多样性降低的问题。现有的方法,包括标准的去噪扩散概率模型 (DDPM) 和基于分数的扩散模型 (SBDM),往往无法在不损害头部类别生成质量的前提下,为这些欠代表类别生成高保真度和多样性的图像。虽然对比学习已在长尾识别和基于 GAN 的生成中被证明有效,但将其应用于扩散模型以解决类别不平衡生成问题,需要进行新的适配,以应对去噪过程的具体机制。
方法论:对比式条件-无条件对齐 (CCUA)
作者提出了 CCUA,这是一个包含两个协同损失函数的框架,旨在提高尾部类图像的多样性和保真度,同时保持头部类别的质量。该方法兼容基于 U-Net 的架构以及扩散 Transformer (DiT/SiT)。
1. 用于无条件生成的无监督对比损失 (UCL)
为了解决模式崩塌问题,作者引入了一种应用于无条件生成潜变量的无监督对比损失。
- 机制: 将噪声估计网络拆分为一个潜变量编码器 e(⋅) 和一个解码器 d(⋅)。编码器将噪声图像 xt 映射到低维潜变量 h。
- 损失公式: 该损失使用仅包含负样本的 InfoNCE 式公式。在同一个小批量(mini-batch)内,每张图像作为锚点(anchor),批次中的所有其他图像作为负样本。这里没有通过数据增强创建正样本对;锚点本身被视为自身的正向向量。
- 目标: 这在潜变量空间中创造了一种“排斥力”,无论类别如何,都使合成图像之间的距离最大化。这迫使模型使无条件潜变量多样化,防止它们崩塌为一个常数向量或过拟合于有限的训练样本。
- 理论依据: 直接将对比损失应用于条件潜变量会导致一个平凡解,即模型在最大化类间多样性(分离类别)的同时忽略了类内多样性。通过将损失应用于无条件潜变量,模型被强制使所有样本多样化,这种多样性随后通过第二个损失函数蒸馏到条件生成中。
2. 用于条件-无条件对齐的对齐损失 (AL)
第二个组件将条件生成与多样化的无条件生成进行对齐。
- 机制: 该损失最小化条件分布 pθ(xt−1∣xt,c) 与无条件分布 pθ(xt−1∣xt) 之间的 KL 散度。在实践中,这被简化为估计噪声 ϵθ(xt,t,c) 与 ϵθ(xt,t,∅) 之间的 MSE 损失。
- 时间权重: 至关重要的是,这种对齐在大时间步长(反向过程的初始阶段)处权重更高。
- 动机: 作者观察到,在初始去噪步骤期间,来自不同类别的图像(以及条件生成与无条件生成之间)的低频分量高度相似。通过对齐这些初始步骤,模型可以促进知识共享,将知识从头部类别(数据丰富)传递给尾部类别(数据稀缺)。这使得尾部类别能够在生成的早期阶段,从头部类别所学习到的丰富多样性中获益。
3. 协同作用
该框架将标准的 DDPM 损失与提出的 CCUA 损失相结合:
Ltotal=Lddpm+α⋅Lucl+γ⋅Lal
其协同作用在于:UCL 使无条件潜变量空间多样化,而 AL 将条件潜变量空间对齐到这个多样化的无条件空间。这种对条件潜变量的间接多样化处理,在实验中被证明比直接对条件潜变量应用对比损失更为有效。
核心贡献
- CCUA 框架: 一种针对类别不平衡扩散模型的新颖方法,结合了无条件潜变量上的无监督对比学习与条件-无条件对齐损失。
- 对齐策略: 提出专门在大时间步长(初始去噪步骤)对齐条件与无条件生成,以利用低频分量的相似性并实现从头部到尾部的知识迁移。
- 无监督对比正则化: 使用仅含负样本的无监督对比损失作用于无条件潜变量,在不需要类别标签进行对比配对的情况下,最大化类内和类间多样性。
- 架构无关性: 该方法被证明在基于 U-Net 的架构和扩散 Transformer (SiT) 上均有效。
实验结果
该方法在 ImageNet-LT (256×256)、TinyImageNet-LT (64×64)、Places-LT (64×64) 和 CIFAR-LT 数据集上进行了评估。
- 定量性能:
- 在 ImageNet-LT 上,CCUA 显著优于包括 SiT、CBDM、REPA 和 Dispersive Loss 在内的基线模型。
- 在 900k 训练步数时,CCUA 实现了 FID 为 15.1(相比之下 SiT 为 19.9)和 FIDtail 为 22.5(相比之下 SiT 为 33.9),代表了尾部类别保真度约 11.4 点的提升。
- 该方法在全线指标上也提高了召回率(多样性)和精确度(保真度)。
- 在 TinyImageNet-LT 上,CCUA 取得了最佳的 FID (12.0) 和 FIDtail (20.8),超越了 DDPM、CBDM 和 OCLT。
- 定性结果: 可视化显示,与经常在这些类别上产生重复或低质量图像的标准 SiT 相比,CCUA 能为尾部类别(例如“红葡萄酒”、“浓缩咖啡”、“窗帘”)生成更高多样性和保真度的图像。
- 消融实验:
- 两种损失的结合是必要的;仅使用其中之一会导致结果欠佳。
- 在大时间步长应用对齐损失(线性权重)优于恒定或二次方权重。
- 使用来自 Transformer 第 N/4 块的潜变量表示,通常能在整体 FID 与空间 FID/召回率之间提供最佳权衡。
重要性与主张
本文声称 CCUA 通过将长尾 GAN 的原则(特别是针对较低分辨率/早期阶段的无条件训练)适配到扩散范式中,有效地解决了长尾生成问题。通过将多样化任务(由无条件对比学习处理)与条件任务(由对齐处理)解耦,该方法避免了直接进行条件对比正则化的陷阱。
作者强调,其方法:
- 在不降低头部类别质量的前提下,改善了尾部类别的生成。
- 易于在现有的 DDPM 和 SBDM 流水线中实现。
- 在极端类别不平衡场景下(例如不平衡因子为 0.001 的 ImageNet-LT),优于同期的 Dispersive Loss 和 DiffROP。
- 为为什么在反向过程的初始步骤对齐条件与无条件生成有利于长尾设置下的知识共享,提供了理论和实证依据。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。