Scalable GANs with Transformers
原作者: Sangeek Hyun, MinKyu Lee, Jae-Pil Heo
原作者: Sangeek Hyun, MinKyu Lee, Jae-Pil Heo
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:基于 Transformer 的可扩展生成对抗网络(GAT)
1. 问题陈述
尽管可扩展性推动了生成建模领域的近期突破(特别是在自回归和扩散模型家族中),但生成对抗网络(GANs)在此方面仍未被充分探索。现有的扩展 GAN 的尝试往往依赖于单一的高容量模型,并进行大量的特定任务微调,而非展示真正系统性的可扩展性。此外,标准 GAN 训练在扩展时面临特定障碍:
- 早期层利用不足:在基于 Transformer 的大型生成器中,早期层往往处于非活跃状态,对图像合成的贡献微乎其微。
- 优化不稳定性:在保持超参数(特别是学习率)不变的情况下,盲目增加模型深度和宽度会导致收敛失败。在相同学习率下,较大模型表现出更大的每步输出变化,从而破坏了敏感的对抗动态。
2. 方法论
作者提出了生成对抗 Transformer(GAT),这是一个结合了两大可扩展性关键要素的框架:在紧凑的变分自编码器(VAE)潜在空间中进行训练,以及为生成器和判别器均采用纯 Transformer 架构。
2.1 架构
- 潜在空间:模型在预训练且冻结的 VAE(具体为 SD-VAE)的潜在空间中运行,在保持感知保真度的同时降低了计算负担。
- 生成器:采用纯视觉 Transformer(ViT)架构。它接收潜在代码 z 和条件 c,通过一系列 Transformer 块(GAT 块)进行处理,并通过解补丁层(线性解码器)输出图像。它采用自适应归一化和 LayerScale 以确保稳定性。
- 判别器:采用带有专用
[cls]标记用于分类的 ViT 骨干网络,同样利用 LayerScale。
2.2 可扩展性的关键创新
为了解决扩展 GAN 时的特定失效模式,作者引入了两种主要机制:
A. 多级噪声扰动图像引导(MNG)
为防止早期层变得非活跃,生成器被划分为 K 个阶段,每个阶段产生一个中间输出 x^k。
- 噪声层级:每个中间输出均受到高斯噪声的扰动,其强度随深度单调递减(α1<α2<⋯<αK=1)。
- 监督:所有受扰动的中间输出均被转发至判别器。这迫使早期层在强噪声下学习粗略结构,而后期层在弱噪声下细化细节。
- 效果:这鼓励了一种从粗略到精细的细化轨迹,确保所有层都积极参与合成过程,而无需显式的图像层级(不同于 MSG-GAN)。
B. 宽度感知学习率缩放
为了在不同模型规模下保持稳定的训练动态,作者提出了一种学习率(η)的缩放规则。
- 原理:随着模型宽度(通道维度 C)的增加,输入的期望平方范数线性增长,导致在固定学习率下每步输出更新幅度更大。
- 规则:学习率应随通道维度成反比减小,以保持功能更新的幅度恒定:
ηadapt=ηbase⋅CmodelCbase - 效果:这防止了较大模型的发散,并消除了为每个规模手动调整超参数的需求。
C. 其他目标
- 表示对齐(REPA):判别器通过真实数据上的相似性损失与冻结的视觉基础模型(VFM,例如 DINOv2)进行对齐。这鼓励判别器学习语义丰富的特征,从而提供更好的对抗反馈。
- 对抗损失:该框架使用相对配对损失(relativistic pairing loss)结合双边梯度惩罚(近似 R3GAN)。
3. 关键结果
作者在 ImageNet-256 数据集上,针对从小型(S)到超大型(XL)的不同模型规模验证了 GAT。
- 最先进性能:GAT-XL/2 模型在仅 60 个 epoch 内就在 ImageNet-256 上实现了 2.18 的 FID。这比强大的单步(1-NFE)基线模型 MeanFlow-XL/2(FID 3.43)有显著改进,并且比其他强基线模型(例如 GigaGAN 需要 480 个 epoch)所需的 epoch 数少 4 倍。
- 可扩展性:随着模型规模增大(S → XL),性能单调提升。推理成本(GFLOPs)与 FID 之间存在强负相关(-0.95),总训练计算量与 FID 之间也存在类似的相关性,遵循幂律:FID(C)≈3.52×105⋅C−0.456。
- 效率:GAT 保留了 GAN 的单步推理优势(1 NFE),在可比质量下,其推理时间比多步扩散模型(例如 DiT)快约 200 倍。
- 消融研究:
- 移除 MNG 会导致早期层非活跃且性能下降。
- 在不同规模上使用固定学习率会导致较大模型发散或较小模型收敛缓慢。
- REPA 目标显著提升了性能,证明了扩散模型中的技术可以有效地迁移到 GAN 中。
- 泛化性:该方法可扩展至更高分辨率(ImageNet-512)和不同的 Tokenizer(FLUX-e2e),并支持文本到图像生成(MS-COCO)和无条件生成(FFHQ)。
4. 意义与主张
本文声称 GAT 成功建立了一个可扩展的 GAN 框架,其性能可与现代扩散模型和自回归模型相媲美,同时保留了 GAN 的独特优势:
- 单步推理:无需迭代去噪即可实现高效生成。
- 潜在空间操控:能够执行平滑的潜在空间插值和语义编辑,即使在大规模下也能保持连贯性。
- 数据效率:与扩散模型基线相比,仅需显著更少的训练 epoch 即可实现最先进结果。
作者将这项工作定位为迈向“扩展 GAN"的一步,证明了通过正确的架构选择(纯 Transformer)和优化策略(MNG 和宽度感知学习率),对抗学习可以变得稳健且可扩展,从而挑战了 GAN 在扩展潜力上 inherently 不如扩散模型的观点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 AI 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。