Scalable GANs with Transformers
Auteurs originaux : Sangeek Hyun, MinKyu Lee, Jae-Pil Heo
Auteurs originaux : Sangeek Hyun, MinKyu Lee, Jae-Pil Heo
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé technique : GAN évolutifs avec Transformers (GAT)
1. Énoncé du problème
Bien que l'évolutivité ait été le moteur des récentes percées en modélisation générative (en particulier dans les familles autoregressives et de diffusion), les Réseaux Antagonistes Génératifs (GAN) restent sous-explorés à cet égard. Les tentatives existantes pour mettre à l'échelle les GAN reposent souvent sur des modèles uniques à haute capacité avec un réglage spécifique à la tâche, plutôt que sur une véritable évolutivité systématique. De plus, l'entraînement standard des GAN rencontre des obstacles spécifiques lors de la mise à l'échelle :
- Sous-utilisation des couches précoces : Dans les générateurs basés sur des transformers de grande taille, les premières couches deviennent souvent inactives, contribuant marginalement à la synthèse d'images.
- Instabilité de l'optimisation : Augmenter naïvement la profondeur et la largeur du modèle tout en conservant les mêmes hyperparamètres (notamment les taux d'apprentissage) conduit à des échecs de convergence. Les modèles plus grands présentent des variations de sortie par étape plus importantes sous le même taux d'apprentissage, déstabilisant la dynamique antagoniste sensible.
2. Méthodologie
Les auteurs proposent les Transformateurs Antagonistes Génératifs (GAT), un cadre qui combine deux ingrédients clés pour l'évolutivité : l'entraînement dans un espace latent compact de Variational Autoencoder (VAE) et l'utilisation d'architectures purement basées sur des transformers pour le générateur et le discriminateur.
2.1 Architecture
- Espace latent : Le modèle opère dans l'espace latent d'un VAE pré-entraîné et figé (spécifiquement SD-VAE), réduisant la charge computationnelle tout en préservant la fidélité perceptuelle.
- Générateur : Une architecture pure de Vision Transformer (ViT). Il prend un code latent z et une condition c, les traite à travers une pile de blocs de transformers (blocs GAT), et produit des images via une couche de dépatchification (décodeur linéaire). Il utilise une normalisation adaptative et LayerScale pour la stabilité.
- Discriminateur : Un backbone ViT avec un token dédié
[cls]pour la classification, utilisant également LayerScale.
2.2 Innovations clés pour l'évolutivité
Pour répondre aux modes d'échec spécifiques de la mise à l'échelle des GAN, les auteurs introduisent deux mécanismes principaux :
A. Guidance d'image perturbée par bruit multi-niveaux (MNG)
Pour empêcher les premières couches de devenir inactives, le générateur est divisé en K étapes, chacune produisant une sortie intermédiaire x^k.
- Hiérarchie du bruit : Chaque sortie intermédiaire est perturbée par un bruit gaussien dont l'intensité diminue de manière monotone avec la profondeur (α1<α2<⋯<αK=1).
- Supervision : Toutes les sorties intermédiaires perturbées sont transmises au discriminateur. Cela force les premières couches à apprendre des structures grossières sous un bruit fort et les couches ultérieures à affiner les détails fins sous un bruit faible.
- Effet : Cela encourage une trajectoire de raffinement du grossier au fin, assurant que toutes les couches contribuent activement au processus de synthèse sans nécessiter de hiérarchie d'images explicite (contrairement à MSG-GAN).
B. Mise à l'échelle du taux d'apprentissage consciente de la largeur
Pour maintenir une dynamique d'entraînement stable à travers différentes tailles de modèles, les auteurs proposent une règle de mise à l'échelle pour le taux d'apprentissage (η).
- Principe : À mesure que la largeur du modèle (dimension de canal C) augmente, la norme quadratique attendue des entrées croît linéairement, provoquant des mises à jour de sortie par étape plus importantes pour un taux d'apprentissage fixe.
- Règle : Le taux d'apprentissage doit diminuer inversement avec la dimension du canal pour maintenir constante l'ampleur des mises à jour fonctionnelles :
ηadapt=ηbase⋅CmodelCbase - Effet : Cela empêche la divergence dans les modèles plus grands et élimine le besoin d'un réglage manuel des hyperparamètres pour chaque échelle.
C. Objectifs supplémentaires
- Alignement des représentations (REPA) : Le discriminateur est aligné avec un Modèle de Fondation Visuel figé (VFM, par exemple DINOv2) en utilisant une perte de similarité sur les données réelles. Cela encourage le discriminateur à apprendre des caractéristiques sémantiquement riches, fournissant un meilleur feedback antagoniste.
- Perte antagoniste : Le cadre utilise une perte d'appariement relativiste avec des pénalités de gradient à double face (R3GAN approximé).
3. Résultats clés
Les auteurs valident GAT sur des tailles de modèles allant de Petit (S) à Extra-Large (XL) sur le jeu de données ImageNet-256.
- Performances de l'état de l'art : Le modèle GAT-XL/2 atteint un FID de 2,18 sur ImageNet-256 en seulement 60 époques. Cela représente une amélioration significative par rapport aux bases fortes à 1-NFE (une étape) comme MeanFlow-XL/2 (FID 3,43) et nécessite 4 fois moins d'époques que d'autres bases fortes (par exemple, GigaGAN nécessite 480 époques).
- Évolutivité : Les performances s'améliorent de manière monotone à mesure que la taille du modèle augmente (S → XL). Il existe une forte corrélation négative (-0,95) entre le coût d'inférence (GFLOPs) et le FID, et une corrélation similaire pour le calcul total d'entraînement, suivant une loi de puissance : FID(C)≈3,52×105⋅C−0,456.
- Efficacité : GAT conserve l'avantage de l'inférence en une seule étape des GAN (1 NFE), offrant une accélération d'environ 200 fois en temps d'inférence par rapport aux modèles de diffusion multi-étapes (par exemple, DiT) à qualité comparable.
- Études d'ablation :
- La suppression de MNG entraîne des couches précoces inactives et une dégradation des performances.
- L'utilisation d'un taux d'apprentissage fixe à travers les échelles provoque une divergence dans les modèles plus grands ou une convergence lente dans les plus petits.
- L'objectif REPA améliore considérablement les performances, démontrant que les techniques issues des modèles de diffusion se transfèrent efficacement aux GAN.
- Généralisation : La méthode s'étend à des résolutions plus élevées (ImageNet-512) et à différents tokeniseurs (FLUX-e2e), et prend en charge la génération texte-à-image (MS-COCO) et la génération non conditionnelle (FFHQ).
4. Importance et affirmations
L'article affirme que GAT établit avec succès un cadre de GAN évolutif qui rivalise avec les performances des modèles de diffusion et autoregressifs modernes, tout en conservant les avantages uniques des GAN :
- Inférence en une seule étape : Génération à haute efficacité sans débruitage itératif.
- Manipulation latente : La capacité d'effectuer une interpolation latente fluide et une édition sémantique, qui reste cohérente même à grande échelle.
- Efficacité des données : Atteinte de résultats de l'état de l'art avec significativement moins d'époques d'entraînement par rapport aux bases de diffusion.
Les auteurs positionnent ce travail comme une étape vers la « mise à l'échelle des GAN », démontrant qu'avec les bons choix architecturaux (transformers purs) et stratégies d'optimisation (MNG et taux d'apprentissage conscients de la largeur), l'apprentissage antagoniste peut être rendu robuste et évolutif, remettant en question l'idée que les GAN sont intrinsèquement limités dans leur potentiel de mise à l'échelle par rapport aux modèles de diffusion.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.
Recevez les meilleurs articles AI chaque semaine.
Adopté par des chercheurs de Stanford, Cambridge et de l'Académie des sciences.
Vérifiez votre boîte mail pour confirmer votre inscription.
Quelque chose s'est mal passé. Réessayer ?
Pas de spam, désinscription à tout moment.