← Derniers articles
⚡ electrical engineering

AGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models

Cet article introduit JAGG (Jacobian-Aggregated Group Gradient), une méthode qui exploite la variation quasi linéaire des trajectoires de modèles de diffusion pour approximer les Jacobiens intermédiaires et agréger les gradients de groupe, réduisant ainsi le coût computationnel de l'entraînement par Group Relative Policy Optimization (GRPO) pour les Diffusion Transformers d'environ 2× sans perte de qualité significative.

Auteurs originaux : Ruiyi Ding, Jie Li, He Kang, Ziyan Liu, Chengru Song, Yuan chen

Publié 2026-07-21
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Ruiyi Ding, Jie Li, He Kang, Ziyan Liu, Chengru Song, Yuan chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un artiste numérique à mieux peindre des tableaux. Cet artiste n'est pas un humain ; c'est un programme informatique complexe appelé « modèle de diffusion ». Imaginez ce modèle comme un sculpteur qui part d'un bloc d'argile bruyant, rempli de statique, et qui retire progressivement le bruit, étape par étape, jusqu'à ce qu'une statue parfaite émerge. Pour apprendre à ce sculpteur à créer de l'art que les humains apprécient réellement, nous utilisons une technique appelée « Apprentissage par Renforcement » (Reinforcement Learning). C'est comme un jeu où le sculpteur tente différents mouvements de ciseau, reçoit un score de la part d'un juge (un modèle de récompense), puis apprend de ce score pour faire mieux la prochaine fois.

Le problème est que ce processus d'apprentissage est incroyablement coûteux. Chaque fois que le sculpteur fait un petit coup de ciseau (une « étape » dans le processus), l'ordinateur doit effectuer un calcul massif et gourmand en énergie pour déterminer exactement comment ajuster le cerveau du sculpteur. Si la statue nécessite 20 étapes pour être terminée, l'ordinateur doit effectuer ce calcul lourd 20 fois pour chaque leçon. C'est comme essayer d'apprendre une nouvelle danse en s'arrêtant après chaque mouvement pour demander une critique complète à un entraîneur, en réécrivant toute votre mémoire musculaire, puis en recommençant. Pour les images à haute résolution, cela prend tellement de temps et d'électricité qu'il est presque impossible d'entraîner ces modèles efficacement.

C'est là qu'intervient une nouvelle idée appelée JAGG. Les chercheurs derrière cet article se sont posé une question intelligente : « Avons-nous vraiment besoin de nous arrêter et de tout recalculer après chaque mouvement ? » Ils ont remarqué que dans les premières étapes désordonnées du processus de sculpture, les changements se produisent de manière très fluide et prévisible — presque comme une ligne droite. Si vous savez où la sculpture commence et où elle finit après quelques mouvements, vous pouvez en réalité deviner ce qui s'est passé au milieu sans effectuer le calcul lourd pour chaque étape.

L'article présente une méthode appelée JAGG (Jacobian-Aggregated Group Gradient). Au lieu de s'arrêter pour calculer la leçon après chaque étape, JAGG permet au modèle d'effectuer un groupe d'étapes (disons, quatre mouvements consécutifs) et ne réalise le calcul lourd de la « mise à jour du cerveau » que deux fois : une fois au tout début du groupe et une fois à la toute fin. Pour les étapes intermédiaires, il utilise un raccourci intelligent. Il suppose que le chemin entre le début et la fin est une ligne droite et comble les lacunes.

Les chercheurs ont prouvé mathématiquement que si le processus de sculpture est parfaitement fluide et linéaire, ce raccourci est en réalité parfait — il donne exactement la même réponse qu'en faisant le travail difficile à chaque fois. Dans le monde réel, où les choses ne sont pas parfaitement droites, ils ont constaté que ce raccourci fonctionne extrêmement bien durant les premières étapes « bruitées » de la création d'images. En utilisant cette méthode, ils ont pu réduire le temps nécessaire pour entraîner ces modèles d'environ 17 % à 18 % par étape.

Le meilleur dans tout cela ? La qualité des images n'en a pas souffert. Lorsqu'ils ont testé JAGG sur différents modèles (comme Flux et QwenImage), les images générées étaient tout aussi bonnes que celles créées par la méthode traditionnelle lente. En fait, dans certains cas, le raccourci a même aidé le modèle à apprendre plus stablement. L'article montre qu'en étant un peu plus astucieux sur le moment où effectuer le gros du travail, nous pouvons rendre l'entraînement de ces puissants artistes IA beaucoup plus rapide et moins coûteux, sans sacrifier la beauté de l'œuvre finale.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →