← Derniers articles
💻 computer science

Memorization In Stable Diffusion Is Unexpectedly Driven by CLIP Embeddings

Cet article révèle que la mémorisation dans Stable Diffusion est de manière inattendue entraînée par la duplication structurelle de l'embedding de fin de texte dans les tokens de remplissage, ce qui amplifie son influence, et propose des stratégies simples lors de l'inférence pour atténuer ce problème sans dégrader la qualité de l'image.

Auteurs originaux : Bumjun Kim, Albert No

Publié 2026-05-06
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bumjun Kim, Albert No

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Gros Problème : Le Modèle est « Bloqué » sur des Souvenirs

Imaginez un artiste talentueux (Stable Diffusion) qui a été formé sur des millions de photos. Parfois, lorsque vous demandez à cet artiste de dessiner quelque chose de nouveau, il copie accidentellement une photo spécifique de son ensemble d'entraînement, exactement, pixel par pixel. C'est ce qu'on appelle la mémorisation. C'est un risque pour la vie privée et le droit d'auteur car le modèle ne crée rien de nouveau ; il régurgite simplement d'anciennes données.

Les scientifiques tentent de comprendre pourquoi cela se produit. La plupart des théories se concentraient sur les mots que vous tapez (l'invite) ou sur les mathématiques internes du modèle. Ce papier, cependant, a découvert un coupable surprenant se cachant dans le « remplissage » des instructions.

Le Contexte : Comment l'Artiste Lit les Instructions

Pour comprendre la découverte, nous devons examiner comment l'artiste lit vos instructions.

  1. L'Invite : Vous tapez une phrase comme « Un chat sur un tapis ».
  2. La Limite : L'artiste ne peut lire les instructions que jusqu'à une certaine longueur (77 « tokens » ou parties de mots).
  3. Le Remplissage : Si votre phrase est courte (par exemple, seulement 10 mots), l'ordinateur doit remplir les 67 espaces vides restants pour atteindre la limite de 77.

L'Ancienne Méthode (Stable Diffusion v1.4) :
L'ordinateur remplit ces espaces vides avec un token spécial « Fin du Texte » (appelons-le <eot>).

  • L'Analogie : Imaginez que vous lisez une histoire, mais que la dernière page est blanche. Au lieu de la laisser blanche, l'imprimante continue d'estamper les mots « FIN » encore et encore jusqu'à ce que la page soit pleine.
  • Ainsi, pour une invite courte, l'artiste voit : [Vos Mots] + [FIN] + [FIN] + [FIN]... (répété 60 fois ou plus).

La Découverte : L'Effet « Chambre d'Écho »

Les auteurs du papier ont découvert que l'artiste s'appuie lourdement sur ces estampes répétées de « FIN » pour décider quoi dessiner, en particulier lors de la mémorisation d'images.

Voici la chaîne d'événements qu'ils ont découverte :

  1. Inadéquation de l'Entraînement : Le système qui traduit les mots en mathématiques (appelé CLIP) a été entraîné pour traiter le premier token « FIN » comme le résumé le plus important de toute la phrase. Il a appris à ignorer les mots réels et les tokens de remplissage.
  2. Le Bug : Parce que l'ordinateur remplit l'espace vide avec plus de tokens « FIN », l'artiste voit soudainement le token « FIN » répété des dizaines de fois.
  3. L'Amplification : L'artiste pense : « Wow, il y a tellement de tokens « FIN » ! Cela doit être la partie la plus importante de l'instruction ! »
  4. Le Résultat : Le modèle se concentre excessivement sur ce token répété. Si ce motif spécifique « FIN » était associé à une image protégée par le droit d'auteur pendant l'entraînement, le modèle se retrouve piégé dans une boucle et reproduit cette image exacte, ignorant votre demande réelle.

La Métaphore :
Imaginez un chœur où le chef d'orchestre (le modèle) est censé écouter le soliste (votre invite). Mais, les membres du chœur crient tous « STOP ! » (le token de remplissage) encore et encore. Le chef d'orchestre est tellement submergé par les cris qu'il arrête d'écouter le soliste et se met simplement à marcher en rond en suivant les commandes « STOP ! ». Si la commande « STOP ! » était précédemment liée à une danse spécifique, le chœur répète simplement cette danse, en ignorant la musique.

Le Twist Surprenant : Les Mots Ne Comptent Pas Autant

Les auteurs ont testé cela en retirant les mots réels de l'invite et en les remplaçant par le token « Fin ».

  • Résultat : Le modèle pouvait toujours générer une image reconnaissable.
  • Conclusion : Les mots réels que vous avez tapés (l'invite) contribuent très peu à la partie mémorisation du processus. Ce sont les tokens « remplissage » qui font le gros du travail pour le comportement de copie.

La Solution : Deux Corrections Simples

Le papier propose deux moyens faciles d'arrêter cela sans réentraîner tout le modèle ni le ralentir. Les deux sont des corrections « au moment de l'inférence », ce qui signifie que vous pouvez les appliquer juste avant que l'image ne soit générée.

Correction 1 : Changer le Token de Remplissage

  • L'Action : Au lieu de remplir l'espace vide avec « FIN » (<eot>), remplacez-le par un symbole neutre comme un point d'exclamation (!).
  • Pourquoi cela fonctionne : Cela brise la chambre d'écho. Le modèle ne voit plus 60 copies du token « Fin ». Il voit un symbole neutre qui ne porte pas le même poids lourd.
  • Bonus : Ils masquent également le seul token « Fin » original pour être extra prudents.

Correction 2 : Couper le Remplissage

  • L'Action : Gardez les tokens tels quels, mais baissez simplement le volume (masquez) sur les tokens « Fin » répétés afin que le modèle leur prête moins attention.
  • Pourquoi cela fonctionne : Cela réduit l'influence de l'« écho » sans changer le tokeniseur.

La Preuve : Pourquoi la Version 2.1 est Meilleure

Les auteurs ont remarqué que Stable Diffusion v2.1 (une version plus récente) ne souffre pas autant de ce problème de mémorisation.

  • Pourquoi ? Il s'avère que les créateurs de la v2.1 ont accidentellement corrigé ce problème. Ils sont passés à un système de texte différent (OpenCLIP) qui utilise un symbole neutre pour le remplissage au lieu de répéter « FIN ».
  • La Conclusion : Le fait que la v2.1 ait naturellement cessé de mémoriser autant prouve que le « token Fin répété » était bien la cause principale du problème dans la v1.4.

Résumé

  • Le Problème : Stable Diffusion copie parfois exactement les images d'entraînement.
  • La Cause : Les invites courtes sont remplies de tokens « Fin de Texte » répétés. Le modèle prend ces tokens répétés pour la partie la plus importante de l'instruction, ce qui le pousse à « surajuster » et à mémoriser des images spécifiques.
  • La Correction : Changez le token de remplissage en quelque chose de neutre (comme !) ou coupez les tokens répétés. Cela arrête la mémorisation tout en maintenant une haute qualité d'image.
  • L'Avantage : Vous pouvez appliquer cette correction immédiatement sans avoir besoin de réentraîner l'IA ou de détecter quelles images sont risquées au préalable.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →