← Derniers articles
💻 computer science

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

Cet article introduit un cadre d'interprétabilité causale pour les Transformers de diffusion qui révèle que les jetons de modèles structurels agissent comme des registres sémantiques implicites maintenant l'identité des objets via un mécanisme de lecture indirecte, permettant la conception d'une stratégie d'élagage sans entraînement qui réduit considérablement le coût computationnel avec une perte de performance minimale.

Auteurs originaux : Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

Publié 2026-07-22
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé technique : Les jetons de modèles de texte sont des registres sémantiques implicites dans les Transformers de diffusion

Énoncé du problème

La génération d'images à partir de texte est passée des architectures U-Net aux Transformers de diffusion (DiT), où les jetons de texte et d'image interagissent via une attention conjointe. Parallèlement, le conditionnement textuel est passé d'encodeurs isolés (ex. CLIP, T5) à des modèles de langage de grande taille (LLM) qui sérialisent les invites de l'utilisateur dans des modèles de conversation contenant des jetons de système, d'utilisateur, d'assistant et de délimiteur.

Bien que le contenu sémantique de l'invite de l'utilisateur soit clair, le rôle des jetons de modèles structurels (le résidu de formatage comme les délimiteurs) reste mal compris. Dans les DiT à attention conjointe, tous les jetons de conditionnement entrent en compétition en tant que clés pour le flux d'image. Il est question de savoir si ces jetons structurels restent des résidus de formatage inertes, agissent comme un conditionnement transparent ou acquièrent un rôle computationnel plus profond. De plus, il existe un écart plus large dans la compréhension de l'organisation mécaniste des DiT : spécifiquement, quels réseaux engagent le contenu sémantique, quels têtes affectent causalement la génération, et comment l'attention texte-image médie le conditionnement à travers la trajectoire de débruitage.

Méthodologie

Les auteurs introduisent un cadre d'interprétabilité causale conçu pour tracer où l'information de conditionnement est lue, acheminée et stockée pendant le débruitage. Ce cadre combine quatre techniques spécifiques :

  1. Décomposition de l'attention au niveau du jeton : Analyser la masse d'attention Image-vers-Texte (I2T) pour quantifier la part de l'attention que les requêtes d'image dirigent vers des segments de jetons de texte spécifiques (sémantique vs structurel).
  2. Interventions de conditionnement au niveau du segment : Effectuer des échanges entre invites et des moyennes de jetons structurels pour tester si ils portent une sémantique propre à l'invite.
  3. Transplantation de tête inter-trajectoire : Échanger progressivement les projections d'attention (q,k,vq, k, v) entre deux trajectoires de génération différentes (ex. « pomme » vs « banane ») pour identifier quelles têtes déterminent causalement l'identité de l'objet.
  4. Masquage causal par couche : Masquer les flux d'attention (ex. Registre \to Sémantique ou Registre \to Image) à des couches spécifiques pour déterminer la direction du flux d'information.

L'étude utilise principalement la famille Qwen-Image (un MMDiT à double flux) et évalue sur plusieurs benchmarks (GenEval, DPG-Bench, Qwen-Image-Bench) et langues (anglais et chinois).

Principaux résultats

1. Les jetons structurels comme puits d'attention dominants

L'analyse révèle que les jetons de modèles structurels (ex. les délimiteurs comme <|im_start|>) agissent comme des puits d'attention prédominants.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →