Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers
Dit artikel introduceert een causaal interpreteerbaar kader voor Diffusion Transformers dat onthult dat structurele template-tokens fungeren als impliciete semantische registers die de identiteit van objecten behouden via een indirect read-back mechanisme, wat het ontwerp mogelijk maakt van een training-vrije pruning-strategie die de computationele kosten aanzienlijk vermindert met minimaal prestatieverlies.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: Tekst Template Tokens Zijn Impliciete Semantische Registers in Diffusion Transformers
Probleemstelling
Moderne tekst-naar-beeldgeneratie is verschoven van U-Net architecturen naar Diffusion Transformers (DiTs), waarbij tekst- en beeldtokens interageren via gezamenlijke aandacht (joint attention). Tegelijkertijd is tekstconditiering geëvolueerd van geïsoleerde encoders (bijv. CLIP, T5) naar Large Language Models (LLMs) die gebruikersprompts serialiseren in chattemplates die systeem-, gebruiker-, assistent- en scheidingstoken bevatten.
Hoewel de semantische inhoud van de gebruikersprompt duidelijk is, blijft de rol van de structurele template tokens (de formatieresten zoals delimiters) slecht begrepen. In joint-attention DiTs concurreren alle conditieringstokens als keys voor de beeldstroom. Het is een open vraag of deze structurele tokens inert formatieresidu blijven, fungeren als transparante conditiering, of een diepere computationele rol verwerven. Bovendien is er een bredere kloof in het begrip van de mechanistische organisatie van DiTs: specifiek, welke lagen semantische inhoud vastleggen, welke heads de generatie causaal beïnvloeden, en hoe tekst-beeld aandacht de conditiering over de denoising-trajectorie medieert.
Methodologie
De auteurs introduceren een causaal interpreteerbaarheidsframework ontworpen om te traceren waar conditieringsinformatie wordt gelezen, gerouteerd en opgeslagen tijdens het denoising-proces. Dit framework combineert vier specifieke technieken:
- Token-level Attention Decomposition: Het analyseren van de Image-to-Text (I2T) attention massa om te kwantificeren hoeveel aandacht beeldqueries richten naar specifieke teksttoken-spannen (semantisch versus structureel).
- Span-level Conditioning Interventions: Het uitvoeren van cross-prompt swaps en het middelen van structurele tokens om te testen of ze prompt-specifieke semantiek dragen.
- Cross-trajectory Head Transplantation: Het progressief wisselen van attention projecties () tussen twee verschillende generatie-trajectorieën (bijv. "appel" versus "banaan") om te identificeren welke heads de identiteit van het object causaal bepalen.
- Layer-wise Causal Masking: Het maskeren van attention flows (bijv. Register Semantisch of Register Beeld) op specifieke lagen om de richting van de informatiestroom te bepalen.
De studie maakt primair gebruik van de Qwen-Image familie (een dual-stream MMDiT) en evalueert over meerdere benchmarks (GenEval, DPG-Bench, Qwen-Image-Bench) en talen (Engels en Chinees).
Belangrijkste Bevindingen
1. Structurele Tokens als Dominante Attention Sinks
De analyse onthult dat structurele template tokens (bijv. delimiters zoals `
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.