Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers
Este artículo introduce un marco de interpretabilidad causal para los Transformers de Difusión que revela que los tokens de plantillas estructurales actúan como registros semánticos implícitos que mantienen la identidad del objeto a través de un mecanismo indirecto de lectura posterior, permitiendo el diseño de una estrategia de poda sin entrenamiento que reduce significativamente el costo computacional con una pérdida de rendimiento mínima.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: Los tokens de plantillas de texto son registros semánticos implícitos en los Transformers de Difusión
Planteamiento del problema
La generación de texto a imagen moderna ha pasado de arquitecturas U-Net a Transformers de Difusión (DiTs), donde los tokens de texto e imagen interactúan mediante atención conjunta. Concurrentemente, el condicionamiento de texto ha evolucionado de codificadores aislados (p. ej., CLIP, T5) a Modelos de Lenguaje de Gran Escala (LLMs) que serializan los prompts del usuario en plantillas de chat que contienen tokens de sistema, usuario, asistente y delimitadores.
Si bien el contenido semántico del prompt del usuario es claro, el papel de los tokens de plantillas estructurales (el residuo de formato como los delimitadores) sigue sin comprenderse bien. En los DiTs de atención conjunta, todos los tokens de condicionamiento compiten como claves para el flujo de imagen. Es una cuestión abierta si estos tokens estructurales permanecen como residuo de formato inerte, actúan como condicionamiento transparente o adquieren un rol computacional más profundo. Además, existe una brecha mayor en la comprensión de la organización mecanística de los DiTs: específicamente, qué capas comprometen el contenido semántico, qué cabezales afectan causalmente la generación y cómo la atención texto-imagen media el condicionamiento a lo largo de la trayectoria de eliminación de ruido.
Metodología
Los autores introducen un marco de interpretabilidad causal diseñado para rastrear dónde se lee, se enruta y se almacena la información de condicionamiento durante la eliminación de ruido. Este marco combina cuatro técnicas específicas:
- Descomposición de atención a nivel de token: Analizar la masa de atención Imagen-a-Texto (I2T) para cuantificar cuánta atención dirigen las consultas de imagen hacia spans específicos de tokens de texto (semánticos vs. estructurales).
- Intervenciones de condicionamiento a nivel de span: Realizar intercambios entre prompts y promediar tokens estructurales para probar si transportan semántica específica del prompt.
- Trasplante de cabezales entre trayectorias: Intercambiar progresivamente las proyecciones de atención () entre dos trayectorias de generación diferentes (p. ej., "manzana" vs. "banana") para identificar qué cabezales determinan causalmente la identidad del objeto.
- Enmascaramiento causal por capas: Enmascarar los flujos de atención (p. ej., Registro Semántico o Registro Imagen) en capas específicas para determinar la dirección del flujo de información.
El estudio utiliza principalmente la familia Qwen-Image (un MMDiT de doble flujo) y evalúa a través de múltiples benchmarks (GenEval, DPG-Bench, Qwen-Image-Bench) y lenguajes (inglés y chino).
Hallazgos clave
1. Los tokens estructurales como sumideros de atención dominantes
El análisis revela que los tokens de plantillas estructurales (p. ej., delimitadores como <|im_start|> y <|im_end|>) actúan como sumideros de atención masivos. Estos tokens capturan una cantidad desproporcionada de la atención de las consultas de imagen, funcionando como registros que almacenan información de alto nivel sobre la estructura del prompt y el contexto de la generación.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.