← Últimos artículos
💻 computer science

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

DiTango es un marco de difusión paralelo y rentable que acelera la generación de DiT multinodo mediante el aprovechamiento de la heterogeneidad de las particiones de contexto para reutilizar estratégicamente los estados de atención, logrando una aceleración de hasta 3.2x con un escalado casi lineal mientras preserva la calidad de la generación.

Autores originales: Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

Publicado 2026-07-20
📖 3 min de lectura☕ Lectura para el café

Autores originales: Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras pueden soñar con películas enteras, no solo imágenes estáticas, sino historias fluidas y de alta definición que duran minutos. Esta es la magia de los "Transformadores de Difusión", un tipo de inteligencia artificial que construye imágenes y videos paso a paso, convirtiendo lentamente el ruido estático en una escena clara y hermosa. Piensa en ello como un escultor que va tallando un bloque de mármol; la IA comienza con una nube caótica de píxeles y, tras muchas rondas de refinamiento, revela un video perfecto.

Sin embargo, hay un inconveniente: estos escultores digitales son increíblemente lentos. Crear un solo video de cinco segundos puede tomar más de una hora en una computadora potente. Para acelerar esto, los ingenieros a menudo intentan lograr que muchas computadoras trabajen juntas, dividiendo la larga secuencia de video en fragmentos y repartiéndolos como una carrera de relevos. Pero aquí está el problema: cuando estas computadoras intentan compartir su trabajo, se quedan atrapadas en atascos de tráfico. El tiempo dedicado a pasar datos de un lado a otro a menudo cancela la velocidad ganada al tener más trabajadores. Esto crea un cuello de botella frustrante donde añadir más computadoras no hace que el video termine realmente más rápido, e incluso, a veces, lo hace más lento.

Aquí entra DiTango, un nuevo sistema diseñado para solucionar este atasco de tráfico. Los investigadores detrás de DiTamente notaron algo fascinante sobre cómo estos modelos de IA "prestan atención" a diferentes partes del video. Descubrieron que no todas las partes del video son igualmente importantes en cada momento. Tal como tú te concentras intensamente en la persona que está hablando justo frente a ti pero apenas notas a la persona que está tres habitaciones más allá, la atención de la IA es más fuerte para las partes cercanas del video y mucho más débil para las distantes.

DiTango utiliza este conocimiento para jugar un juego inteligente de "saltar y reutilizar". En lugar de obligar a cada computadora a buscar y calcular constantemente cada una de las piezas de datos de cada una de las otras computadoras (lo que causa el atasco de tráfico), el planificador inteligente de DiTango decide qué partes son cruciales para calcular de nuevo y qué partes son tan poco importantes que la computadora simplemente puede usar un resultado antiguo, almacenado en caché, de hace unos segundos. Es como un grupo de chefs en una cocina masiva: en lugar de que todos corran a la despensa para agarrar la misma especia cada vez, se dan cuenta de que para la guarnición en el lado lejano de la mesa, el frasco de especias que está en el mostrador cercano es "suficientemente bueno" y no requiere un viaje nuevo.

Al ser selectivo, DiTango reduce drásticamente el tiempo que las computadoras pasan comunicándose entre sí. En pruebas utilizando potentes modelos de video, este enfoque hizo que el proceso de generación fuera casi dos veces más rápido de principio a fin y aceleró los cálculos centrales de "atención" en más de tres veces cuando se usaron 32 computadoras juntas. Crucialmente, los investigadores descubrieron que esta aceleración no arruinó la calidad del video; las películas finales se veían tan nítidas y coherentes como las creadas por los métodos tradicionales más lentos. DiTango demuestra que, al comprender hacia dónde necesita mirar realmente la IA, podemos evitar que desperdicie energía en cosas que apenas nota, haciendo que el sueño de la generación de video por IA instantánea y de alta calidad esté un poco más cerca de la realidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →