← Últimos artículos
💻 computer science

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

Este artículo introduce la Asignación de Pasos Heterogénea (HSA), un algoritmo de inferencia sin entrenamiento que acelera los Transformadores de Difusión para la generación de video asignando dinámicamente menos pasos de eliminación de ruido a los tokens de baja velocidad, al tiempo que mantiene el contexto global y la calidad mediante un nuevo mecanismo de sincronización de caché KV y actualizaciones de Euler en caché.

Autores originales: Ernie Chu, Vishal M. Patel

Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ernie Chu, Vishal M. Patel

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el director de una producción cinematográfica masiva y de gran presupuesto. En esta película, cada personaje, cada árbol de fondo y cada partícula de polvo en el suelo es un actor. En un Transformador de Difusión estándar (el modelo de IA que genera el video), el director trata a cada uno de estos "actores" exactamente igual.

Si el guion requiere 40 rondas de ensayo (pasos de eliminación de ruido) para perfeccionar la escena, el director obliga a que el muro de fondo ensaye 40 veces, al árbol estático ensaye 40 veces, y al héroe que corre a través de la pantalla ensaye 40 veces.

¿El problema? El muro y el árbol apenas se mueven. No necesitan 40 ensayos; podrían conformarse con 5. Pero la IA desperdicia cantidades masivas de tiempo y energía haciéndolos ensayar de todos modos, mientras que el héroe (que se mueve rápido y cambia de forma) también recibe las mismas 40 rondas. Es como pagarle a un actor estrella y a un recorte de cartón exactamente el mismo salario por hora por exactamente la misma cantidad de trabajo.

La Solución: Asignación Heterogénea de Pasos (HSA)

Los autores de este artículo, Ernie Chu y Vishal Patel, proponen una forma más inteligente de dirigir el set de la película llamada Asignación Heterogénea de Pasos (HSA).

Piensa en la HSA como un director inteligente que observa a los actores y dice:

  • "Tú, el muro de fondo? Eres aburrido y estático. Solo necesitas 5 ensayos."
  • "Tú, el héroe que corre? Eres dinámico y complejo. Necesitas todas las 40 ensayos."
  • "Tú, el árbol que se mece? Necesitas 20 ensayos."

Esto ahorra una enorme cantidad de tiempo porque la IA deja de desperdiciar energía en las partes aburridas.

Los Dos Problemas Difíciles que Resolvieron

Podrías pensar: "Bien, pero si el muro deja de ensayar después de 5 rondas, ¿cómo sabe lo que el héroe está haciendo en la ronda 40? Necesitan verse entre sí para mantenerse en la misma escena".

El artículo introduce dos trucos inteligentes para resolver esto:

1. El Truco de la "Memoria Fantasma" (Sincronización de Caché KV)
En la IA, los actores necesitan "verse" entre sí para mantenerse sincronizados (esto se llama atención). Por lo general, si un actor deja de ensayar, desaparece de la habitación y los demás no pueden verlo.

  • La Solución: La IA mantiene una "memoria fantasma" (una caché) del muro y del árbol. Aunque no están ensayando activamente, sus "fantasmas" permanecen en la habitación. Los actores activos (el héroe) aún pueden mirar los fantasmas de los actores inactivos para saber dónde están.
  • El Resultado: El héroe puede ensayar intensamente mientras aún sabe exactamente dónde está el muro, sin que el muro tenga que realizar realmente ningún trabajo.

2. El Truco de la "Viaje en el Tiempo" (Actualización Euler Caché)
¿Qué sucede con la posición del muro mientras está tomando un descanso? ¿Se congela simplemente?

  • La Solución: La IA recuerda la última vez que el muro se movió y a qué velocidad iba. Utiliza una fórmula matemática simple para "adelantar" la posición del muro a través del tiempo omitido. Es como decir: "El muro se movió 1 pulgada por segundo la última vez; simplemente calcularé dónde está ahora sin hacer que se mueva realmente".
  • El Resultado: El muro se actualiza en segundo plano instantáneamente, sin que la IA tenga que ejecutar una simulación compleja para él.

Los Resultados: Más Rápido, Más Barato, Igual de Bueno

Los investigadores probaron esto en potentes modelos de IA para crear videos (como Wan-2 y LTX-2). Esto es lo que encontraron:

  • Velocidad: Podían reducir el tiempo que toma crear un video en un 50% o incluso un 75% (haciendo que tome solo el 25% del tiempo original).
  • Calidad: Incluso con todo ese tiempo eliminado, los videos se veían casi exactamente igual que las versiones completas y lentas. El "héroe" seguía viéndose nítido, y el "muro" seguía viéndose sólido.
  • Comparación: Los métodos anteriores intentaban acelerar las cosas simplemente saltando rondas completas de ensayo para todos a la vez. Esos métodos hacían que el video se desmoronara (como un edificio colapsando) cuando intentaban ir demasiado rápido. La HSA mantuvo el video estable porque solo saltaba las partes que no necesitaban trabajo.

En Resumen

Este artículo trata sobre no tratar a cada píxel igual. Al darse cuenta de que algunas partes de un video son aburridas y estáticas mientras que otras son emocionantes y en movimiento, la IA puede dejar de perder tiempo en las partes aburridas. Utiliza "memorias fantasma" y "atajos matemáticos" para mantener todo sincronizado, permitiéndonos generar videos de alta calidad en una fracción del tiempo.

Es la diferencia entre una fábrica que mecaniza cada tornillo de un automóvil con la misma precisión, y una fábrica que pasa el 90% de su tiempo en el motor y solo el 10% en los tornillos que sostienen las fundas de los asientos. El automóvil sigue funcionando perfectamente, pero se construye mucho más rápido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →