← Últimos artículos
🤖 AI

LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration

El artículo presenta LESA, un marco de predictores entrenables y conscientes de la etapa basado en redes KAN y una arquitectura multi-experto que acelera significativamente los modelos de difusión para generación de imágenes y video manteniendo una alta fidelidad y superando a los métodos anteriores.

Autores originales: Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang

Publicado 2026-03-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que crear una imagen o un video con Inteligencia Artificial es como cocinar un plato gourmet complejo.

El Problema: La Cocina Lenta

Hasta ahora, los modelos de IA (como los que crean imágenes de Flux o videos de Hunyuan) funcionaban como un chef muy meticuloso pero lento. Para crear una imagen, el chef tenía que:

  1. Empezar con un "bowl" lleno de ruido (como si fuera harina y arena mezcladas).
  2. Ir quitando la arena paso a paso, muy lentamente, para revelar la imagen.
  3. Repetir este proceso docenas de veces (pasos de "desruido").

Cada paso requiere que el chef (la computadora) revise toda la receta y calcule qué quitar. Es un proceso muy pesado y lento, como si tuvieras que volver a mezclar toda la masa cada vez que quitas un grano de arena.

La Solución Antigua: "Copiar y Pegar" (Caché)

Para acelerar esto, otros investigadores dijeron: "¡Espera! Si el paso 10 y el paso 11 son casi iguales, ¿por qué no copiamos el resultado del paso 10 y lo pegamos en el 11?".

  • La analogía: Es como si el chef dijera: "Como la sopa casi no cambió en el último minuto, voy a usar la misma cuchara de prueba que usé hace un minuto".
  • El fallo: A veces la sopa cambia de golpe (se quema o se le añade sal). Si solo copias y pegas, la sopa queda mal. Si intentas "adivinar" cómo cambiará usando matemáticas simples (como una línea recta), te equivocas porque el proceso de la IA es caótico y cambia de ritmo.

La Nueva Solución: LESA (El Chef con Instinto y Mapas)

El equipo de la Universidad Jiao Tong de Shanghái propone LESA. Imagina que LESA no es un robot que solo copia, sino un chef experto con un mapa del tiempo.

1. El Mapa de las Etapas (Stage-Aware)

El proceso de crear una imagen tiene tres fases muy distintas, como un viaje en coche:

  • Fase de Despegue (Alto ruido): Es el caos inicial. La imagen se forma bruscamente. Aquí, las cosas cambian muy rápido.
  • Fase de Cruce (Ruido medio): Es la autopista. Todo es estable y fluido.
  • Fase de Aterrizaje (Bajo ruido): Es el aparcamiento. Se están ajustando los detalles finos (los ojos, la textura de la piel).

El error de los métodos anteriores: Usaban la misma estrategia para todo el viaje. ¡Como conducir a 200 km/h en una zona escolar!
La magia de LESA: Sabe en qué fase está.

  • En el caos inicial, usa un predictor rápido y agresivo.
  • En la autopista, usa un predictor suave y constante.
  • En el final, usa un predictor de "micro-ajuste" para los detalles.

2. El "Cerebro" KAN (Kolmogorov-Arnold Network)

Para predecir el futuro, LESA usa una red neuronal especial llamada KAN.

  • La analogía: Imagina que los métodos antiguos usan una regla de cálculo rígida (una línea recta). Si la curva es complicada, la regla falla.
  • KAN es como un gimnasta flexible. Puede doblarse y adaptarse a cualquier forma curva compleja. En lugar de seguir una fórmula fija, LESA "aprende" cómo se mueven los datos de la IA paso a paso, como si hubiera visto miles de veces cómo se forma una imagen y supiera exactamente qué pasará a continuación.

3. Entrenamiento en Dos Actos

LESA no nace sabiendo todo. Se entrena en dos etapas:

  1. Acto 1 (Aprendiz con guía): El chef aprende copiando la respuesta correcta del "chef maestro" (la IA original) para entender la dinámica.
  2. Acto 2 (Práctica real): El chef empieza a cocinar solo, usando sus propias predicciones. Si se equivoca un poco, aprende a corregirse a sí mismo para no acumular errores. Esto le da "resistencia" para ir muy rápido sin que la imagen se deforme.

Los Resultados: ¡Velocidad de Luz con Calidad de Cine!

Gracias a esto, LESA logra hazañas increíbles:

  • En FLUX (un modelo de imágenes), acelera el proceso 5 veces y la imagen apenas cambia (casi perfecta).
  • En Qwen-Image, acelera 6.25 veces y, ¡sorprendentemente!, la calidad es mejor que la de los métodos anteriores más rápidos.
  • En HunyuanVideo (videos), acelera 5 veces y mantiene la coherencia del movimiento, algo que antes era muy difícil.

En Resumen

LESA es como tener un copiloto experto en un coche de carreras.

  • Los métodos antiguos eran como conducir a ciegas o seguir un GPS obsoleto.
  • LESA sabe exactamente en qué curva estás (la etapa de ruido), tiene un mapa flexible (KAN) para predecir el camino, y sabe cuándo acelerar y cuándo frenar.

El resultado: Imágenes y videos de alta calidad generados en una fracción del tiempo, haciendo que la IA sea mucho más accesible y rápida para todos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →