← Últimos artículos
💻 computer science

SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation

SQuad es un marco de destilación de atención subcuadrática que comprime los Video Diffusion Transformers preentrenados para lograr una complejidad de O(nn)\mathcal{O}(n\sqrt{n}), ofreciendo una calidad de generación de video de nivel cuadrático con costos computacionales significativamente reducidos y velocidades de inferencia más rápidas.

Autores originales: Animesh Karnewar, Denis Korzhenkov, Amirhossein Habibian, Mohsen Ghafoorian

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Animesh Karnewar, Denis Korzhenkov, Amirhossein Habibian, Mohsen Ghafoorian

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La creación de imágenes en movimiento con inteligencia artificial se ha convertido en una de las fronteras más emocionantes de la informática moderna. Estos sistemas, conocidos como modelos de difusión de video, funcionan comenzando con una nube caótica de ruido estático y refinándola gradualmente hasta convertirla en una escena coherente, fotograma a fotograma, basándose en una descripción de texto. Para entender cómo lo hacen, imagine una vasta cuadrícula de diminutos píxeles digitales, donde cada píxel es un token que porta información sobre color, forma y tiempo. El motor que impulsa estos modelos es un mecanismo llamado autoatención. Este mecanismo permite que cada uno de los tokens del video observe a todos los demás tokens para decidir cómo deben relacionarse entre sí. Es esta conexión constante y omnisciente la que otorga al video su calidad realista y asegura que el movimiento de un personaje en el primer segundo coincida con su apariencia en el último. Sin embargo, este poder conlleva un precio elevado. A medida que el video crece en longitud o detalle, el número de conexiones que el sistema debe calcular explota, haciendo que el proceso sea increíblemente lento y costoso, lo que a menudo limita a los creadores a solo unos pocos segundos de metraje.

Investigadores de Qualcomm AI Research han desarrollado un nuevo enfoque llamado SQuad para resolver este problema sin sacrificar la calidad del video. En lugar de intentar simplificar las conexiones complejas o reemplazar el mecanismo central con una alternativa más barata y débil, encontraron una forma de reorganizar cómo el sistema observa los datos. En el método estándar, cada token debe consultar con cada otro token, un proceso que se vuelve inmanejable a medida que el tamaño del video aumenta. El equipo se dio cuenta de que, en la generación de video, la mayoría de estas conexiones son en realidad muy débiles; solo un pequeño y crítico grupo de tokens realmente necesita prestar atención a los demás en cualquier momento dado. Basándose en esta observación, diseñaron un proceso de dos pasos. Primero, el sistema agrupa los tokens cercanos en pequeñas ventanas y permite que mezclen información localmente. Luego, realiza una segunda pasada para permitir que estas ventanas se comuniquen entre sí a través de todo el video. Esta estructura permite que el modelo mantene una visión completa de la escena mientras reduce drásticamente el número de cálculos requeridos.

Los resultados de aplicar este método a un modelo de generación de video de gran escala llamado Wan 2.2 son sorprendentes. Los investigadores tomaron un modelo potente y preentrenado y le enseñaron a utilizar este nuevo método de atención optimizado mediante un proceso de destilación, donde el nuevo sistema aprende a imitar el comportamiento del original. El resultado es un modelo que produce videos de una calidad visual casi idéntica al original, obteniendo puntuaciones casi iguales en rigurosas pruebas de calidad, pero con una reducción masiva de costos. Mientras que el modelo original requería 100 pasos para generar un video, la nueva versión logra resultados similares en solo seis pasos. En términos de velocidad, el tiempo que toma procesar un solo paso de la generación de video cayó de aproximadamente 47 milisegundos a solo 4 milisegundos. La cantidad de potencia de cómputo necesaria para estos pasos disminuyó por un factor de casi 67.

Esta ganancia de eficiencia no es solo una mejora teórica; se traduce directamente en lo que experimenta un usuario. Al ser probado en una tarea estándar de generación de video de alta definición, el nuevo método generó un video en aproximadamente la mitad del tiempo total del sistema original, incluso contabilizando todo el flujo de generación. Los investigadores compararon su método contra otros intentos de acelerar la generación de video, algunos de los cuales dependen de arquitecturas híbridas complejas que añaden millones de parámetros extra al modelo. En contraste, el enfoque SQuad no requiere memoria adicional ni hardware especializado, integrándose perfectamente en los sistemas existentes. Los estudios con usuarios confirmaron que las personas no podían distinguir de manera confiable entre los videos hechos por el modelo original, pesado, y aquellos hechos por la nueva y eficiente versión. De hecho, en una comparación directa, una parte significativa de los espectadores humanos prefirió los videos generados por el nuevo método.

La importancia de este trabajo reside en su equilibrio. Los intentos previos para hacer estos modelos más rápidos a menudo implicaban reemplazar el poderoso mecanismo de atención por aproximaciones lineales más simples, lo que frecuentemente resultaba en una caída notable en la calidad del video. El método SQuad evita esta trampa manteniendo intacta la operación matemática central pero cambiando el orden en que se aplica. Demuestra que la complejidad cuadrática total de verificar cada token contra cada otro token no es estrictamente necesaria para lograr resultados de alta fidelidad. Al estructurar cuidadosamente el flujo de información, los investigadores han demostrado que es posible generar videos largos y de alta resolución con una fracción del costo computacional. Esto abre la puerta para generar escenas más largas y complejas en hardware estándar, acercando el campo al objetivo de crear contenido de video ilimitado y de alta calidad sin los actuales cuellos de botella de tiempo y energía.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →