Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
Autores originales: Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: Kandinsky 5.0 – Una Familia de Modelos Fundacionales para la Generación de Imágenes y Video
1. Declaración del Problema
A pesar de los rápidos avances en los modelos de difusión y los enfoques de ajuste de flujo para la generación de imágenes, la generación de video sigue siendo un desafío crítico en la inteligencia artificial generativa. Los principales obstáculos incluyen el crecimiento exponencial en la complejidad computacional al manejar datos de video 3D dependientes del tiempo, las dificultades para mantener la consistencia temporal y el realismo del movimiento, y la necesidad de optimizaciones complejas y multietapa tanto para el entrenamiento como para la inferencia. Aunque modelos como Sora y Veo han demostrado alta calidad, crear sistemas de generación de video eficientes, controlables y de alta resolución que sean accesibles para la comunidad de investigación sigue siendo un obstáculo significativo. Kandinsky 5.0 busca abordar estos desafíos proporcionando una familia de modelos fundacionales capaces de sintetizar imágenes de alta resolución y videos de 10 segundos con un rendimiento de vanguardia (SOTA) y eficiencia operativa.
2. Metodología
2.1 Pipeline de Procesamiento de Datos
El marco de entrenamiento se basa en un ciclo de vida integral de curación de datos en múltiples etapas que involucra recolección, procesamiento, filtrado y agrupamiento:
- Texto a Imagen (T2I): Un conjunto de datos de más de 500 millones de imágenes pasa por un filtrado riguroso (resolución, eliminación de duplicados, detección de marcas de agua, evaluación de calidad mediante TOPIQ y Q-Align, filtrado de texto/complejidad) y generación de subtítulos sintéticos utilizando modelos multimodales (InternVL2, Qwen2.5VL).
- Texto a Video (T2V): Más de 250 millones de escenas de video se segmentan, eliminan duplicados y filtran según dinámicas estructurales, calidad técnica/estética (DOVER, Q-Align) y contenido. Los subtítulos sintéticos se generan utilizando Tarsier2-7B.
- Edición de Imágenes (I2I): Un pipeline especializado construye aproximadamente 150 millones de pares de imágenes con instrucciones precisas. Esto implica coincidencia de similitud (CLIP, DINO, reconocimiento facial), verificación geométrica (LoFTR, RANSAC) y filtrado de calidad para garantizar ejemplos de transformación de alta fidelidad.
- Conjuntos de Datos Culturales y SFT: Un conjunto de datos de Código Cultural Ruso (RCC) se curó manualmente para la especificidad cultural. Un conjunto de datos de Ajuste Fino Supervisado (SFT) de alta calidad se crea mediante selección manual experta y clasificación de dominios (9 dominios: animales, arquitectura, arte, etc.) para mejorar la estética y el seguimiento de instrucciones.
2.2 Arquitectura: CrossDiT y NABLA
La arquitectura central es un Transformador de Difusión con Atención Cruzada (CrossDiT) unificado, entrenado utilizando el paradigma de Ajuste de Flujo.
- CrossDiT: A diferencia de las arquitecturas anteriores similares a MMDiT que requerían operaciones de concatenación que ralentizaban el entrenamiento, CrossDiT utiliza un mecanismo de atención cruzada para una mejor compatibilidad con la atención dispersa. Integra codificadores de texto (Qwen2.5-VL) y codificadores visuales (VAE FLUX.1-dev para imágenes, VAE HunyuanVideo para video).
- NABLA (Atención Adaptativa a Nivel de Bloque Vecino): Para manejar la generación de video de alta resolución (hasta 1024 px) y larga duración (hasta 10 s), los autores introducen NABLA. Este mecanismo de atención dispersa construye dinámicamente máscaras conscientes del contenido mediante reducción de dimensionalidad por bloques y dispersión adaptativa (umbralización CDF). Reduce la complejidad cuadrática de la atención espacio-temporal estándar, logrando una aceleración de 2.7× en el entrenamiento y la inferencia mientras mantiene la calidad del video.
- Reordenamiento de Tokens: NABLA emplea un aplanamiento fractal para agrupar tokens espaciales, optimizando los patrones de acceso a la memoria.
2.3 Pipeline de Entrenamiento
El proceso de entrenamiento es multietapa y está adaptado para diferentes tamaños de modelo (Image Lite, Video Lite, Video Pro):
- Pre-entrenamiento: Los modelos se pre-entrenan en conjuntos de datos a gran escala de T2I, T2V e I2V en resoluciones bajas, medias y altas. Los modelos de video se entrenan en una mezcla de tareas (T2I, T2V, I2V) con distribuciones de probabilidad específicas.
- Ajuste Fino Supervisado (SFT): Se emplea una técnica de "sopa de modelos" (model souping). Los datos se agrupan en dominios temáticos y subdominios. Se realiza un ajuste fino completo independiente en cada subdominio, y los puntos de control resultantes se agregan mediante promedios ponderados (pesos iguales o proporcionales a la raíz) para crear un modelo final robusto. Esto previene el sobreajuste y mejora la generalización.
- Destilación: Para los modelos de video, se utiliza un enfoque combinado:
- Destilación de Guía Libre de Clasificador (CFG): Reduce los pasos de muestreo.
- Destilación de Consistencia Segmentada de Trayectoria (TSCD): Reduce aún más los pasos a 16.
- Post-entrenamiento Adversarial: Un refinamiento de segunda etapa utilizando un discriminador (inspirado en LADD) con una función de pérdida Hinge y perturbación estocástica (re-ruido) para restaurar la fidelidad visual perdida durante la destilación agresiva.
- Post-entrenamiento basado en RL (Solo Imágenes): Para la generación de imágenes, se entrena un modelo de recompensa (basado en Qwen 2.5VL) para comparar las imágenes generadas con imágenes reales de SFT. Luego, el generador se ajusta finamente utilizando Ajuste Fino Directo de Recompensa (DRaFT-K), maximizando la preferencia del modelo de recompensa mientras se minimiza la divergencia KL del modelo SFT.
2.4 Optimizaciones
- Aceleración VAE: Codificador VAE HunyuanVideo optimizado con refactorización de código y
torch.compile, logrando una aceleración de 2.5×. - Optimización de Inferencia: Uso de Flash/Sage Attention para resoluciones estándar y NABLA para videos HD/largos. La caché de pasos de difusión mediante MagCache proporciona una aceleración del 46%.
- Gestión de Memoria: Implementación de HSDP (Paralelismo de Datos Fragmentado Híbrido), Paralelismo de Secuencia y checkpointing de activación con descarga al host para reducir el consumo de memoria GPU.
3. Contribuciones Clave
- Pipeline de Datos Integral: Una descripción detallada de la curación de datos para T2I, T2V, I2V y edición basada en instrucciones, incluido el manejo especializado de contenido cultural ruso y conjuntos de datos SFT de alta calidad.
- Marco de Entrenamiento Multietapa: Un pipeline unificado que abarca pre-entrenamiento, SFT específico de dominio (mediante sopa de modelos), destilación y post-entrenamiento basado en RL (para imágenes) para mejorar el realismo y la alineación.
- Arquitectura CrossDiT y NABLA: Introducción de una columna vertebral transformadora de atención cruzada y el mecanismo de atención dispersa NABLA, que supera la complejidad cuadrática para video de alta resolución, permitiendo un entrenamiento/inferencia 2.7 veces más rápido.
- Técnicas de Optimización: Implementación de aceleración VAE, cuantización de codificadores de texto y estrategias de entrenamiento eficientes en memoria (HSDP, descarga) para permitir la generación de alta fidelidad en hardware de consumo y profesional.
- Estrategia de Destilación: Una combinación novedosa de destilación CFG, TSCD y post-entrenamiento adversarial para reducir las Evaluaciones de Función (NFE) de 100 a 16 mientras se preserva la calidad visual.
- Lanzamiento de Código Abierto: Lanzamiento completo del código, pesos y puntos de control de entrenamiento para todos los modelos (Image Lite, Video Lite, Video Pro y sus variantes Flash) a través de Hugging Face y GitHub.
4. Resultados
- Evaluación Humana: Se realizaron extensas evaluaciones lado a lado (SBS) en la referencia MovieGen (más de 1,000 prompts) con aproximadamente 20 anotadores entrenados.
- Video Lite vs. Sora/Wan: Kandinsky 5.0 Video Lite demostró una Calidad Visual y Dinámicas de Movimiento superiores en comparación con los modelos Sora y Wan, aunque los modelos Wan mostraron un mejor Seguimiento de Prompts (alineación semántica).
- Video Lite vs. Kandinsky 4.1: Se observaron mejoras significativas en las dinámicas de movimiento, el realismo de los objetos y la supresión de artefactos.
- Video Pro vs. Veo 3/Wan 2.2: Kandinsky 5.0 Video Pro obtuvo puntuaciones más altas en Calidad Visual y Dinámicas de Movimiento en comparación con Veo 3 y Wan 2.2 A14B, aunque las variantes de Veo 3 superaron en el Seguimiento de Prompts.
- Image Lite: Superó a FLUX.1 y Qwen-Image en Calidad Visual mientras permanecía competitivo en el Seguimiento de Prompts.
- Métricas de Rendimiento:
- Velocidad: Los modelos "Flash" destilados reducen significativamente el tiempo de generación (por ejemplo, la generación de 10s de Video Lite cae de ~224s a ~61s en una H100).
- Calidad: Las métricas cuantitativas (FVD, VBench, CLIP-score) y las evaluaciones humanas confirman que el entrenamiento multietapa y el mecanismo NABLA mantienen una alta calidad a pesar de las reducciones computacionales.
5. Significado y Afirmaciones
El documento posiciona a Kandinsky 5.0 como un hito significativo en la IA generativa de código abierto, con el objetivo de democratizar el acceso a modelos fundacionales de alta calidad para imágenes y video.
- Accesibilidad: Al lanzar modelos con diferentes conteos de parámetros (2B, 6B, 19B) y variantes destiladas "Flash", el marco permite el despliegue a través de diferentes restricciones de hardware.
- Avance Técnico: La integración de Ajuste de Flujo, CrossDiT y NABLA aborda los cuellos de botella de escalabilidad y eficiencia inherentes a la generación de video, ofreciendo una alternativa viable a los sistemas propietarios de código cerrado.
- Impacto en la Comunidad: Los autores esperan que el lanzamiento de código de código abierto, puntos de control de entrenamiento y un informe técnico detallado avance sustancialmente el desarrollo y la accesibilidad de modelos generativos de alta calidad para la comunidad de investigación.
- Postura Ética: El modelo se lanza bajo la licencia MIT sin filtrado de contenido integrado para fomentar la innovación, colocando la responsabilidad del uso ético y la responsabilidad legal en el usuario final. Los autores reconocen los sesgos inherentes en los datos de entrenamiento y alientan la formulación de prompts específicos para mitigar estereotipos.
El informe concluye que, aunque Kandinsky 5.0 logra un rendimiento SOTA en calidad visual y consistencia de movimiento, persisten desafíos en la alineación texto-visual (debido a los límites del contexto del codificador) y en el modelado de interacciones físicas complejas de largo alcance, los cuales se identifican como direcciones para trabajos futuros.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de machine learning cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.