Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
Autores originais: Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: Kandinsky 5.0 – Uma Família de Modelos de Fundação para Geração de Imagem e Vídeo
1. Declaração do Problema
Apesar dos avanços rápidos nos modelos de difusão e nas abordagens de correspondência de fluxo para geração de imagens, a geração de vídeo permanece um desafio crítico na IA generativa. Os principais obstáculos incluem o crescimento exponencial da complexidade computacional ao lidar com dados de vídeo 3D dependentes do tempo, dificuldades em manter a consistência temporal e o realismo do movimento, e a necessidade de otimizações complexas e multiestágio tanto para treinamento quanto para inferência. Embora modelos como Sora e Veo tenham demonstrado alta qualidade, criar sistemas de geração de vídeo eficientes, controláveis e de alta resolução que sejam acessíveis à comunidade de pesquisa permanece um obstáculo significativo. O Kandinsky 5.0 visa abordar esses desafios fornecendo uma família de modelos de fundação capazes de síntese de imagens de alta resolução e vídeos de 10 segundos com desempenho de última geração (SOTA) e eficiência operacional.
2. Metodologia
2.1 Pipeline de Processamento de Dados
O framework de treinamento depende de um ciclo de vida abrangente e multiestágio de curadoria de dados envolvendo coleta, processamento, filtragem e agrupamento:
- Texto para Imagem (T2I): Um conjunto de dados com mais de 500 milhões de imagens passa por filtragem rigorosa (resolução, deduplicação, detecção de marca d'água, avaliação de qualidade via TOPIQ e Q-Align, filtragem de texto/complexidade) e geração de legendas sintéticas usando modelos multimodais (InternVL2, Qwen2.5VL).
- Texto para Vídeo (T2V): Mais de 250 milhões de cenas de vídeo são segmentadas, deduplicadas e filtradas quanto a dinâmicas estruturais, qualidade técnica/estética (DOVER, Q-Align) e conteúdo. Legendas sintéticas são geradas usando Tarsier2-7B.
- Edição de Imagem (I2I): Um pipeline especializado constrói aproximadamente 150 milhões de pares de imagens com instruções precisas. Isso envolve correspondência de similaridade (CLIP, DINO, reconhecimento facial), verificação geométrica (LoFTR, RANSAC) e filtragem de qualidade para garantir exemplos de transformação de alta fidelidade.
- Conjuntos de Dados Culturais e SFT: Um conjunto de dados do Código Cultural Russo (RCC) é curado manualmente para especificidade cultural. Um conjunto de dados de Ajuste Fino Supervisionado (SFT) de alta qualidade é criado através de seleção manual por especialistas e classificação de domínio (9 domínios: animais, arquitetura, arte, etc.) para aprimorar a estética e o seguimento de instruções.
2.2 Arquitetura: CrossDiT e NABLA
A arquitetura central é um Transformador de Difusão com Atenção Cruzada (CrossDiT) unificado, treinado usando o paradigma de Correspondência de Fluxo.
- CrossDiT: Diferentemente de arquiteturas anteriores semelhantes a MMDiT que exigiam operações de concatenação que retardavam o treinamento, o CrossDiT utiliza um mecanismo de atenção cruzada para melhor compatibilidade com atenção esparsa. Ele integra codificadores de texto (Qwen2.5-VL) e codificadores visuais (VAE FLUX.1-dev para imagens, VAE HunyuanVideo para vídeo).
- NABLA (Atenção Adaptativa de Nível de Bloco de Vizinhança): Para lidar com a geração de vídeo de alta resolução (até 1024px) e longa duração (até 10s), os autores introduzem o NABLA. Este mecanismo de atenção esparsa constrói dinamicamente máscaras conscientes do conteúdo por meio de redução de dimensionalidade em blocos e esparsificação adaptativa (limiarização CDF). Ele reduz a complexidade quadrática da atenção espaço-temporal padrão, alcançando um aceleração de 2,7× no treinamento e inferência, mantendo a qualidade do vídeo.
- Reordenamento de Tokens: O NABLA emprega achatamento fractal para agrupar tokens espaciais, otimizando padrões de acesso à memória.
2.3 Pipeline de Treinamento
O processo de treinamento é multiestágio e adaptado para diferentes tamanhos de modelo (Image Lite, Video Lite, Video Pro):
- Pré-treinamento: Os modelos são pré-treinados em grandes conjuntos de dados T2I, T2V e I2V em resoluções baixa, média e alta. Os modelos de vídeo são treinados em uma mistura de tarefas (T2I, T2V, I2V) com distribuições de probabilidade específicas.
- Ajuste Fino Supervisionado (SFT): É empregada uma técnica de "sopa de modelos" (model souping). Os dados são agrupados em domínios e subdomínios temáticos. Um ajuste fino completo independente é realizado em cada subdomínio, e os checkpoints resultantes são agregados por meio de média ponderada (pesos iguais ou proporcionais à raiz) para criar um modelo final robusto. Isso previne o sobreajuste e melhora a generalização.
- Destilação: Para modelos de vídeo, uma abordagem combinada é utilizada:
- Destilação de Guia Livre de Classificador (CFG): Reduz os passos de amostragem.
- Destilação de Consistência Segmentada de Trajetória (TSCD): Reduz ainda mais os passos para 16.
- Pós-treinamento Adversarial: Um refinamento de segundo estágio usando um discriminador (inspirado no LADD) com perda Hinge e perturbação estocástica (re-ruído) para restaurar a fidelidade visual perdida durante a destilação agressiva.
- Pós-treinamento Baseado em RL (Apenas Imagem): Para geração de imagens, um modelo de recompensa (baseado no Qwen 2.5VL) é treinado para comparar imagens geradas com imagens reais de SFT. O gerador é então ajustado finamente usando Ajuste Fino de Recompensa Direta (DRaFT-K), maximizando a preferência do modelo de recompensa enquanto minimiza a divergência KL do modelo SFT.
2.4 Otimizações
- Aceleração VAE: Codificador VAE HunyuanVideo otimizado com refatoração de código e
torch.compile, resultando em uma aceleração de 2,5×. - Otimização de Inferência: Uso de Flash/Sage Attention para resoluções padrão e NABLA para vídeos HD/longos. Cache de passos de difusão via MagCache fornece uma aceleração de 46%.
- Gerenciamento de Memória: Implementação de HSDP (Paralelismo de Dados Fragmentado Híbrido), Paralelismo de Sequência e checkpointing de ativação com descarregamento para host para reduzir o consumo de memória GPU.
3. Contribuições Principais
- Pipeline de Dados Abrangente: Uma descrição detalhada da curadoria de dados para T2I, T2V, I2V e edição baseada em instruções, incluindo tratamento especializado para conteúdo cultural russo e conjuntos de dados SFT de alta qualidade.
- Framework de Treinamento Multiestágio: Um pipeline unificado que abrange pré-treinamento, SFT específico de domínio (via sopa de modelos), destilação e pós-treinamento baseado em RL (para imagens) para aprimorar o realismo e o alinhamento.
- Arquitetura CrossDiT e NABLA: Introdução de um backbone transformador de atenção cruzada e do mecanismo de atenção esparsa NABLA, que supera a complexidade quadrática para vídeo de alta resolução, permitindo treinamento/inferência 2,7× mais rápidos.
- Técnicas de Otimização: Implementação de aceleração VAE, quantização de codificador de texto e estratégias de treinamento eficientes em memória (HSDP, descarregamento) para permitir geração de alta fidelidade em hardware de consumo e profissional.
- Estratégia de Destilação: Uma combinação inovadora de destilação CFG, TSCD e pós-treinamento adversarial para reduzir as Avaliações de Função (NFE) de 100 para 16, preservando a qualidade visual.
- Lançamento de Código Aberto: Lançamento completo de código, pesos e checkpoints de treinamento para todos os modelos (Image Lite, Video Lite, Video Pro e suas variantes Flash) via Hugging Face e GitHub.
4. Resultados
- Avaliação Humana: Extensas avaliações lado a lado (SBS) foram conduzidas no benchmark MovieGen (mais de 1.000 prompts) com aproximadamente 20 anotadores treinados.
- Video Lite vs. Sora/Wan: O Kandinsky 5.0 Video Lite demonstrou Qualidade Visual e Dinâmicas de Movimento superiores em comparação aos modelos Sora e Wan, embora os modelos Wan tenham mostrado maior Seguimento de Prompt (alinhamento semântico).
- Video Lite vs. Kandinsky 4.1: Melhorias significativas foram observadas em dinâmicas de movimento, realismo de objetos e supressão de artefatos.
- Video Pro vs. Veo 3/Wan 2.2: O Kandinsky 5.0 Video Pro alcançou pontuações mais altas em Qualidade Visual e Dinâmicas de Movimento em comparação ao Veo 3 e Wan 2.2 A14B, embora variantes do Veo 3 tenham superado em Seguimento de Prompt.
- Image Lite: Superou o FLUX.1 e o Qwen-Image em Qualidade Visual, mantendo-se competitivo em Seguimento de Prompt.
- Métricas de Desempenho:
- Velocidade: Modelos "Flash" destilados reduzem significativamente o tempo de geração (por exemplo, a geração de 10s do Video Lite cai de ~224s para ~61s em uma H100).
- Qualidade: Métricas quantitativas (FVD, VBench, CLIP-score) e avaliações humanas confirmam que o treinamento multiestágio e o mecanismo NABLA mantêm alta qualidade apesar das reduções computacionais.
5. Significado e Alegações
O artigo posiciona o Kandinsky 5.0 como um marco significativo na IA generativa de código aberto, visando democratizar o acesso a modelos de fundação de alta qualidade para imagem e vídeo.
- Acessibilidade: Ao lançar modelos com diferentes contagens de parâmetros (2B, 6B, 19B) e variantes destiladas "Flash", o framework permite a implantação em diferentes restrições de hardware.
- Avanço Técnico: A integração de Correspondência de Fluxo, CrossDiT e NABLA aborda os gargalos de escalabilidade e eficiência inerentes à geração de vídeo, oferecendo uma alternativa viável a sistemas proprietários de código fechado.
- Impacto na Comunidade: Os autores esperam que o lançamento de código aberto, checkpoints de treinamento e um relatório técnico detalhado avancem substancialmente o desenvolvimento e a acessibilidade de modelos generativos de alta qualidade para a comunidade de pesquisa.
- Posicionamento Ético: O modelo é lançado sob a licença MIT sem filtragem de conteúdo embutida para fomentar a inovação, colocando a responsabilidade do uso ético e da responsabilidade civil no usuário final. Os autores reconhecem vieses inerentes nos dados de treinamento e incentivam prompts específicos para mitigar estereótipos.
O relatório conclui que, embora o Kandinsky 5.0 alcance desempenho SOTA em qualidade visual e consistência de movimento, desafios permanecem no alinhamento texto-visual (devido a limites de contexto do codificador) e na modelagem de interações físicas complexas de longo alcance, que são identificados como direções para trabalhos futuros.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.
Receba os melhores artigos de machine learning toda semana.
Confiado por pesquisadores de Stanford, Cambridge e da Academia Francesa de Ciências.
Verifique sua caixa de entrada para confirmar sua inscrição.
Algo deu errado. Tentar novamente?
Sem spam, cancele quando quiser.