Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
Autori originali: Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Riepilogo Tecnico: Kandinsky 5.0 – Una Famiglia di Modelli Fondamentali per la Generazione di Immagini e Video
1. Enunciato del Problema
Nonostante i rapidi progressi nei modelli di diffusione e negli approcci di flow matching per la generazione di immagini, la generazione video rimane una sfida critica nell'IA generativa. Gli ostacoli principali includono la crescita esponenziale della complessità computazionale nella gestione di dati video 3D dipendenti dal tempo, le difficoltà nel mantenere coerenza temporale e realismo del movimento, e la necessità di ottimizzazioni complesse e multi-stadio sia per l'addestramento che per l'inferenza. Sebbene modelli come Sora e Veo abbiano dimostrato alta qualità, creare sistemi di generazione video efficienti, controllabili e ad alta risoluzione accessibili alla comunità di ricerca rimane un ostacolo significativo. Kandinsky 5.0 mira a risolvere queste sfide fornendo una famiglia di modelli fondamentali capaci di sintesi di immagini ad alta risoluzione e video di 10 secondi con prestazioni all'avanguardia (SOTA) ed efficienza operativa.
2. Metodologia
2.1 Pipeline di Elaborazione dei Dati
Il framework di addestramento si basa su un ciclo di vita completo e multi-stadio di curazione dei dati che coinvolge raccolta, elaborazione, filtraggio e clustering:
- Text-to-Image (T2I): Un dataset di oltre 500 milioni di immagini subisce un rigoroso filtraggio (risoluzione, deduplicazione, rilevamento filigrana, valutazione della qualità tramite TOPIQ e Q-Align, filtraggio testo/complessità) e generazione di didascalie sintetiche utilizzando modelli multimodali (InternVL2, Qwen2.5VL).
- Text-to-Video (T2V): Oltre 250 milioni di scene video vengono segmentate, deduplicate e filtrate per dinamiche strutturali, qualità tecnica/estetica (DOVER, Q-Align) e contenuto. Le didascalie sintetiche sono generate utilizzando Tarsier2-7B.
- Image Editing (I2I): Una pipeline specializzata costruisce circa 150 milioni di coppie di immagini con istruzioni precise. Ciò include matching di similarità (CLIP, DINO, riconoscimento facciale), verifica geometrica (LoFTR, RANSAC) e filtraggio della qualità per garantire esempi di trasformazione ad alta fedeltà.
- Dataset Culturali e SFT: Un dataset del Codice Culturale Russo (RCC) è curato manualmente per la specificità culturale. Un dataset di Supervised Fine-Tuning (SFT) di alta qualità è creato attraverso selezione manuale esperta e classificazione di dominio (9 domini: animali, architettura, arte, ecc.) per migliorare l'estetica e il rispetto delle istruzioni.
2.2 Architettura: CrossDiT e NABLA
L'architettura centrale è un Diffusion Transformer con Cross-Attention (CrossDiT) unificato, addestrato utilizzando il paradigma Flow Matching.
- CrossDiT: A differenza delle precedenti architetture simili a MMDiT che richiedevano operazioni di concatenazione che rallentavano l'addestramento, CrossDiT utilizza un meccanismo di cross-attention per una migliore compatibilità con l'attenzione sparsa. Integra encoder di testo (Qwen2.5-VL) e encoder visivi (VAE FLUX.1-dev per le immagini, VAE HunyuanVideo per il video).
- NABLA (Neighborhood Adaptive Block-Level Attention): Per gestire la generazione video ad alta risoluzione (fino a 1024px) e lunga durata (fino a 10s), gli autori introducono NABLA. Questo meccanismo di attenzione sparsa costruisce dinamicamente maschere consapevoli del contenuto tramite riduzione della dimensionalità per blocchi e diradamento adattivo (soglia CDF). Riduce la complessità quadratica dell'attenzione spaziotemporale standard, ottenendo un accelerazione di 2,7× nell'addestramento e nell'inferenza mantenendo la qualità video.
- Riordinamento dei Token: NABLA impiega un appiattimento frattale per raggruppare i token spaziali, ottimizzando i pattern di accesso alla memoria.
2.3 Pipeline di Addestramento
Il processo di addestramento è multi-stadio e personalizzato per diverse dimensioni del modello (Image Lite, Video Lite, Video Pro):
- Pre-training: I modelli vengono pre-addestrati su grandi dataset T2I, T2V e I2V a risoluzioni basse, medie e alte. I modelli video sono addestrati su un mix di compiti (T2I, T2V, I2V) con distribuzioni di probabilità specifiche.
- Supervised Fine-Tuning (SFT): Viene impiegata una tecnica di "model souping". I dati vengono raggruppati in domini tematici e sottodomini. Viene eseguito un full fine-tuning indipendente su ciascun sottodominio e i checkpoint risultanti vengono aggregati tramite media ponderata (pesi uguali o proporzionali alla radice) per creare un modello finale robusto. Questo previene l'overfitting e migliora la generalizzazione.
- Distillazione: Per i modelli video viene utilizzato un approccio combinato:
- Classifier-Free Guidance (CFG) Distillation: Riduce i passaggi di campionamento.
- Trajectory Segmented Consistency Distillation (TSCD): Riduce ulteriormente i passaggi a 16.
- Adversarial Post-training: Una raffinazione di seconda fase che utilizza un discriminatore (ispirato a LADD) con una funzione di perdita Hinge e perturbazione stocastica (re-noising) per ripristinare la fedeltà visiva persa durante la distillazione aggressiva.
- Post-training basato su RL (Solo Immagini): Per la generazione di immagini, viene addestrato un modello di reward (basato su Qwen 2.5VL) per confrontare le immagini generate con immagini SFT reali. Il generatore viene quindi fine-tunato utilizzando Direct Reward Fine-Tuning (DRaFT-K), massimizzando la preferenza del modello di reward minimizzando al contempo la divergenza KL dal modello SFT.
2.4 Ottimizzazioni
- Accelerazione VAE: Encoder HunyuanVideo VAE ottimizzato con refactoring del codice e
torch.compile, ottenendo un'accelerazione di 2,5×. - Ottimizzazione Inferenza: Utilizzo di Flash/Sage Attention per risoluzioni standard e NABLA per video HD/lunghi. La memorizzazione dei passaggi di diffusione tramite MagCache fornisce un'accelerazione del 46%.
- Gestione della Memoria: Implementazione di HSDP (Hybrid Sharded Data Parallel), Sequence Parallel e checkpointing delle attivazioni con offloading sull'host per ridurre il consumo di memoria GPU.
3. Contributi Chiave
- Pipeline di Dati Completa: Una descrizione dettagliata della curazione dei dati per T2I, T2V, I2V e editing basato su istruzioni, inclusa la gestione specializzata per contenuti culturali russi e dataset SFT di alta qualità.
- Framework di Addestramento Multi-Stadio: Una pipeline unificata che comprende pre-training, SFT specifico per dominio (tramite model souping), distillazione e post-training basato su RL (per le immagini) per migliorare realismo e allineamento.
- Architettura CrossDiT e NABLA: Introduzione di un backbone transformer con cross-attention e del meccanismo di attenzione sparsa NABLA, che supera la complessità quadratica per video ad alta risoluzione, consentendo un addestramento/inferenza 2,7 volte più veloce.
- Tecniche di Ottimizzazione: Implementazione di accelerazione VAE, quantizzazione dell'encoder di testo e strategie di addestramento efficienti in termini di memoria (HSDP, offloading) per abilitare la generazione ad alta fedeltà su hardware consumer e professionale.
- Strategia di Distillazione: Una combinazione innovativa di distillazione CFG, TSCD e post-training avversario per ridurre le Valutazioni di Funzione (NFE) da 100 a 16 preservando la qualità visiva.
- Rilascio Open-Source: Rilascio completo di codice, pesi e checkpoint di addestramento per tutti i modelli (Image Lite, Video Lite, Video Pro e le loro varianti Flash) tramite Hugging Face e GitHub.
4. Risultati
- Valutazione Umana: Sono state condotte estese valutazioni Side-by-Side (SBS) sul benchmark MovieGen (1.000+ prompt) con circa 20 annotatori addestrati.
- Video Lite vs Sora/Wan: Kandinsky 5.0 Video Lite ha dimostrato una Qualità Visiva e Dinamiche del Movimento superiori rispetto ai modelli Sora e Wan, sebbene i modelli Wan abbiano mostrato un Rispetto del Prompt (allineamento semantico) più forte.
- Video Lite vs Kandinsky 4.1: Sono state osservate miglioramenti significativi nelle dinamiche del movimento, nel realismo degli oggetti e nella soppressione degli artefatti.
- Video Pro vs Veo 3/Wan 2.2: Kandinsky 5.0 Video Pro ha ottenuto punteggi più alti in Qualità Visiva e Dinamiche del Movimento rispetto a Veo 3 e Wan 2.2 A14B, sebbene le varianti Veo 3 abbiano superato in Rispetto del Prompt.
- Image Lite: Ha superato FLUX.1 e Qwen-Image nella Qualità Visiva rimanendo competitivo nel Rispetto del Prompt.
- Metriche di Prestazione:
- Velocità: I modelli "Flash" distillati riducono significativamente il tempo di generazione (ad esempio, la generazione Video Lite di 10s scende da ~224s a ~61s su un H100).
- Qualità: Metriche quantitative (FVD, VBench, CLIP-score) e valutazioni umane confermano che l'addestramento multi-stadio e il meccanismo NABLA mantengono alta qualità nonostante le riduzioni computazionali.
5. Significato e Affermazioni
Il documento posiziona Kandinsky 5.0 come una pietra miliare significativa nell'IA generativa open-source, mirando a democratizzare l'accesso a modelli fondamentali di alta qualità per immagini e video.
- Accessibilità: Rilasciando modelli con diversi conteggi di parametri (2B, 6B, 19B) e varianti "Flash" distillate, il framework consente il deployment su diversi vincoli hardware.
- Avanzamento Tecnico: L'integrazione di Flow Matching, CrossDiT e NABLA affronta i colli di bottiglia di scalabilità ed efficienza intrinseci nella generazione video, offrendo un'alternativa praticabile ai sistemi proprietari chiusi.
- Impatto sulla Comunità: Gli autori sperano che il rilascio di codice open-source, checkpoint di addestramento e un rapporto tecnico dettagliato farà avanzare sostanzialmente lo sviluppo e l'accessibilità di modelli generativi di alta qualità per la comunità di ricerca.
- Posizione Etica: Il modello è rilasciato sotto licenza MIT senza filtri di contenuto integrati per favorire l'innovazione, ponendo la responsabilità dell'uso etico e della responsabilità legale sull'utente finale. Gli autori riconoscono i bias intrinseci nei dati di addestramento e incoraggiano prompt specifici per mitigare gli stereotipi.
Il rapporto conclude che, sebbene Kandinsky 5.0 raggiunga prestazioni SOTA nella qualità visiva e nella coerenza del movimento, rimangono sfide nell'allineamento testo-visivo (a causa dei limiti del contesto dell'encoder) e nella modellazione di complesse interazioni fisiche a lungo raggio, che sono identificate come direzioni per lavori futuri.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.
Ricevi i migliori articoli di machine learning ogni settimana.
Scelto da ricercatori di Stanford, Cambridge e dell'Accademia francese delle scienze.
Controlla la tua casella di posta per confermare l'iscrizione.
Qualcosa è andato storto. Riprovare?
Niente spam, cancellati quando vuoi.