Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
Oorspronkelijke auteurs: Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: Kandinsky 5.0 – Een Familie van Basismodellen voor Afbeeldings- en Videogeneratie
1. Probleemstelling
Ondanks snelle vooruitgang in diffusiemodellen en flow-matching-benaderingen voor afbeeldingsgeneratie, blijft videogeneratie een kritieke uitdaging in generatieve AI. De primaire obstakels omvatten de exponentiële groei in rekencomplexiteit bij het verwerken van tijdsafhankelijke 3D-videogegevens, moeilijkheden in het handhaven van temporele consistentie en realisme van beweging, en de behoefte aan complexe, meerstaps optimalisaties voor zowel training als inferentie. Hoewel modellen zoals Sora en Veo hoge kwaliteit hebben aangetoond, blijft het creëren van efficiënte, controleerbare en hoogresolutie videogeneratiesystemen die toegankelijk zijn voor de onderzoeksgemeenschap een aanzienlijke hindernis. Kandinsky 5.0 beoogt deze uitdagingen aan te pakken door een familie van basismodellen te bieden die in staat zijn tot hoogresolutie afbeeldings- en 10-seconden videosynthese met state-of-the-art (SOTA) prestaties en operationele efficiëntie.
2. Methodologie
2.1 Data-Verwerkingspijplijn
Het trainingskader vertrouwt op een uitgebreide, meerstaps levenscyclus voor data-curatie die verzameling, verwerking, filtering en clustering omvat:
- Tekst-naar-Afbeelding (T2I): Een dataset van meer dan 500 miljoen afbeeldingen ondergaat rigoureuze filtering (resolutie, deduplicatie, watermerkdetectie, kwaliteitsbeoordeling via TOPIQ en Q-Align, tekst/complexiteitsfiltering) en synthetische bijschriftgeneratie met behulp van multimodale modellen (InternVL2, Qwen2.5VL).
- Tekst-naar-Video (T2V): Meer dan 250 miljoen videoscènes worden gesegmenteerd, gededupliceerd en gefilterd op structurele dynamiek, technische/aesthetische kwaliteit (DOVER, Q-Align) en inhoud. Synthetische bijschriften worden gegenereerd met Tarsier2-7B.
- Afbeeldingsbewerking (I2I): Een gespecialiseerde pijplijn construeert ongeveer 150 miljoen afbeeldingsparen met precieze instructies. Dit omvat overeenkomstmatching (CLIP, DINO, gezichtsherkenning), geometrische verificatie (LoFTR, RANSAC) en kwaliteitsfiltering om voorbeelden van transformatie met hoge fideliteit te waarborgen.
- Culturele & SFT-datasets: Een Russische Culturele Code (RCC)-dataset wordt handmatig samengesteld voor culturele specificiteit. Een hoogwaardige Supervised Fine-Tuning (SFT)-dataset wordt gecreëerd door middel van deskundige handmatige selectie en domeinklassificatie (9 domeinen: dieren, architectuur, kunst, enz.) om esthetiek en het volgen van instructies te verbeteren.
2.2 Architectuur: CrossDiT en NABLA
De kernarchitectuur is een geünificeerde Diffusietransformator met Cross-Attention (CrossDiT) die getraind wordt met behulp van het Flow Matching-paradigma.
- CrossDiT: In tegenstelling tot eerdere MMDiT-achtige architecturen die concatenatie-operaties vereisten die de training vertraagden, maakt CrossDiT gebruik van een cross-attention-mechanisme voor betere compatibiliteit met sparse attention. Het integreert tekstencoders (Qwen2.5-VL) en visuele encoders (FLUX.1-dev VAE voor afbeeldingen, HunyuanVideo VAE voor video).
- NABLA (Neighborhood Adaptive Block-Level Attention): Om hoogresolutie (tot 1024px) en langdurige (tot 10s) videogeneratie te hanteren, introduceren de auteurs NABLA. Dit sparse attention-mechanisme construeert dynamisch inhoudsbewuste maskers via blokgewijze dimensiereductie en adaptieve verspreiding (CDF-drempelwaarde). Het verlaagt de kwadratische complexiteit van standaard spatiotemporale attention, wat resulteert in een 2,7× versnelling in training en inferentie terwijl de videokwaliteit behouden blijft.
- Token-herschikking: NABLA maakt gebruik van fractale afvlakking om ruimtelijke tokens te groeperen, waardoor toegangspatronen tot het geheugen worden geoptimaliseerd.
2.3 Trainingspijplijn
Het trainingsproces is meerstaps en op maat gemaakt voor verschillende modelgroottes (Image Lite, Video Lite, Video Pro):
- Pre-training: Modellen worden voorgetraind op grote schaal T2I-, T2V- en I2V-datasets over lage, middelhoge en hoge resoluties. Videomodellen worden getraind op een mix van taken (T2I, T2V, I2V) met specifieke waarschijnlijkheidsverdelingen.
- Supervised Fine-Tuning (SFT): Er wordt een "model souping"-techniek toegepast. Data wordt geklusterd in thematische domeinen en subdomeinen. Onafhankelijke volledige fine-tuning wordt uitgevoerd op elk subdomein, en de resulterende checkpoints worden geaggregeerd via gewogen gemiddelde (gelijke of wortel-proportionele gewichten) om een robuust eindmodel te creëren. Dit voorkomt overfitting en verbetert generalisatie.
- Distillatie: Voor videomodellen wordt een gecombineerde aanpak gebruikt:
- Classifier-Free Guidance (CFG) Distillatie: Vermindert het aantal bemonsteringsstappen.
- Trajectory Segmented Consistency Distillation (TSCD): Vermindert de stappen verder tot 16.
- Adversariale Post-training: Een verfijning in een tweede fase met een discriminator (geïnspireerd door LADD) met een Hinge-verlies en stochastische verstoring (her-ruisen) om visuele fideliteit die verloren is gegaan tijdens agressieve distillatie, te herstellen.
- RL-gebaseerde Post-training (alleen Afbeeldingen): Voor afbeeldingsgeneratie wordt een beloningsmodel (gebaseerd op Qwen 2.5VL) getraind om gegenereerde afbeeldingen te vergelijken met echte SFT-afbeeldingen. De generator wordt vervolgens gefine-tuned met Direct Reward Fine-Tuning (DRaFT-K), waarbij de voorkeur van het beloningsmodel wordt gemaximaliseerd terwijl de KL-divergentie van het SFT-model wordt geminimaliseerd.
2.4 Optimalisaties
- VAE-versnelling: Geoptimaliseerde HunyuanVideo VAE-encoder met code-refactoring en
torch.compile, wat een 2,5× versnelling oplevert. - Inferentie-optimalisatie: Gebruik van Flash/Sage Attention voor standaardresoluties en NABLA voor HD/lange video's. Caching van diffusiestappen via MagCache biedt een 46% versnelling.
- Geheugenbeheer: Implementatie van HSDP (Hybrid Sharded Data Parallel), Sequence Parallel en activatie-checkpointing met host-offloading om het GPU-geheugengebruik te verminderen.
3. Belangrijkste Bijdragen
- Uitgebreide Data-pijplijn: Een gedetailleerde beschrijving van data-curatie voor T2I, T2V, I2V en instructiegebaseerde bewerking, inclusief gespecialiseerde verwerking voor Russische culturele inhoud en hoogwaardige SFT-datasets.
- Meerstaps Trainingskader: Een geünificeerde pijplijn die pre-training, domeinspecifieke SFT (via model souping), distillatie en RL-gebaseerde post-training (voor afbeeldingen) omvat om realisme en uitlijning te verbeteren.
- CrossDiT- en NABLA-architectuur: Introductie van een cross-attention transformator-ruggengraat en het NABLA sparse attention-mechanisme, dat de kwadratische complexiteit voor hoogresolutie video overwint, wat 2,7× snellere training/inferentie mogelijk maakt.
- Optimalisatietechnieken: Implementatie van VAE-versnelling, kwantisatie van tekstencoders en geheugenefficiënte trainingsstrategieën (HSDP, offloading) om generatie met hoge fideliteit op consumenten- en professionele hardware mogelijk te maken.
- Distillatiestrategie: Een nieuwe combinatie van CFG-distillatie, TSCD en adversariale post-training om het aantal Functiewaarderingen (NFE) te reduceren van 100 naar 16 terwijl de visuele kwaliteit behouden blijft.
- Open-Source Release: Volledige release van code, gewichten en trainingscheckpoints voor alle modellen (Image Lite, Video Lite, Video Pro en hun Flash-varianten) via Hugging Face en GitHub.
4. Resultaten
- Menselijke Evaluatie: Uitgebreide Side-by-Side (SBS)-evaluaties werden uitgevoerd op de MovieGen-benchmark (1.000+ prompts) met ongeveer 20 getrainde annotatoren.
- Video Lite vs. Sora/Wan: Kandinsky 5.0 Video Lite toonde superieure Visuele Kwaliteit en Bewegingsdynamiek in vergelijking met Sora- en Wan-modellen, hoewel Wan-modellen een sterkere Prompt-volging (semantische uitlijning) vertoonden.
- Video Lite vs. Kandinsky 4.1: Beduidende verbeteringen werden waargenomen in bewegingsdynamiek, realisme van objecten en onderdrukking van artefacten.
- Video Pro vs. Veo 3/Wan 2.2: Kandinsky 5.0 Video Pro behaalde hogere scores in Visuele Kwaliteit en Bewegingsdynamiek in vergelijking met Veo 3 en Wan 2.2 A14B, hoewel Veo 3-varianten beter presteerden in Prompt-volging.
- Image Lite: Presteerde beter dan FLUX.1 en Qwen-Image in Visuele Kwaliteit terwijl het concurrerend bleef in Prompt-volging.
- Prestatiemetingen:
- Snelheid: Gedistilleerde "Flash"-modellen verminderen de generatietijd aanzienlijk (bijv. daalt de 10s-generatie van Video Lite van ~224s naar ~61s op een H100).
- Kwaliteit: Kwantitatieve metrieken (FVD, VBench, CLIP-score) en menselijke evaluaties bevestigen dat de meerstaps training en het NABLA-mechanisme hoge kwaliteit behouden ondanks rekenreducties.
5. Betekenis en Claims
Het artikel positioneert Kandinsky 5.0 als een belangrijke mijlpaal in open-source generatieve AI, met als doel de toegang tot hoogwaardige basismodellen voor afbeeldingen en video te democratiseren.
- Toegankelijkheid: Door modellen met verschillende parameteraantallen (2B, 6B, 19B) en gedistilleerde "Flash"-varianten vrij te geven, maakt het kader implementatie mogelijk over verschillende hardwarebeperkingen heen.
- Technische Vooruitgang: De integratie van Flow Matching, CrossDiT en NABLA adresseert de schaalbaarheids- en efficiëntieflessen die inherent zijn aan videogeneratie, en biedt een haalbaar alternatief voor propriëtaire gesloten bron-systemen.
- Impact op de Gemeenschap: De auteurs hopen dat de release van open-source code, trainingscheckpoints en een gedetailleerd technisch rapport de ontwikkeling en toegankelijkheid van hoogwaardige generatieve modellen voor de onderzoeksgemeenschap substantieel zal bevorderen.
- Ethische Standpunt: Het model wordt uitgebracht onder de MIT-licentie zonder ingebouwde inhoudsfiltering om innovatie te stimuleren, waarbij de verantwoordelijkheid voor ethisch gebruik en aansprakelijkheid bij de eindgebruiker ligt. De auteurs erkennen inherente biases in de trainingsdata en moedigen specifieke prompting aan om stereotypen te mitigeren.
Het rapport concludeert dat, hoewel Kandinsky 5.0 SOTA-prestaties bereikt in visuele kwaliteit en temporele consistentie, uitdagingen blijven bestaan in tekst-visuele uitlijning (vanwege limieten in de encoder-context) en het modelleren van complexe langetermijn-fysische interacties, die worden geïdentificeerd als richtingen voor toekomstig werk.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.
Ontvang wekelijks de beste machine learning papers.
Vertrouwd door onderzoekers van Stanford, Cambridge en de Franse Academie van Wetenschappen.
Check je inbox om je aanmelding te bevestigen.
Er ging iets mis. Opnieuw proberen?
Geen spam, altijd opzegbaar.