Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
원저자: Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기술 요약: Kandinsky 5.0 – 이미지 및 비디오 생성을 위한 기초 모델 패밀리
1. 문제 제기
이미지 생성을 위한 확산 모델 (diffusion models) 과 흐름 매칭 (flow matching) 접근법의 급속한 발전에도 불구하고, 비디오 생성은 생성형 AI 에서 여전히 중요한 과제로 남아 있습니다. 주요 장애물로는 시간 의존적 3D 비디오 데이터를 처리할 때 발생하는 계산 복잡도의 기하급수적 증가, 시간적 일관성과 운동 사실성을 유지하는 어려움, 그리고 학습과 추론 모두를 위한 복잡하고 다단계 최적화의 필요성 등이 있습니다. Sora 와 Veo 와 같은 모델들이 높은 품질을 입증했음에도 불구하고, 연구 커뮤니티가 접근 가능한 효율적이고 제어 가능하며 고해상도의 비디오 생성 시스템을 구축하는 것은 여전히 큰 장벽입니다. Kandinsky 5.0 은 최첨단 (SOTA) 성능과 운영 효율성을 갖춘 고해상도 이미지 및 10 초 비디오 합성이 가능한 기초 모델 패밀리를 제공함으로써 이러한 과제를 해결하는 것을 목표로 합니다.
2. 방법론
2.1 데이터 처리 파이프라인
학습 프레임워크는 수집, 처리, 필터링, 클러스터링을 포함하는 포괄적인 다단계 데이터 큐레이션 라이프사이클에 의존합니다:
- 텍스트 - 이미지 (T2I): 5 억 개 이상의 이미지로 구성된 데이터셋은 TOPIQ 및 Q-Align 을 통한 정밀한 필터링 (해상도, 중복 제거, 워터마크 감지, 품질 평가, 텍스트/복잡도 필터링) 과 다중 모달 모델 (InternVL2, Qwen2.5VL) 을 사용한 합성 캡션 생성을 거칩니다.
- 텍스트 - 비디오 (T2V): 2 억 5 천만 개 이상의 비디오 장면은 구조적 역동성, 기술적/미적 품질 (DOVER, Q-Align), 그리고 콘텐츠를 위해 분할, 중복 제거 및 필터링됩니다. 합성 캡션은 Tarsier2-7B 를 사용하여 생성됩니다.
- 이미지 편집 (I2I): 전문 파이프라인이 정밀한 지시사항을 가진 약 1 억 5 천만 개의 이미지 쌍을 구성합니다. 여기에는 유사성 매칭 (CLIP, DINO, 얼굴 인식), 기하학적 검증 (LoFTR, RANSAC), 그리고 고희 fidelity 변환 예제를 보장하기 위한 품질 필터링이 포함됩니다.
- 문화 및 SFT 데이터셋: 러시아 문화 코드 (RCC) 데이터셋은 문화적 특수성을 위해 수동으로 큐레이션됩니다. 고품질 지도 미세 조정 (SFT) 데이터셋은 전문가의 수동 선택과 도메인 분류 (동물, 건축, 예술 등 9 개 도메인) 를 통해 생성되어 미적 감각과 지시 따르기를 향상시킵니다.
2.2 아키텍처: CrossDiT 및 NABLA
핵심 아키텍처는 흐름 매칭 (Flow Matching) 패러다임을 사용하여 학습된 통합 **크로스 어텐션 확산 트랜스포머 (CrossDiT)**입니다.
- CrossDiT: 이전의 MMDiT 유사 아키텍처가 학습 속도를 저하시키는 연결 (concatenation) 연산을 필요로 했던 것과 달리, CrossDiT 는 희소 어텐션과의 더 나은 호환성을 위해 크로스 어텐션 메커니즘을 활용합니다. 이는 텍스트 인코더 (Qwen2.5-VL) 와 시각 인코더 (이미지의 경우 FLUX.1-dev VAE, 비디오의 경우 HunyuanVideo VAE) 를 통합합니다.
- NABLA (Neighborhood Adaptive Block-Level Attention): 고해상도 (최대 1024px) 및 장시간 (최대 10 초) 비디오 생성을 처리하기 위해 저자들은 NABLA 를 도입했습니다. 이 희소 어텐션 메커니즘은 블록 단위 차원 축소 및 적응형 희소화 (CDF 임계값) 를 통해 콘텐츠 인식 마스크를 동적으로 구성합니다. 이는 표준 시공간 어텐션의 2 차 복잡도를 줄여 비디오 품질을 유지하면서 학습 및 추론 속도를 2.7 배 향상시킵니다.
- 토큰 재배열: NABLA 는 프랙탈 평탄화 (fractal flattening) 를 사용하여 공간 토큰을 그룹화하고 메모리 액세스 패턴을 최적화합니다.
2.3 학습 파이프라인
학습 과정은 다단계이며 다양한 모델 크기 (Image Lite, Video Lite, Video Pro) 에 맞게 조정됩니다:
- 사전 학습 (Pre-training): 모델은 저, 중, 고해상도에 걸쳐 대규모 T2I, T2V, I2V 데이터셋에서 사전 학습됩니다. 비디오 모델은 특정 확률 분포를 가진 T2I, T2V, I2V 작업의 혼합으로 학습됩니다.
- 지도 미세 조정 (SFT): "모델 수핑 (model souping)" 기법이 사용됩니다. 데이터는 주제별 도메인과 하위 도메인으로 클러스터링됩니다. 각 하위 도메인에 대해 독립적인 전체 미세 조정이 수행된 후, 생성된 체크포인트는 가중 평균 (동일 또는 루트 비례 가중치) 을 통해 집계되어 강력한 최종 모델을 만듭니다. 이는 과적합을 방지하고 일반화를 향상시킵니다.
- 증류 (Distillation): 비디오 모델의 경우 결합된 접근 방식이 사용됩니다:
- 분류기 없는 가이드 (CFG) 증류: 샘플링 단계를 줄입니다.
- 궤적 분할 일관성 증류 (TSCD): 단계를 16 으로 추가로 줄입니다.
- 적대적 사후 학습 (Adversarial Post-training): LADD 에서 영감을 받은 판별기를 사용한 2 단계 정제 과정으로, Hinge 손실과 확률적 교란 (재노이즈) 을 통해 공격적인 증류 과정에서 손실된 시각적 충실도를 복원합니다.
- RL 기반 사후 학습 (이미지 전용): 이미지 생성의 경우, 생성된 이미지와 실제 SFT 이미지를 비교하도록 훈련된 보상 모델 (Qwen 2.5VL 기반) 이 사용됩니다. 그런 다음 생성기는 **직접 보상 미세 조정 (DRaFT-K)**을 사용하여 SFT 모델의 KL 발산은 최소화하면서 보상 모델의 선호도를 최대화하도록 미세 조정됩니다.
2.4 최적화
- VAE 가속화: 코드 리팩토링 및
torch.compile을 통한 최적화된 HunyuanVideo VAE 인코더로 2.5 배의 속도 향상을 달성했습니다. - 추론 최적화: 표준 해상도에는 Flash/Sage Attention 을, HD/장기 비디오에는 NABLA 를 사용합니다. MagCache 를 통한 확산 단계 캐싱은 46% 의 속도 향상을 제공합니다.
- 메모리 관리: GPU 메모리 소비를 줄이기 위해 HSDP(하이브리드 샤어드 데이터 병렬), 시퀀스 병렬, 그리고 호스트 오프로딩을 통한 활성화 체크포인트를 구현했습니다.
3. 주요 기여
- 포괄적인 데이터 파이프라인: T2I, T2V, I2V 및 지시 기반 편집을 위한 데이터 큐레이션에 대한 상세한 설명으로, 러시아 문화 콘텐츠에 대한 전문 처리 및 고품질 SFT 데이터셋을 포함합니다.
- 다단계 학습 프레임워크: 사전 학습, 도메인별 SFT(모델 수핑을 통해), 증류, 그리고 이미지용 RL 기반 사후 학습을 포괄하는 통합 파이프라인으로 사실성과 정렬을 향상시킵니다.
- CrossDiT 및 NABLA 아키텍처: 고해상도 비디오의 2 차 복잡도를 극복하고 2.7 배 빠른 학습/추론을 가능하게 하는 크로스 어텐션 트랜스포머 백본과 NABLA 희소 어텐션 메커니즘의 도입.
- 최적화 기법: VAE 가속화, 텍스트 인코더 양자화, 그리고 메모리 효율적인 학습 전략 (HSDP, 오프로딩) 의 구현으로 소비자 및 전문 하드웨어에서 고희 fidelity 생성을 가능하게 합니다.
- 증류 전략: 시각적 품질을 유지하면서 함수 평가 횟수 (NFE) 를 100 에서 16 으로 줄이기 위한 CFG 증류, TSCD, 그리고 적대적 사후 학습의 독창적인 조합.
- 오픈소스 공개: Hugging Face 및 GitHub 를 통해 모든 모델 (Image Lite, Video Lite, Video Pro 및 해당 Flash 변형) 에 대한 코드, 가중치, 학습 체크포인트의 전체 공개.
4. 결과
- 인간 평가: 약 20 명의 훈련된 주석가를 대상으로 MovieGen 벤치마크 (1,000 개 이상의 프롬프트) 에서 광범위한 양측 비교 (SBS) 평가가 수행되었습니다.
- Video Lite vs. Sora/Wan: Kandinsky 5.0 Video Lite 는 Sora 및 Wan 모델에 비해 시각적 품질과 운동 역학에서 우위를 보였으나, Wan 모델은 **프롬프트 따르기 (의미적 정렬)**에서 더 강세를 보였습니다.
- Video Lite vs. Kandinsky 4.1: 운동 역학, 객체 사실성, 그리고 아티팩트 억제에서 상당한 개선이 관찰되었습니다.
- Video Pro vs. Veo 3/Wan 2.2: Kandinsky 5.0 Video Pro 는 Veo 3 및 Wan 2.2 A14B 에 비해 시각적 품질과 운동 역학에서 더 높은 점수를 달성했으나, 프롬프트 따르기 측면에서는 Veo 3 변형 모델이 더 우수했습니다.
- Image Lite: 프롬프트 따르기 측면에서는 경쟁력을 유지하면서 FLUX.1 및 Qwen-Image 보다 시각적 품질에서 우위를 보였습니다.
- 성능 지표:
- 속도: 증류된 "Flash" 모델은 생성 시간을 크게 단축합니다 (예: H100 에서 Video Lite 10 초 생성이 약 224 초에서 약 61 초로 감소).
- 품질: 정량적 지표 (FVD, VBench, CLIP-score) 와 인간 평가는 다단계 학습과 NABLA 메커니즘이 계산 감소에도 불구하고 높은 품질을 유지함을 확인시켜 줍니다.
5. 중요성 및 주장
이 논문은 Kandinsky 5.0 을 오픈소스 생성형 AI의 중요한 이정표로 위치시키며, 이미지 및 비디오를 위한 고품질 기초 모델에 대한 접근성을 민주화하는 것을 목표로 합니다.
- 접근성: 다양한 파라미터 수 (2B, 6B, 19B) 와 증류된 "Flash" 변형 모델을 공개함으로써, 이 프레임워크는 다양한 하드웨어 제약 조건에 따른 배포를 가능하게 합니다.
- 기술적 진보: 흐름 매칭, CrossDiT, 그리고 NABLA 의 통합은 비디오 생성에 내재된 확장성 및 효율성 병목 현상을 해결하여 독점 폐쇄형 시스템에 대한 실현 가능한 대안을 제공합니다.
- 커뮤니티 영향: 저자들은 오픈소스 코드, 학습 체크포인트, 그리고 상세한 기술 보고서의 공개가 연구 커뮤니티를 위한 고품질 생성 모델의 개발과 접근성을 크게 진전시킬 것으로 기대합니다.
- 윤리적 입장: 모델은 혁신을 장려하기 위해 내장된 콘텐츠 필터링 없이 MIT 라이선스로 공개되며, 윤리적 사용과 책임은 최종 사용자에게 있습니다. 저자들은 학습 데이터에 내재된 편향을 인정하고 고정관념을 완화하기 위한 구체적인 프롬프팅을 장려합니다.
이 보고서는 Kandinsky 5.0 이 시각적 품질과 운동 일관성에서 SOTA 성능을 달성했음에도 불구하고, 인코더 컨텍스트 제한으로 인한 텍스트 - 시각 정렬과 복잡한 장거리 물리적 상호작용 모델링에서 여전히 과제가 남아 있음을 결론지으며, 이를 향후 연구의 방향으로 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.
매주 최고의 machine learning 논문을 받아보세요.
스탠포드, 케임브리지, 프랑스 과학 아카데미 연구자들이 신뢰합니다.
받은편지함에서 구독을 확인해주세요.
문제가 발생했습니다. 다시 시도하시겠어요?
스팸 없음, 언제든 구독 취소 가능.