Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
原作者: Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:Kandinsky 5.0——面向图像与视频生成的基础模型家族
1. 问题陈述
尽管扩散模型和流匹配方法在图像生成领域取得了快速进展,但视频生成仍是生成式人工智能中的关键挑战。主要障碍包括:处理随时间变化的 3D 视频数据时计算复杂度的指数级增长;维持时间一致性和运动真实性的困难;以及训练和推理过程中对复杂多阶段优化的需求。尽管 Sora 和 Veo 等模型已展现出高质量,但构建高效、可控且高分辨率的视频生成系统并使其对研究社区可用,仍是一个重大障碍。Kandinsky 5.0 旨在通过提供一系列基础模型来解决这些挑战,这些模型具备生成高分辨率图像和 10 秒视频的能力,同时拥有最先进的(SOTA)性能和运行效率。
2. 方法论
2.1 数据处理流程
训练框架依赖于一个全面的、多阶段的数据策展生命周期,涵盖收集、处理、过滤和聚类:
- 文生图(T2I): 超过 5 亿张图像的数据集经过严格过滤(分辨率、去重、水印检测、通过 TOPIQ 和 Q-Align 进行质量评估、文本/复杂度过滤),并使用多模态模型(InternVL2、Qwen2.5VL)生成合成标题。
- 文生视频(T2V): 超过 2.5 亿个视频场景被分割、去重,并针对结构动态、技术/美学质量(DOVER、Q-Align)和内容进行过滤。使用 Tarsier2-7B 生成合成标题。
- 图像编辑(I2I): 一个专门的流程构建了约 1.5 亿对带有精确指令的图像对。这涉及相似度匹配(CLIP、DINO、人脸识别)、几何验证(LoFTR、RANSAC)和质量过滤,以确保高保真转换示例。
- 文化与 SFT 数据集: 手动策划了“俄罗斯文化代码”(RCC)数据集以体现文化特异性。通过专家手动选择和领域分类(9 个领域:动物、建筑、艺术等)创建了高质量的监督微调(SFT)数据集,以增强美学效果和指令遵循能力。
2.2 架构:CrossDiT 与 NABLA
核心架构是一个统一的带交叉注意力的扩散 Transformer(CrossDiT),采用流匹配范式进行训练。
- CrossDiT: 与之前需要连接操作从而减慢训练速度的 MMDiT 类架构不同,CrossDiT 利用交叉注意力机制以更好地兼容稀疏注意力。它集成了文本编码器(Qwen2.5-VL)和视觉编码器(用于图像的 FLUX.1-dev VAE,用于视频的 HunyuanVideo VAE)。
- NABLA(邻域自适应块级注意力): 为了处理高分辨率(高达 1024 像素)和长时长(高达 10 秒)的视频生成,作者引入了 NABLA。这种稀疏注意力机制通过块级降维和自适应稀疏化(CDF 阈值)动态构建内容感知掩码。它降低了标准时空注意力的二次复杂度,在保持视频质量的同时实现了训练和推理2.7 倍的加速。
- Token 重排序: NABLA 采用分形展平来对空间 Token 进行分组,优化内存访问模式。
2.3 训练流程
训练过程是多阶段的,并针对不同的模型规模(Image Lite、Video Lite、Video Pro)进行了定制:
- 预训练: 模型在大规模 T2I、T2V 和 I2V 数据集上进行预训练,涵盖低、中、高分辨率。视频模型在特定概率分布下混合训练多种任务(T2I、T2V、I2V)。
- 监督微调(SFT): 采用“模型汤”(model souping)技术。数据被聚类为主题领域和子领域。在每个子域上执行独立的完整微调,然后通过加权平均(等权重或根比例权重)聚合生成的检查点,以创建稳健的最终模型。这防止了过拟合并提高了泛化能力。
- 蒸馏: 对于视频模型,采用组合方法:
- 无分类器引导(CFG)蒸馏: 减少采样步数。
- 轨迹分段一致性蒸馏(TSCD): 进一步将步数减少至 16 步。
- 对抗性后训练: 使用判别器(受 LADD 启发)进行第二阶段细化,采用 Hinge 损失和随机扰动(重噪声),以恢复激进蒸馏过程中损失的视觉保真度。
- 基于 RL 的后训练(仅限图像): 对于图像生成,训练一个奖励模型(基于 Qwen 2.5VL)来比较生成图像与真实 SFT 图像。然后使用**直接奖励微调(DRaFT-K)**对生成器进行微调,在最大化奖励模型偏好的同时,最小化与 SFT 模型的 KL 散度。
2.4 优化技术
- VAE 加速: 优化 HunyuanVideo VAE 编码器,通过代码重构和
torch.compile,实现了 2.5 倍的加速。 - 推理优化: 在标准分辨率下使用 Flash/Sage 注意力,在高清/长视频中使用 NABLA。通过 MagCache 缓存扩散步骤,提供了 46% 的加速。
- 内存管理: 实施 HSDP(混合分片数据并行)、序列并行以及带有主机卸载的激活检查点,以减少 GPU 内存消耗。
3. 主要贡献
- 全面的数据流程: 详细描述了 T2I、T2V、I2V 和基于指令的编辑的数据策展,包括针对俄罗斯文化内容的专门处理和高质量 SFT 数据集。
- 多阶段训练框架: 一个统一的流程,涵盖预训练、特定领域的 SFT(通过模型汤)、蒸馏以及基于 RL 的图像后训练,以增强真实性和对齐度。
- CrossDiT 和 NABLA 架构: 引入了交叉注意力 Transformer 骨干网络和 NABLA 稀疏注意力机制,克服了高分辨率视频的二次复杂度,实现了 2.7 倍的训练/推理加速。
- 优化技术: 实现了 VAE 加速、文本编码器量化和内存高效的训练策略(HSDP、卸载),以在消费级和专业硬件上实现高保真生成。
- 蒸馏策略: 一种新颖的组合,包括 CFG 蒸馏、TSCD 和对抗性后训练,将函数评估次数(NFE)从 100 次减少到 16 次,同时保持视觉质量。
- 开源发布: 通过 Hugging Face 和 GitHub 全面发布了所有模型(Image Lite、Video Lite、Video Pro 及其 Flash 变体)的代码、权重和训练检查点。
4. 结果
- 人类评估: 在 MovieGen 基准测试(1000+ 提示)上进行了广泛的并排(SBS)评估,约有 20 名训练有素的标注员参与。
- Video Lite 与 Sora/Wan 对比: 与 Sora 和 Wan 模型相比,Kandinsky 5.0 Video Lite 在视觉质量和运动动态方面表现更优,尽管 Wan 模型在提示遵循(语义对齐)方面显示出更强的能力。
- Video Lite 与 Kandinsky 4.1 对比: 观察到运动动态、物体真实性和伪影抑制方面的显著改进。
- Video Pro 与 Veo 3/Wan 2.2 对比: 与 Veo 3 和 Wan 2.2 A14B 相比,Kandinsky 5.0 Video Pro 在视觉质量和运动动态方面获得了更高的分数,尽管 Veo 3 变体在提示遵循方面表现更佳。
- Image Lite: 在视觉质量方面优于 FLUX.1 和 Qwen-Image,同时在提示遵循方面保持竞争力。
- 性能指标:
- 速度: 蒸馏后的"Flash"模型显著减少了生成时间(例如,在 H100 上,Video Lite 10 秒生成时间从约 224 秒降至约 61 秒)。
- 质量: 定量指标(FVD、VBench、CLIP-score)和人类评估证实,尽管计算量减少,多阶段训练和 NABLA 机制仍保持了高质量。
5. 意义与主张
该论文将 Kandinsky 5.0 定位为开源生成式人工智能的重要里程碑,旨在 democratize 高质量图像和视频基础模型的访问。
- 可访问性: 通过发布具有不同参数数量(2B、6B、19B)的模型以及蒸馏后的"Flash"变体,该框架允许在不同硬件约束下进行部署。
- 技术进步: Flow Matching、CrossDiT 和 NABLA 的集成解决了视频生成固有的可扩展性和效率瓶颈,为专有闭源系统提供了可行的替代方案。
- 社区影响: 作者希望开源代码、训练检查点和详细技术报告的发布,将实质性地推动研究社区对高质量生成模型的开发和访问。
- 伦理立场: 该模型在 MIT 许可证下发布,没有内置的内容过滤,以促进创新,将道德使用和法律责任置于最终用户身上。作者承认训练数据中存在固有的偏见,并鼓励使用特定的提示来减轻刻板印象。
报告总结道,尽管 Kandinsky 5.0 在视觉质量和运动一致性方面实现了 SOTA 性能,但在文本 - 视觉对齐(由于编码器上下文限制)和建模复杂的长程物理交互方面仍存在挑战,这些被确定为未来的工作方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。