KVAE: Family of Tokenizers for Multimodal Generative Models
本文介绍了 KVAE,这是一个用于音频、图像和视频的高性能分词器家族,其重建与生成质量达到或超越了现有的最先进开源模型,同时提供了详尽的训练细节和代码,以促进其在文本条件下的多模态生成模型中的应用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人创作杰作、谱写交响乐或导演电影。你不能只是把一堆杂乱无章的像素或数十亿个声波直接丢给机器人;那就像是试图通过把砖头扔向墙壁并祈祷它们能粘住来盖房子。机器人需要一份蓝图。在人工智能的世界里,这份蓝图被称为“分词器”(tokenizer)。可以将分词器想象成一个超级聪明的翻译官,它能将一段混乱的高清视频或一段复杂的音频轨道压缩成一组整洁、微小的指令——即“潜空间”(latent space)——这样 AI 才能真正理解并与之交互。
长期以来,科学家们认为这个翻译官最重要的特质是成为一个完美的复印员:如果你给它一张图片,它应该能够完全原样地把它画出来。但一个新的想法正在酝酿:也许最好的翻译官不是那个能完美复制的,而是那个能以一种让 AI 容易构思出“新事物”的方式来组织信息的翻译官。这就像是复印机与制图师之间的区别:复印机只能完美复制一张地图,而制图师则会重新绘制地图,画出清晰、逻辑严密的道路,让旅行者更容易找到新的目的地。这篇论文深入探讨了正是这样一个问题,探索如何构建这些用于图像、视频和声音的翻译器,从而让 AI 能够创造出更好、更快、更具创造性的内容。
KVAE 家族:AI 创作者的终极翻译官
认识一下 KVAE 家族,这是由 Kandinsky Lab 团队创造的一套全新的工具。它们是专门设计的“分词器”,旨在充当原始数据(如视频剪辑或歌曲)与生成它们的 AI 模型之间的桥梁。团队意识到,最终 AI 作品的质量很大程度上取决于这座桥梁建造得有多好。如果桥梁摇晃不稳,AI 就会踉跄;如果桥梁平滑且组织有序,AI 就能跑得飞快并创造出惊人的事物。
该论文介绍了这个家族中的三个主要成员,每个成员都针对不同类型的媒体进行了定制:
- KVAE-Audio:一个处理声音的翻译器,其工作频率高达 48 kHz(高品质音频的标准)。它将音频压缩成一个拥有 64 个通道的紧凑格式,使 AI 能够在不丢失音乐或语音细微差别的情况下,听到并创作全带宽的声音。
- KVAE-3D:一套用于视频的翻译器。它们旨在处理视频中棘手的“时间”维度,通过压缩帧让 AI 理解运动。它们有两种尺寸:一种在时间上压缩 4 倍并在空间上压缩 16 倍,另一种则进行更激进的压缩。
- KVAE-2D:一个用于静态图像的翻译器,通过 8 倍压缩来为 AI 提供一个干净、高效的表示形式。
重大发现:重点不在于完美的复制
这篇论文中最令人兴奋的发现是一个有些反直觉的结论。多年来,这些翻译器的目标一直是实现完美的重构(reconstruction)——也就是说,如果你输入一张图像,输出的结果应该看起来与输入完全一致。KVAE 团队发现,追求完美的重构其实是一个陷阱。
他们发现,一个分词器可能非常擅长复制图像,但在帮助 AI 生成新图像方面却表现糟糕。这就像是一个学生可以逐字逐句地背诵教科书,却无法就一个新话题写出一篇论文。论文指出,秘诀在于他们称之为**“可扩散性”(diffusability)**的东西。这是一个高级说法,意思就是:“这些压缩后的数据对于 AI 来说有多容易进行‘游戏’(操作)?”
为了衡量这一点,团队开发了一个聪明的测试,称为相关性衰减斜率(Correlation Decay Slope, CDS)。想象一下你正在观察网格上的点阵模式。如果点与邻近的点过于相似,那么这种模式就是“粘稠”的,难以让 AI 进行移动。如果随着你在网格上移动,点的变化呈现出某种特定的、可预测的方式,那么这种模式就是“流畅”的,易于 AI 进行操纵。KVAE 模型经过调整,旨在具有这种“流畅”的特性,即使这意味着它们在完美复制原始图像方面并非绝对顶尖。
结果:更好的电影、音乐与艺术
当团队利用这些新的翻译器对 AI 模型进行训练测试时,结果令人印象深刻。
- 对于图像:当他们使用 KVAE-2D 根据文本生成图片时,AI 生成的图像在人类评分中,其质量和对提示词的忠实度都高于使用其他流行开源工具生成的图像。有趣的是,那个最擅长复制图像(重构)的模型,实际上生成的新图像反而比 KVAE 模型生成的更差,这证明了重构并不是故事的全貌。
- 对于视频:KVAE-3D 模型帮助 AI 生成了运动更自然、画面更锐利的视频。在与领先的视频分词器的正面交锋中,KVAE 模型在训练速度和最终视频质量(尤其是视频与文本描述的匹配度)方面都表现出色。
- 对于音频:KVAE-Audio 分词器是声音领域的游戏规则改变者。与其他将声音切碎成低质量片段或丢失“相位”(声波的时序)的工具不同,KVAE-Audio 保留了完整的 48 kHz 质量。在生成音乐和语音时,尽管它使用的“通道”数(64个)比一些竞争对手(使用128或256个)更少,但它生成的音频更受人类青睐。
权衡:为什么“少”反而能“多”
论文的一个核心教训是关于平衡。团队实验了增加翻译器的“宽度”(增加更多通道)以观察是否会有所帮助。对于视频,他们发现增加翻译器的宽度确实有助于提升复制和生成能力。但对于音频,他们找到了一个平衡点。如果他们把音频翻译器做得太宽(通道过多),AI 就会难以学习如何生成新声音,尽管复制效果会略有提升。
事实证明,对于音频而言,64 个通道是“金发姑娘区”(Goldilocks zone)——恰到好处,既能让 AI 快速学习,又能创作出高质量的声音。这表明,并不存在一个单一的“最佳”尺寸;它取决于你处理的是视频、图像还是声音,以及 AI 需要处理多少信息。
总结
KVAE 团队不仅制造了更好的翻译器,他们还弄清楚了为什么有些翻译器在创造力方面比其他翻译器更有效。通过关注数据的组织方式(可扩散性)而非仅仅是复制得有多完美,他们创造出的工具能帮助 AI 生成不仅高质量,而且更符合逻辑且符合人类指令的媒体内容。
最棒的部分是?他们并没有把这些秘密藏起来。代码和模型都是开源的,这意味着任何人都可以使用这些工具来构建属于自己的 AI 艺术、音乐和视频生成器。这提醒我们,在 AI 的世界里,有时最重要的步骤不仅仅是让机器人变得更聪明,而是给它一张更好地导航世界的地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。