Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers
本文介绍了一种用于扩散 Transformer 的新型变长分词器,该分词器通过采用可学习的全局合并来实现数据无关的跨长度表示对齐,从而在实现卓越的质量-计算权衡的同时,克服了传统基于截断的方法所固有的语义失配问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图给朋友发送一部高清电影。如果你发送未经压缩的完整文件,下载会耗费极长时间并占用大量数据;如果你压缩得太厉害,画面就会变得模糊且充满颗粒感。
长期以来,AI 图像生成器(例如那些根据文本创建图片的 AI)一直面临着这个难题。它们使用一种“分词器”(tokenizer)——即一种将图像分解为被称为“标记”(tokens)的小块的翻译器。
- 高压缩(少量标记)= 快速且廉价,但图像质量差。
- 低压缩(大量标记)= 画质极佳,但速度慢且昂贵。
以前,如果你想在速度和质量之间取得不同的平衡,你必须为每种设置训练一个完全不同的 AI 模型。这就像为了以每小时 10 英里的速度减速行驶,就必须更换一个全新的汽车引擎一样。
“裁剪”的问题
一些研究人员尝试通过创建“可变长度”的分词器来解决这个问题。他们的想法很简单:“如果我们想节省空间,就直接把标记列表的末尾切掉。”
这就像一本书,最重要的情节都在第 1 页,而微小的细节都在第 100 页。如果你想要一个简短的版本,你只需撕掉最后 50 页。
- 代价是: 这改变了故事。 “短版本”只关注大局,而 “长版本”则包含微小的细节。因为内容如此不同,AI 会感到困惑。这就像试图让一个学生用同一本教科书去阅读短篇小说和长篇小说,但两者的章节却完全不同。AI 难以同时学习两者,从而导致图像模糊或出现异常。
解决方案:“合并”而非“裁剪”
该论文的作者提出了一个更聪明的方法:合并而非裁剪。
想象你有一组 100 个人(标记)排成一队。
- 旧方法(裁剪): 如果你需要更少的人,你只需让最后 50 个人回家。剩下的 50 个人仍然站在完全相同的位置。
- 新方法(合并): 如果你需要更少的人,你要求长相相似的人聚在一起,组成一个“超级个体”。如果两个人穿着同样的红衬衫,他们就会合并成这个群体的代表。
为什么这种方法更好?
- 一致性: 无论你有 100 个人还是 10 个“超级个体”,这些“群体”都代表了相同的底层结构。“红衬衫群体”依然存在,只是被浓缩了。这为 AI 保持了连贯的“故事”,无论你使用多少个标记。
- 对齐: 因为这些群体是基于相似性(而非位置)形成的,所以 AI 可以学习一个适用于短列表和长列表的单一模型。
核心秘诀:“可学习的全局合并”
这里有一个巨大的障碍。通常,为了决定谁与谁合并,你需要观察特定的图像(例如,“这两个像素看起来像猫的耳朵,所以把它们合并”)。但当 AI 从头开始创建 一张新图像时,它还没有图像!它无法通过观察图像来决定如何合并。
作者通过 “可学习的全局合并” 解决了这个问题。
你可以把它想象成一套预设的规则手册或“总体计划”。AI 在训练期间学习的不是观察图像来决定合并,而是使用一个固定的、学习到的模式(就像一份通用的说明书),上面写着:“标记 1 总是与标记 2 合并,标记 3 总是与标记 4 合并”,无论最终图像是什么样子。
尽管这个规则手册是固定的(不会随图像而改变),但 AI 对其进行了充分的训练,使其能够自然地将相似的事物归为一组。这使得 AI 即使在生成图片之前,也能准确知道如何处理这些“合并后”的标记。
结果
研究人员在 ImageNet(一个庞大的图像数据库)上测试了该方法。他们发现:
- 他们的这种方法允许单个 AI 模型在不同的速度和质量下生成图像,而无需为每种设置重新训练。
- 与之前仅仅“裁剪”标记的方法相比,他们生成的图像质量更高,数学运算也更高效。
- 他们甚至添加了一个微小的“微调”步骤(使用名为 LoRA 的技术),这能让 AI 在几乎不增加额外成本的情况下,在特定标记数量下表现得更好。
简而言之: 他们找到了让 AI 图像生成器变得灵活的方法。他们没有强迫 AI 在“快速型”模型和“高质量型”模型之间做出选择,而是构建了一个聪明的翻译器,可以通过智能地将相似部分分组,从而实现图像数据的缩放,在保持高质量的同时降低成本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。