Taming Outlier Tokens in Diffusion Transformers
本文通过引入双阶段寄存器(DSR)来识别并解决扩散 Transformer(DiT)中的异常值令牌问题,该方法有效减少了伪影,并提升了编码器与去噪器组件的图像生成质量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个非常聪明、富有艺术感的机器人(称为扩散 Transformer)从零开始绘制美丽的图画。这个机器人通过观察一张杂乱、充满噪声的草图,并逐步将其清理,直到清晰的图像显现出来。
这篇论文的研究人员发现了一个隐藏的问题,它正在扰乱机器人的绘画过程。他们将这些问题称为"异常值 Token"。
以下是他们发现的内容以及他们如何利用简单的类比来修复它。
1. 问题:“大嗓门”Token
将机器人的大脑想象成一个由数千名微小工人(称为Token)组成的团队。每个工人负责查看图像的一小部分(如单个像素或一小群像素),并弄清楚它是什么。
在一个完美的世界里,每个工人都平等地做出贡献。但研究人员发现,少数工人表现得像极度聒噪的大嗓门。
- 他们做了什么:这些“异常值”工人会大声喊叫(拥有巨大的数学值),以至于机器人的注意力机制被分散。机器人不再倾听那些了解图像细节的安静、有帮助的工人,而是完全专注于这几个大声的声音。
- 结果:机器人忽略了实际的图像细节,转而关注噪声。这导致最终画作中出现了模糊、奇怪的伪影,如奇怪的斑块或涂抹的纹理。
2. 噪声的来源
研究人员发现,这些“大嗓门”出现在机器人工作流程的两个不同位置:
- 翻译器(编码器):在机器人开始绘画之前,它首先将现实世界翻译成它能理解的语言。研究人员发现,“翻译器”在故事开始之前就已经发送了一些这些大声且混乱的信息。这就像一位翻译员在故事开始前就意外地喊错了词。
- 画家(去噪器):更糟糕的是,机器人的绘画大脑本身在工作过程中就开始制造新的“大嗓门”。这些“大嗓门”并非出现在最后(正如人们之前所认为的那样),而是出现在绘画过程的中间。这就像画家在画到一半时感到困惑,开始大喊胡言乱语,破坏了艺术品的中间层次。
3. 失败的修复:仅仅让大嗓门闭嘴
起初,团队认为:“好吧,让我们告诉机器人忽略那些大声的工人。”他们尝试了一种称为损失掩码的策略,就像在最响亮的 Token 上贴一个“请勿倾听”的标志。
这不起作用。
为什么?因为问题不仅仅在于工人太吵;而在于他们携带的信息已经受损。让他们闭嘴并没有修复缺失的细节;它只是在图像中留下了空洞。这就像试图用胶带封住破碎的窗户来修复它——光线依然无法透进来。
4. 真正的解决方案:“双阶段寄存器”(DSR)
研究人员意识到他们需要一种不同的方法。与其让大声的工人沉默,不如给机器人一个特殊的安全阀。
他们引入了一种新工具,称为双阶段寄存器(DSR)。将这些寄存器想象成机器人大脑专用的**“垃圾桶”或“安全阀”**。
- 工作原理:他们在机器人的团队中添加了一些特殊的、不可见的 Token(即寄存器)。这些寄存器有一个特殊的任务:捕捉噪声。
- 类比:想象一个拥挤的房间,每个人都在说话。如果有几个人开始尖叫,对话就会被破坏。但是,如果有几个人站在角落里,他们的唯一工作就是吸收尖叫声并说:“好的,我们听到了,现在让我们专注于真正的对话”,那么房间就会重新恢复平静。
- 两阶段方法:
- 阶段 1(翻译器):他们在翻译器中添加了一个“安全阀”,以便在噪声进入绘画阶段之前就将其捕捉。
- 阶段 2(画家):他们在绘画大脑内部添加了一组“安全阀”,以捕捉过程中间出现的新噪声。
5. 结果
当他们使用这种双阶段寄存器系统时:
- “大嗓门”被捕捉并中和。
- 机器人终于能够倾听那些了解图像实际细节的安静、有帮助的工人。
- 结果:画作变得更加锐利、清晰和逼真。机器人学会了更好、更快、更少错误地绘画。
总结
这篇论文是关于发现一种特定类型的“噪声”(异常值 Token),它会混淆 AI 图像生成器。作者表明,简单地忽略这种噪声是行不通的。相反,他们构建了一个两阶段的安全系统(双阶段寄存器),它充当噪声的专用垃圾桶,使 AI 能够专注于实际的图像细节。这个简单的修复使 AI 在生成高质量图像方面有了显著提升。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。