← 最新论文
💻 computer science

Attention Sinks in Diffusion Transformers: A Causal Analysis

本文提出了一项因果分析,表明尽管抑制扩散变换器中的注意力汇聚会引发显著的感知偏移,但移除它们并不会损害文本 - 图像对齐或偏好指标,从而揭示了轨迹级扰动与语义对齐之间的经验性解耦。

原作者: Fangzheng Wu, Brian Summa

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Fangzheng Wu, Brian Summa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对该论文的解读。

核心问题:“注意力汇聚”(Attention Sinks)重要吗?

想象你正在执导一场拥有数百名演员(Token)的大型戏剧。在某些类型的戏剧中(称为自回归语言模型,就像你对话的聊天机器人),导演会注意到,某一个特定的演员——通常是第一个走上舞台的——几乎总是独占聚光灯。其他演员几乎得不到任何关注。

研究人员将这些“霸占聚光灯”的演员称为**“注意力汇聚”**。在聊天机器人中,人们曾认为这些汇聚点是必不可少的。它们被视为支撑整场演出的“锚点”或“粘合剂”。如果移除了它们,整场戏就会分崩离析。

本文提出了一个不同的问题: 这条规则是否适用于扩散 Transformer(即像 Stable Diffusion 那样根据文本生成图像的 AI 模型)?

在图像生成中,“戏剧”的运作方式不同。演员们不是一一发言,而是整个舞台被同时、逐步地重新绘制,从一团模糊的混乱逐渐变成清晰的画面。研究人员想知道:这些霸占聚光灯的演员是否仍然是维系图像整体的粘合剂,还是说它们只是可以被移除而不会毁掉演出的布景的一部分?

实验:关掉聚光灯

为了查明真相,研究人员没有只是观察演员,而是进行了干预。他们使用了一种“因果”测试,这就像是一个科学实验:改变一件事,然后观察会发生什么。

  1. 识别汇聚点: 在图像生成过程的每一步,他们找出哪一个"Token"(提示词或图像数据的一部分)获得了模型其余部分最多的关注。
  2. 干预措施: 他们不仅仅是忽略这些演员,而是有效地告诉模型停止关注它们。他们通过数学方法将这些 Token 接收到的注意力“归零”来实现这一点。
  3. 对比: 他们将移除了汇聚点生成的图像与正常生成的图像进行对比,使用了完全相同的随机种子,因此唯一的变量就是汇聚点的移除。

结果:演出继续(大部分如此)

研究结果令人惊讶且清晰:

1. 含义保持不变
当他们移除注意力汇聚点时,生成的图像仍然完美地匹配了文本描述。

  • 类比: 想象你要求生成“一个蓝色的披萨和一个黄色的棒球手套”。即使关掉了“汇聚”演员的聚光灯,AI 仍然画出了一个蓝色的披萨和一个黄色的手套。
  • 数据: 衡量图像与文本匹配程度的指标(如 CLIP-T)以及衡量人类偏好的指标(如 ImageReward)显示没有显著下降。AI 并没有搞混它应该画什么。

2. 外观发生变化(但含义未变)
虽然含义保持不变,但图像的外观确实发生了偏移。

  • 类比: 如果原始图像是一张披萨的照片,那么“移除汇聚点”后的版本可能看起来像同一张披萨的绘画,或者从略微不同的角度拍摄的照片,或者是不同光照下的照片。它仍然是一个蓝色的披萨,但“氛围”或“质感”有所不同。
  • 数据: 研究人员发现,移除汇聚点导致的视觉外观变化,比随机移除其他演员所导致的变化大了6 倍。这表明汇聚点确实携带了一些关于视觉风格或轨迹的信息,但它们对于保持核心概念的正确性并非必需。

3. “粘合剂”的神话被打破
在聊天机器人中,移除“汇聚点”会破坏模型。而在图像生成器中,移除“汇聚点”就像从一面被粉刷过的墙上取下特定的砖块。墙壁(图像概念)依然稳固,即使油漆工作(具体的视觉细节)发生了轻微偏移。

“更强”的测试:我们能移除多少?

研究人员还测试了如果移除更多的汇聚点(不仅仅是前 1 个,而是前 5 个或更多)会发生什么。

  • 结果: 即使移除了大量的汇聚点,文本到图像的对应关系依然保持强劲。AI 仍然知道它在画披萨。
  • 细微差别: 存在一个非常微小的特定界限。当他们移除许多汇聚点时,一个特定的“偏好”分数(HPS-v2)略有下降,这表明对于像人类一样的评判者来说,图像可能看起来有一点点不那么“完美”,但核心含义从未破裂。

结论:新的理解

该论文得出结论:在图像生成 AI 中,注意力汇聚点对于 AI 理解要画什么在功能上并非必要。

  • 旧观念: “那些获得所有关注的演员是最重要的;我们必须保留它们。”
  • 新发现: “那些演员只是做了很多工作,但如果我们让他们静音,演出也不会崩溃。AI 仍然能画出正确的东西。”

这是一个重大突破,因为它表明未来的 AI 模型可以通过忽略这些“汇聚”Token 来变得更快、更高效,而无需担心 AI 会忘记它本应创造的内容。这种“粘合剂”实际上并不是胶水;它只是模型的一种习惯,可以被打破而不会毁掉画面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →