← 最新论文
💻 computer science

Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation

本文介绍了 EMA,这是一个无需训练的框架,它系统地分析并利用了扩散 Transformer 中大规模激活(Massive Activations)的独特结构,旨在同时增强细粒度生成的质量以及用于视觉理解的密集特征判别能力。

原作者: Chaofan Gan, Zicheng Zhao, Yuanpeng Tu, Xi Chen, Ziran Qin, Tieyuan Chen, Supavadee Aramvith, Mehrtash Harandi, Weiyao Lin

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaofan Gan, Zicheng Zhao, Yuanpeng Tu, Xi Chen, Ziran Qin, Tieyuan Chen, Supavadee Aramvith, Mehrtash Harandi, Weiyao Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,扩散 Transformer (DiT) 是一位技艺精湛但略显困惑的数字艺术家。这位艺术家因两件事而闻名:能够根据文本描述创作出美丽的图像,并能理解现有图像的细节。然而,研究人员发现这位艺术家的脑回路中存在一种特定的“习惯”或“怪癖”,他们称之为大规模激活 (Massive Activations, MAs)

以下是他们发现的问题以及如何解决问题的简单拆解,使用了日常类比。

发现: “大喇叭”怪癖

当艺术家的脑部(神经网络)处理图像时,其内部的大多数信号都是安静且平衡的。但研究人员发现,有几个特定的“通道”(就像电路中的特定导线)一直在极其大声地尖叫。这些就是大规模激活

  • 它们在哪里: 与其他 AI 模型中这种大声信号只发生在特定位置不同,在这些艺术家身上,大声信号遍布整幅图像,但始终卡在同样的几根导线里。
  • 谁在控制它们: 这些大声信号的音量并不是由艺术家正在画“什么”(文本提示词)来控制的,而是由绘画过程的“进度”来控制的。随着艺术家从模糊的草图过渡到完成的照片,这些信号会变得越来越响。

问题:两个不同的工作,一个共同的缺陷

研究人员意识到,这种“大声导线”的习惯会根据艺术家的任务类型导致两种不同的问题:

1. 生成问题(创作艺术)
当艺术家试图创造一张新图像时,这些大声的导线实际上是“细节引擎”。它们负责那些微小而美妙的东西,比如毛发的纹理、发丝或衣服上的图案。

  • 问题所在: 如果你忽略这些大声的导线,艺术家仍然能把握大轮廓(猫还是猫,房子还是房子),但结果看起来会很平滑且具有塑料感,缺乏细腻的细节。
  • 解决方法(细节引导 - Detail Guidance, DG): 研究人员创造了一个技巧叫做细节引导 (DG)。想象一下,你要求艺术家画一幅画,然后又要求他们再次画出“同一幅”画,但在画的时候要刻意调低那些“细节导线”的音量。这个第二个版本是一个“无聊、平滑”的版本。研究人员随后取“无聊”版本与“原始”版本之间的差异。这个差异纯粹就是额外的细节。他们利用这个差异来推动最终图像的生成,让纹理和微小部分更加鲜明,同时不改变主体内容。

2. 理解问题(分析艺术)
当艺术家试图理解一张图像(例如,对比不同照片中猫眼与狗眼的相对位置)时,同样的那些大声导线就变成了累赘。

  • 问题所在: 因为这些导线声音太大,且在整个图像中完全一致,它们淹没了图像中不同部分之间的细微差别。这就像是在一个巨大的扬声器正到处播放着同一个音符的房间里,试图去听一个人的耳语。AI 会感到困惑,因为它在内部地图中看一切都显得“过于相似”。
  • 解决方法 (MREP): 研究人员创建了一种名为 MREP 的方法,专门为理解任务“调低这些大声导线的音量”。然而,他们并没有直接删除它们;他们意识到大声的导线仍然保留了物体“在哪里”的地图。因此,他们压低了噪音,但保留了地图,使 AI 能够清晰地看到物体之间的细微差别。

解决方案:EMA (诱发大规模激活)

论文介绍了一个名为 EMA (Eliciting Massive Activation) 的框架。可以将 EMA 想象成这个数字艺术家的通用遥控器。它不需要重新训练艺术家(那将耗费数月时间和庞大的计算资源);它只是实时调整艺术家使用这些“大声导线”的方式。

  • 制作图像时: 它利用“大声导线”来增加纹理和精细细节,使图像看起来更真实,减少塑料感。它能与现有工具配合,让图像效果更上一层楼。
  • 理解图像时: 它通过静音“大声导线”,让 AI 停止将一切看作模糊的整体,转而开始观察物体的具体形状和位置。

实验结果

研究人员在几个著名的 AI 模型(如 SD3、Flux 和视频生成模型)上测试了该方法。

  • 更好的图像: 生成的图像拥有更锐利的纹理、更真实的头发和更逼真的细节。
  • 更好的理解力: 当用于寻找图像间的匹配点或进行物体分割时,AI 的准确度大幅提升。
  • 高效性: 他们发现这种方法不会显著降低计算速度,因为他们只需要重新计算图像的“无聊”部分,而不是整个图像。

简而言之,这篇论文发现了一个隐藏在这些 AI 模型内部的“音量旋钮”。通过学习如何在制作细节时调高旋钮,以及在理解形状时调低旋钮,他们在无需教导 AI 任何新知识的情况下,显著提升了 AI 在这两项工作上的表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →