← 最新论文
💻 computer science

SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers

SEGA 是一种无需训练的方法,它通过根据潜在变量的空间频率结构动态缩放旋转位置嵌入组件中的注意力,从而增强扩散 Transformer 中的分辨率外推能力,进而提升高分辨率图像生成中的结构连贯性与细节保真度。

原作者: Javad Rajabi, Kimia Shaban, Koorosh Roohi, David B. Lindell, Babak Taati

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Javad Rajabi, Kimia Shaban, Koorosh Roohi, David B. Lindell, Babak Taati

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢的肖像画大师,他们只曾在 10 英寸的小画布上练习过。如果你突然要求他们在 20 英尺高的墙壁上绘制一幅巨大的壁画,他们可能会感到困惑。他们可能会开始重复图案、模糊细节,或者失去画面的整体轮廓,因为当空间变得过大时,他们关于“事物应位于何处”的“心理地图”就会崩溃。

这正是 SEGA(光谱能量引导注意力)为 AI 图像生成器所解决的问题。

以下是其工作原理的分解,使用简单的类比:

问题:“困惑的地图”

现代 AI 图像生成器(如 Flux 和 Qwen)使用一种称为 RoPE(旋转位置编码)的特殊内部指南针,来知晓图像的每个部分应位于何处。

  • 问题所在: 当这些 AI 尝试生成远超其训练规模的图像时,它们的内部指南针会被“稀释”。这就像试图用一张小镇的街道地图来导航整个国家;地标变得模糊,AI 开始一遍又一遍地画同一棵树,或者让天空看起来像静态噪点。
  • 旧有的修复方法: 以前的方法试图通过应用“一刀切”的调整来解决这个问题。想象一下给画家一条单一规则:“将你的视野缩小 20%。”这虽然有点帮助,但太过粗糙。它可能会让背景(大轮廓)变清晰,却意外地模糊了面部(微小细节),反之亦然。你无法用一个单一的旋钮来修复整幅画面。

解决方案:SEGA 的“智能聚光灯”

SEGA 是一种新的免费工具(无需重新训练 AI),它充当 AI 注意力的动态智能聚光灯

SEGA 不使用单一的固定规则,而是观察图像在绘制过程中(逐步进行)的状态,并问道:“此刻图像的这部分有什么样的能量?”

  1. 聆听频率: 将图像想象成一首歌。有些部分是低沉的贝斯(大轮廓,如山脉或建筑物),有些则是高音的颤音(精细细节,如树叶或织物纹理)。
  2. 智能调整: SEGA 分析正在生成的图像中这些不同频率的“音量”(能量)。
    • 如果“贝斯”(大轮廓)很安静,SEGA 就会调高 AI 对这些部分的注意力音量,以保持结构稳固。
    • 如果“颤音”(微小细节)已经响亮清晰,SEGA 就会稍微调低音量,以免 AI 感到困惑并开始重复图案。
  3. 结果: AI 在绘画过程的每一个瞬间都获得了量身定制的指令。它确切地知道何时关注大局,何时聚焦于微小细节,而不会感到困惑。

为何重要

该论文表明,有了 SEGA,这些 AI 画家突然能够创作出巨大、超高分辨率的图像(例如 6000x6000 像素),这些图像看起来既清晰又连贯。

  • 无需重新训练: 你不需要教 AI 任何新东西。当你要求生成大图像时,只需打开这个“智能聚光灯”开关即可。
  • 更高质量: 它解决了 AI 尝试生成过大图像时通常出现的“模糊纹理”和“重复图案”问题。
  • 通用性强: 它适用于不同类型的 AI 模型(Flux 和 Qwen),并且处理奇怪的形状(如非常高或非常宽的图像)的能力与处理方形图像一样出色。

简而言之,SEGA 通过动态调整焦点,让 AI 能够在巨大的画布上“看清”事物,确保图像的宏伟架构和最细微的细节都保持完美。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →