← 最新论文
🤖 machine learning

The Routing and Filtering Structure of Attention

本文提出了SS-DD注意力机制,这是一种稳定的参数化方法,它将注意力的路由和过滤组件解耦,从而揭示出一种依赖于深度的谱级联,使得在最小化困惑度损失的同时实现显著的模型压缩和早期层的线性化。

原作者: Shafayeth Jamil, Rehan Kapadia

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Shafayeth Jamil, Rehan Kapadia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将 Transformer(GPT 等模型背后的 AI 大脑)视为一座拥有 12 层楼的庞大且繁忙的办公楼。每一层楼都有相同数量的员工、相同的办公空间以及相同的工作量。这些建筑的架构师一直假设每一层都需要同等程度的复杂性,因此他们以完全相同的方式建造了所有楼层。

本文认为这一假设是错误的。事实证明,“员工”(即注意力机制)实际上在执行两项截然不同的工作,但它们被迫共用同一张办公桌,导致无法分辨谁在做什么。

以下是作者利用简单类比所发现的要点分解:

1. 两项工作:“交通警”与“过滤器”

在标准 AI 模型中,每次它查看一个句子时,都会计算出一个巨大的分数网格。作者意识到,这个网格实际上是两项不同任务的混乱混合体:

  • 交通警(路由): 这项工作关乎方向。它决定"Token A 应该向 Token B 发送信息,但反之则不行”。这就像一条单行道。它在移动信息,而不改变其总量。
  • 过滤器(筛选): 这项工作关乎相关性。它决定"Token A 和 Token B 非常相似,因此增强它们的连接”,或者“它们互不相关,因此忽略它们”。这就像一个音量旋钮,用于调高或调低信号。

问题所在: 在标准模型中,这两项工作纠缠在一个巨大且混乱的矩阵中。“过滤器”的工作过于响亮且占据主导地位,淹没了“交通警”。由于它们混合在一起,AI 会浪费大量能量去构建一个它几乎不使用的复杂“交通警”系统。

2. 实验:解开死结

为了看清究竟发生了什么,作者构建了一种名为S–D 注意力的新型注意力机制。这就像建造一座新办公室,让“交通警”和“过滤器”拥有各自独立且专用的办公桌。

  • 交通警(S): 构建得完美平衡(数学上为“斜对称”)。它只能移动信息,绝不能创造或销毁信息。
  • 过滤器(D): 构建为一份简单的“音量旋钮”列表(对角矩阵)。它仅负责放大或缩小数值。

通过将它们分离,研究人员得以观察 AI 如何在没有“过滤器”噪音主导一切的情况下自行组织。

3. 发现:“谱级级联”

当他们让 AI 以这种新的、分离的方式自行组织时,出现了一种美妙的模式,他们称之为谱级级联

再次想象那 12 层办公楼。

  • 底层(第 0–5 层): 这些楼层极其简单。它们只需要两个“交通警”方向就能完成工作。它们就像一条简单的走廊,每个人只需向左或向右移动。它们不需要复杂的交通系统。
  • 中间楼层: 复杂性缓慢增加。
  • 顶层(第 10–11 层): 只有这些楼层才需要拥有多个方向的庞大且复杂的交通系统。

重大揭示: 在标准模型中,AI 在不需要的底层构建了一个“复杂交通系统”(高秩)。它过度设计了简单的部分。当它们将工作分离后,AI 自然地组织起来:底层简单,顶层复杂。

4. “手术”:切除冗余

因为他们现在可以确切地看到每一层需要多少复杂性,所以他们对这些模型进行了“手术”:

  • 底层线性化: 他们将前 7 层中复杂的注意力机制替换为一种非常简单且廉价的线性数学技巧(就像用直线代替曲线)。

    • 结果: 模型的性能几乎没有下降(恶化不到 5%)。
    • 标准模型: 如果你尝试在普通模型上做同样的事,它会立即崩溃。普通模型即使在不需要复杂性的地方也依赖那种复杂性。
  • 反转: 在普通模型中,如果你尝试简化“过滤器”(音量旋钮),模型就会失效。但在他们新的分离模型中,将“过滤器”简化为每个头仅一个数字,几乎没有任何损害。“交通警”才是真正的干将。

5. 新蓝图

作者利用这张“谱级级联”地图重新设计了 AI 架构。他们不再给每一层分配相同数量的算力,而是构建了一个定制模型:

  • 底层: 微小、狭窄且简单。
  • 顶层: 宽大且复杂。

结果: 他们创造了一个在注意力参数方面**小 47% 到 65%**的模型,但其表现几乎与巨大的均匀模型一样好。他们本质上意识到,底层正携带着它们不需要的沉重行李箱,于是他们把这些行李箱扔掉了。

总结

该论文声称,当前的 AI 模型效率低下,因为它们将大脑的每一层都视为需要同等程度的复杂性。通过将信息的“移动”与信息的“过滤”分离开来,他们发现早期层实际上非常简单。

通过构建符合这种自然“由简至繁”结构的模型,他们可以使 AI 模型显著更小、运行成本更低,而不会损失太多智能。这就像意识到去杂货店不需要法拉利引擎;你只需要在高速公路上才需要它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →