Feed-Forward Steering in Transformer Residual Dynamics
本文通过将前馈网络建模为局部转向场,扩展了仅关注注意力机制的 Transformer 动力学理论,证明了其切向分量对于残差运动和模型性能至关重要,同时将对易子缺陷识别为确定并行化注意力块与前馈网络块可行性的关键指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观察一个位于计算机大脑内部的、庞大的、隐形的舞会。这不是一场伴随着音乐和闪烁灯光的舞会,而是一场由文字和数字构成的舞会。在人工智能的世界里,特别是驱动聊天机器人和搜索引擎的“Transformer”中,存在着一种持续流动的信息,被称为“残差流”(residual stream)。你可以将这条流想象成一条载着微型小船(token,即词元)的河流,这些小船代表着单词。长期以来,科学家们一直认为引导这些小船的唯一机制是被称为“注意力”(Attention)的机制。你可以把“注意力”想象成一个巨大的、隐形的磁铁,如果两艘小船谈论的话题相似,它就会把它们拉向彼此。如果一艘小船说的是“国王”,磁铁可能会把它拉向另一艘说“女王”的小船。这种拉力被称为“聚合”(aggregation),这也是为什么属于同一类别的单词会开始在相同的方向上聚集在一起的原因。
然而,舞会的另一部分是前馈网络(Feed-Forward Network,简称 FFN)。如果说“注意力”是把小船拉在一起的磁铁,那么 FFN 就是紧挨在每艘小船身边的当地 DJ 或私人教练,根据这艘特定小船所表达的内容,给它一个特定的推力。多年来,研究人员一直认为 FFN 只是一个配角,也许只是调整一下小船的速度或音量。然而,一篇新论文提出了一个重大问题:FFN 仅仅是一个音量旋钮,还是它实际上是决定小船去向的转向盘?理解这一点至关重要,因为如果我们知道这些小船究竟是如何移动的,我们就能让 AI 变得更快、更聪明,并且在出错时更容易修复。
论文的大发现:DJ 就是船长
这篇题为《Transformer 残差动力学中的前馈转向》(Feed-Forward Steering in Transformer Residual Dynamics)的论文指出,旧有的观点遗漏了拼图中至关重要的一块。作者提出了一种看待舞会的新方式:注意力是“聚合”过程,将所有人拉向一个共同的群体;而 FFN 是一个“转向场”(steering field),它主动将个体小船推向新的方向。他们将这些单词小船的运动视为一个物理问题,即粒子在球面上(类似于地球表面)运动。
研究人员发现,FFN 不仅仅是把小船向前或向后推(这只会改变它们的速度或大小)。相反,FFN 最重要的工作是将它们向侧面,即“切向”(tangentially)推。想象一下在全球仪上的一个小船:把它推向北极会改变它相对于中心的尺寸,但把它向侧面推则会改变它在地图上的实际方向。论文表明,正是这种侧向的推力改变了单词的含义和路径。
他们的做法与发现
为了证明这一点,团队在包括 GPT-2、Pythia、Mistral 和 Llama-3 在内的几个著名 AI 模型上进行了一系列实验。他们把 AI 当作一个科学实验室,在那里可以开启或关闭某些部分,或者改变它们的工作方式。
首先,他们检查了仅靠“注意力”是否足以解释小船的去向。他们发现了一个巨大的“角度对齐缺陷”(angular-alignment deficit)。简单来说,如果他们只让“注意力”磁铁起作用,小船最终指向的方向与真实的 AI 所引导的方向并不一致。这种缺陷随着模型变得更大、更新而变得越来越大,从 GPT-2 的约 0.41 增加到了 Llama-3-8B 的 0.63。这表明,如果没有 FFN 的转向,AI 就会迷失方向。
接下来,他们对 FFN 进行了一次“手术”。他们将 FFN 的推力分为两部分:“径向”(radial)部分(向前/向后推)和“切向”(tangential)部分(向侧面推)。
- 当他们只保留径向部分时,AI 的性能完全崩溃了,就像完全移除了 FFN 一样。
- 当他们只保留切向部分时,AI 几乎完美地保持运行,仅有微小的质量下降。
这是一个确凿的证据。它证明了 FFN 的主要职责是转向单词的方向,而不仅仅是调整它们的大小。
他们还观察了当“注意力”磁铁拉力过大,试图把所有小船挤成一个微小的集群时(这是一个被称为“秩崩溃”的问题)会发生什么。他们发现 FFN 起到了反向作用。虽然“注意力”试图把小船挤压在一起,但 FFN 会把它们推开,保持群体的多样性,防止它们都变成同一个单词。这就像一位 DJ 发现大家都在向中心拥挤,于是开始播放一种能让人们重新散开的节奏。
一个实用的技巧:加速舞会
这篇论文最令人兴奋的部分是他们发现的一个实用技巧。在标准的 AI 中,小船首先被“注意力”磁铁拉动,然后 FFN 教练再给它一个推力。这两个过程是先后发生的(串行)。研究人员问道:“如果我们让磁铁和教练同时工作(并行)会怎样?”
通常情况下,你不能这样做,因为教练需要先看到磁铁把小船拉到了哪里。但团队测量了一个“缺陷得分”(defect score),以观察每一层 AI 中顺序的重要性。他们发现,对于某些层,顺序并不重要。通过识别这些“低缺陷”层,他们可以让“注意力”和 FFN 部分同时运行。
- 在 GPT-2-large 中,他们在几乎没有质量损失(仅 +0.02 损失)的情况下,成功将处理速度提升了约 1.24 倍。
- 在 Mistral 中,他们实现了 1.10 倍的加速,且质量损失极微(+0.009)。
然而,如果他们在顺序非常重要的“高缺陷”层尝试这样做,AI 的性能就会崩溃。这表明,虽然我们不能立即让整个 AI 实现并行化,但通过了解精确的转向机制,我们可以加速其中的特定部分。
这意味着什么
这篇论文并不声称已经解决了关于 AI 的所有问题,但它改变了我们看待引擎的方式。它表明 FFN 不仅仅是一个助手,它是一个塑造 AI 思维几何形状的定向转向场。它防止 AI 陷入单一方向,并允许其导航复杂的概念。通过理解 FFN 是“转向盘”而非仅仅是“油门”,研究人员或许能够构建出更快、更高效、且不会迷失方向的 AI 模型。这些发现是基于对多个模型的仔细测量和模拟得出的,这表明这种“聚合-转向”的视角是理解这些数字大脑如何运动的一种稳健方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。