Gated Normalization Removal and Scale Anchoring in Pre-Norm Transformers
本文介绍了 TaperNorm,这是一种针对预归一化 Transformer 的门控方法,通过逐步移除内部归一化层来提升推理吞吐量,并揭示了最终归一化层的主要作用在于锚定预对数 logits 表示的尺度,而这一功能可通过固定目标缩放来替代,从而实现完全无归一化的模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个 Transformer 模型(现代 AI 聊天机器人背后的“大脑”)是一座巨大的多层工厂。每当一条数据(一个词)穿过工厂时,它都要经过几个房间。在每一个房间里,都有一位“质量检查员”(称为归一化层),它在数据进入下一个房间之前,检查数据、调整其规模,并确保它不会变得过于失控或过于微小。
多年来,工程师们认为这些检查员在所有步骤中、任何时候都是绝对必要的。但这篇论文提出了一个简单的问题:在工厂完成训练之后,我们真的还需要这些检查员保持活跃吗?
以下是他们发现的分解,使用了简单的类比:
1. “渐隐”技巧(将检查员转变为门道)
作者创造了一种名为TaperNorm的新方法。把它想象成质量检查员的调光开关。
- 训练期间:在开始时,检查员努力工作,像往常一样检查每一条数据。
- 过渡阶段:随着训练结束,作者逐渐“调暗”检查员。他们并没有直接解雇他们,而是教导他们停止检查数据,而是让数据通过一个简单的固定规则(例如“乘以 1.5")直接通过。
- 结果:到了最后,检查员消失了。他们被一个简单的静态门道所取代。因为这个门道只是一个固定规则,工厂可以将其“折叠”到下一个房间的机器中。这意味着计算机不再需要执行任何额外的数学运算来检查数据;它只需将数据传递下去。
这为什么重要?
该论文在小型模型(TinyStories)和一个著名模型(GPT-2)上测试了这一点。他们发现,移除这些内部检查员并没有显著损害模型的智能(性能仅出现微小下降)。然而,由于移除了检查员,工厂变得更快了。
- 速度提升:当他们测试模型生成文本的速度时,速度提高了1.18 倍。这就像一辆汽车仅仅通过移除几个不必要的减速带,就从每小时 60 英里提速到了每小时 70 英里。
2. “锚点”问题(为什么最后一个检查员必须保留)
这是最有趣的发现。虽然他们可以移除工厂中间的检查员,但他们发现最后一个检查员(就在 AI 给出最终答案之前)扮演着特殊且独特的角色。
锚点的类比:
想象 AI 的最终想法是一个在风中飘浮的气球。
- 有最后一个检查员时:检查员就像一个锚。它将气球固定在特定高度。无论风刮得多大(数学试图让答案更加自信),气球都保持在稳定的水平。这保持了 AI 的稳定性。
- 没有最后一个检查员时:如果你移除了那个最后的锚,气球就会自由漂移。AI 的数学运算自然会试图让气球飞得越来越高(使答案更加“自信”或极端),仅仅是为了降低其误差分数。这被称为**“Logit 追逐”**。AI 变得不稳定,因为它不断无限地膨胀自己的自信。
解决方案:
如果你必须移除最后一个检查员(为了让模型更快),你就必须用别的东西来替代这个锚。作者使用了一种**“固定目标尺度损失”**。
- 隐喻:想象一根绳索,如果气球试图飘得太高或沉得太低,它会轻轻地将气球拉回特定高度。这根绳索充当了“虚拟锚”,阻止 AI 发疯,从而允许他们安全地移除最后一个检查员。
3. 底线
该论文得出了两个主要结论:
- 内部检查员是可选的:你可以用检查员训练 AI,然后在最后将它们转变为简单的门道。这使 AI 更快(在他们的测试中快达 18%),且几乎不会损失智能。
- 最后一个检查员很特殊:最后的检查至关重要,因为它阻止 AI 变得“过度自信”和不稳定。如果你移除了它,你必须添加一根“绳索”(一个特定的数学规则)来约束 AI 的自信。
简而言之:你可以剔除中间环节以加快 AI 的运行速度,但你必须小心最后一步,否则 AI 可能会因自身的自信而失控。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。