Does the LM Head Create a Harmful Gradient Bottleneck? A Causal Test
本文通过证明虽然几何压缩反向梯度会显著增加验证损失,但其影响远不如因子分解的前向头部那样严重,从而挑战了语言模型头部会产生有害优化瓶颈这一假设,这表明语言模型的头部投影并非导致训练效率低下的主要原因。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大语言模型是驱动从翻译工具到创意写作助手等一切应用的核心引擎。从本质上讲,这些系统通过基于之前的词语来预测句子中下一个词语来进行工作。为了实现这一点,模型维持着一个隐藏的内部状态——这是对它目前处理过的上下文的一个紧凑总结。随后,这个总结会被传递给一个通常被称为“头”(head)的最终层,它充当了一个翻译器的角色。它将那个紧凑的总结展开成一个庞大的可能性列表,为词汇表中的每一个词分配一个分数,以决定哪一个是最有可能出现的。
多年来,研究人员一直在思考这种翻译步骤是否造成了一个隐藏的交通堵塞。因为模型的内部总结相对较小,而可能的词汇量却极其庞大,数学理论表明,信息在学习过程中向后流动的路径被严重挤压了。想象一下尝试将一加仑水倒入一根细小的吸管;大部分水根本无法通过。一些科学家认为,这种挤压破坏了宝贵的学习信息,阻碍了模型以其应有的速度进行改进。他们认为,绝大部分的“误差”信号——即关于模型出错之处的线索——在能够到达网络深层进行修正之前就已经丢失了。如果这一观点成立,这意味着这些强大模型的架构本身就存在根本性的缺陷,限制了它们发挥全部潜力。
一位研究人员开展了一项严谨且受控的实验,旨在测试这一说法。他没有仅仅观察模型如何学习,而是构建了一个可以手术式改变信息流的设置。他想知道那些“丢失”的信息究竟是真正无用的,还是以一种损害模型学习能力的方式被丢弃了。为了寻找答案,他训练了两类模型:一个使用单个字节文本的小型模型,以及一个使用常见词片段的稍大型模型。在这些实验中,他创造了一种场景:模型照常计算出正确答案,但在返回的过程中,他人工阻断了某些学习信号的方向。他将这种情况与另一种场景进行了对比:在另一种场景中,他阻断了相同数量的信息,但阻断的是系统的前端,即改变了模型生成预测的方式。
结果清晰且令人惊讶。当研究人员阻断后向路径时,模型的学习效率确实有所下降,但损害相对较小。然而,当他们阻断前向路径(即改变模型实际输出的方式)时,学习受到的影响要严重得多。在较大的模型中,将后向信号减半导致误差率出现了小幅但可衡量的上升,而将前向信号减半则导致误差几乎增加了三倍。这表明,这种瓶颈并没有预想中那样具有毁灭性。那些没有流回内部状态的信息并非被丢弃了,而是被用于更新翻译层本身。通过调整翻译器,模型有效地重塑了未来学习的路径,确保信息最终能以有用的形式流回。
该研究还考察了一个曾用于证明瓶颈理论的特定合成任务。在该任务中,模型被要求不断重复预测同一个符号。原先的研究者认为,模型之所以失败是因为梯度瓶颈阻止了它学习模式。而这位新研究者发现了一个更简单的解释:失败是由于数据缺乏多样性造成的。因为该任务反复重复同一个符号,模型没有看到足够多的独立示例来学习规则,无论梯度流如何。当研究人员控制了唯一示例的数量时,即使在所谓的瓶颈存在的情况下,模型也完美地完成了任务。
此外,研究人员试图通过构建新的、独立的路径,将“丢失”的信息直接发送到模型的深层,来修复这个所谓的难题。他尝试了各种方法,包括固定的随机连接和试图追踪最重要信号的自适应路由。然而,这些复杂的定制化修复方案效果都不如标准的反向传播法。事实上,仅仅调整标准方法的学习率,往往比使用这些复杂的路径能产生更好的结果。这表明,这些模型学习的标准方式已经非常高效地处理了该问题的几何结构。
最终,这项研究证实了这种数学投影确实存在:模型的内部状态确实比其词汇量小得多,且后向信号也被压缩了。然而,研究结论指出,这种压缩并不是一个会限制模型性能的有害瓶颈。那些看似丢失的信息实际上正被用于精炼模型自身的翻译层,从而改善未来的学习。认为这一架构特征是阻碍人工智能达到其潜力的根本缺陷的观点,并未得到证据的支持。模型并非陷入困境,它们只是以一种与最初理论预测不同的方式进行学习,并且做得非常有效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。