Toward a First-Principles Update Geometry for the Language-Model Head
本文通过将 softmax 和权重矩阵视为希尔伯特投影距离下的单一模块,为语言模型头提出了一种基于第一性原理的更新几何结构,从而导向一种在约束其欧几里得直径的同时最大化最小标记行间距的优化策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的广阔版图中,最显眼的成就往往来自于那些能够生成类人文本的系统。在这些对话背后,是一个复杂的机器学习模型,一个由海量数据训练而成的数字大脑。在这个机器处理链的最末端,坐落着一个被称为“语言模型头”(language-model head)的特定组件。它的工作看似简单:它接收一个隐藏的内部状态——即计算机正在思考内容的数学表示——并将其转化为词表里每一个单词的概率列表。如果模型试图完成句子“天空是”,该组件就会计算下一个词是“蓝色”、“多云”或“落下”的可能性,并为每种可能性分配一个分数。多年来,工程师们一直将驱动这一最终转换的数学过程视为一个标准问题,应用同样的通用规则来调整网络早期层的权重。
然而,一个新的视角表明,这最后一步与机器的其他部分有着本质的不同。因为输出是一个概率分布——一组必须相加等于百分之百的百分比——所以改变它的规则应当尊重概率的独特几何特性,而不仅仅是改变原始数字的规则。哥伦比亚大学的阿迪蒂亚·索马桑德拉姆(Aditya Somasundaram)最近的一篇论文通过将最后一层和概率转换视为一个统一的模块,探讨了这一观点。作者认为,要理解如何改进系统的这一部分,我们必须观察更新是如何改变单词之间的相对胜率,而不仅仅是观察数字本身的变化了多少。通过使用一种衡量这些相对胜率变化的特定数学距离,该研究推导出了衡量更新大小的一种新方法。其结果是一个全新的几何图景,其中变化的“大小”由不同单词的内部表示的离散程度决定,从而提出了一种新型优化器,可以使这些模型学习得更加高效。
这项调查的核心始于一个关于如何衡量变化的问题。当计算机通过从错误中学习来更新其内部设置时,它会对一个巨大的数字表进行微小的调整。在标准的训练方法中,工程师通常通过观察在转换为概率之前,该调整可能对原始数字造成的最大变化量来衡量其幅度。但作者指出,对于最后一层而言,原始数字并不是最终产物;概率才是。被称为 softmax 的转换过程具有一个特殊属性:如果你在列表中的每个数字上都加上相同的值,最终的概率完全不会改变。这意味着,测量原始更新的大小是有误导性的,因为它统计了那些对最终输出没有影响的变化。为了解决这个问题,论文转向了希尔伯特射影距离(Hilbert's projective distance)的概念。这是一种衡量两组概率之间距离的方法,它完全关注任意两个单词之间的比例如何变化。它忽略了数字的绝对大小,只关注一个词相对于另一个词的相对地位。
通过应用这种特定的距离度量,研究人员发现了一个令人惊讶且简洁的关系,即更新的几何结构与模型的行为之间的关系。研究表明,一个更新在概率分布中引起的最大变化,直接取决于更新矩阵中行向量的物理分布。想象一下这个更新是一个向量集合,其中每个向量对应词表中的一个特定单词。在 terms of 如何摇动概率的角度来看,更新的“大小”是由距离最远的两个向量之间的距离决定的。如果不同单词的向量紧密聚集在一起,那么更新就是微小且安全的;如果它们分布得很开,那么更新就是巨大的,可能会导致模型预测出现剧烈波动。这一发现重新定义了更新语言模型头的问题:目标不再是担心数字的整体量级,而是管理代表单词的“点云”的直径。
这一几何洞察引出了关于如何构建这些更新的新提议,其灵感来自近期在神经网络其他部分取得成功的 Muon 方法。Muon 通过平衡更新的不同方向,使它们的力量保持一致,从而防止模型陷入学习景观中的狭窄谷底。作者建议,类似的原则也应适用于语言模型头,但带有一个转折。与其平衡单一方向的力量,目标应该是让所有单词对之间的距离尽可能相等。理想的更新会使向量展开,使得每个单词与其他任何单词的距离都大致相等,从而创建一个完美平衡的云团。这将确保模型在对待任何一对单词的区别时,都具有同等的敏感度。
然而,论文也指出了实现这一理想状态的一个硬性物理极限。在语言模型头中,词表中的单词数量远远大于用于表示它们的维度数量。要在如此小的空间内排列大量的点,使它们彼此之间的距离都完全相等,在数学上是不可能的。就像你无法在平坦的纸面上放置一百个点使其彼此等距一样,当词表巨大且隐藏空间很小时,你也无法让单词向量实现完美的等距。研究承认了这一约束,并建议目标应该是寻找最佳近似。所提出的优化器将尝试在保持最大距离处于安全限制内的同时,最大化任意两个单词之间的最小距离。这种方法旨在创造一个尽可能均匀分布的更新,确保没有任何一对单词被忽视或被视为不可区分,同时也不会将其他单词推得太远。
这项工作的意义主要在于理论和架构层面,它为看待语言生成的最后一步提供了一个新的视角。作者并未声称已经构建了一个证明该方法在实践中更有效的完整训练模型,而是提供了一个严谨的推导,阐明如果遵循概率的第一原理,更新的几何结构应当呈现为何种形态。论文认为,目前的各种方法往往将这一层留给标准的优化技术,这忽略了对该模块特定功能的尊重。通过将概率转换视为更新过程的一个组成部分,并使用一种尊重 softmax 函数不变性的距离度量,所提出的几何结构为导航学习景观提供了一种更自然的方式。研究结论指出,尽管对于庞大的词表来说,完美的等距排列是不可能的,但追求近似等距配置的过程,为设计专门针对语言模型头独特需求的未来优化器提供了清晰且有原则的方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。