The Changing Geometry of Grammar: Dimensionality and Neighborhood Reorganization across Transformer Layers
本文研究了标记(tokens)的语法角色如何塑造 Transformer 表征的局部几何结构,揭示了由于邻域重组,闭类词与开类词的本征维度在不同层中呈现出不同的演化方式,且在编码器与解码器架构之间观察到了截然不同的模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代语言模型的数字大脑内部,词语并非静止不动。当计算机阅读一个句子时,它会将每个词转化为一长串数字,即在拥有数百个维度的广袤且无形的空间中漂浮的一个点。这些点并非随机散布;它们聚集在一起,在那个高维的虚空中形成薄而弯曲的片层。科学家称这些片层为“流形”(manifolds),而片层的厚度则讲述了一个关于该词承载了多少信息的故事。如果一个词可以在许多方向上自由变化,那么其片层就是厚实且复杂的;如果一个词受到邻近词语的严格约束,其片层就会变得薄而简单。这种信息的压缩是这些模型理解世界的一种基本方式,但直到现在,研究人员仍难以观察到一个词在句子中所承担的具体职责——无论是像“猫”(cat)这样沉重的名词,还是像“the”这样轻盈的连接词——是如何塑造这种几何结构的。
一组研究人员着手绘制这一隐藏的景观,试图探究词语的语法角色是否决定了它在神经网络各层中所经过的路径。他们专注于区分“开类词”(open-class words,即携带丰富含义的名词和动词)与“闭类词”(closed-class words,即承担结构性功能的介词和代词)。通过将数千个句子输入四种不同类型的语言模型,他们追踪了数据形状随层级变化的轨迹。他们发现,这两类词语并不走相同的路线。闭类词在处理过程的早期会扩张进入一个更宽、更复杂的空间,随后比那些内容丰富的词语更早地坍缩回一个紧凑、简单的形状。这表明,模型首先拉伸这些结构性词语,以确定它们如何与其他部分建立联系,一旦建立了这种联系,模型就会将它们折叠回去,从而提取出所有必要的关联信息。
研究人员发现,这种几何折叠并非随机的波动,而是对每个词周围邻域的精确重组。随着词语向网络深处移动,它在数学空间中的近邻也会发生变化。对于结构性词语而言,这种变化发生得迅速且果断。像“the”这样的词,在旅程开始时可能被其他限定词所环绕,但随着网络处理句子的进行,它会脱离那个群体,并向它所修饰的具体名词靠近。这种邻居的变化恰好对应了该词的内部表示变得更简单、更压缩的时刻。相比之下,像“大象”(elephant)或“跑”(run)这样的内容词在更长时间内保持着更复杂、更开放的几何形态,这反映了它们持续需要将特定含义与句子不断演变的语境相结合的需求。
这项研究还揭示了模型的架构具有深远的影响。那些能够同时从两个方向阅读句子的模型(如编码器)会较早地解决这些结构性连接,导致几何变化发生在中间层。而那些严格从左向右阅读的模型(如解码器)则走另一条路径,其几何转变发生得较晚,随着语境的累积而推进。尽管存在这些架构上的差异,核心发现依然成立:词语在网络中经过的路径是其语法功能的直接体现。研究人员通过证明计算机仅凭观察数据点的形状——其厚度以及邻居如何移动——就能在完全不看到词语本身的情况下,正确推测出一个词是功能词还是内容词,甚至能识别出其具体的词性。
这项工作表明,句子的语法不仅仅是模型遵循的一套规则,更是其数学结构中的一种物理现实。模型不仅是存储一个词的含义,它还在物理上重塑该词周围的空间,以解决该词如何融入句子的谜题。当一个结构性词语找到它在句子中的搭档时,模型就会坍缩掉它原本用于探索的额外维度,留下一个紧凑且高效的表示。这仿佛模型搭建了一个临时的脚手架来支撑句子,一旦结构稳固,它便拆除脚手架,只留下意义的核心形状。这种扩张与收缩的几何之舞,为我们理解人工智能如何平衡“承载意义的词”与“维系整体的词”之间微妙关系,提供了一个全新的窗口。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。