A Hyperbolicity Atlas of Large Language Model Hidden States
本文提出了首个系统性研究,证明了大语言模型(LLM)隐藏状态中的格罗莫夫双曲性(Gromov hyperbolicity)主要由层深驱动——在中间层达到峰值并在最终层呈现出更具树状结构的特征——而非由模型规模驱动,从而为理解不同模型家族和输入域中的层次距离结构提供了一种实用的诊断方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在驱动现代人工智能的计算机内部,存在着一个隐藏的数字世界。当这些机器阅读一个句子或处理一个问题时,它们并不以文本形式存储单词。相反,它们将每个单词转化为一组长长的数字列表,即向量,这些向量存在于一个巨大的多维空间中。多年来,科学家们一直知道这些机器所处理的事物——例如家族树的结构、代码程序的步骤或故事的逻辑——通常是具有层级性的。它们有顶端、底端以及中间的许多分支。一个自然而然的问题随之而来:机器用来理解这些事物的内部数字列表是否也呈现出一种类似树状的结构?如果机器的内部地图看起来像一棵树,这可能意味着计算机正在以一种镜像人类语言和逻辑复杂结构的方式来组织信息。为了回答这个问题,研究人员转向了一个被称为“双曲性”(hyperbolicity)的数学概念,它就像一把尺子,用于衡量一组点在多大程度上是“类树状”的。得分较低意味着这些点的排列呈现出整齐的分支层级结构,而得分较高则意味着它们以一种更为混乱、扁平的方式散布。
来自北京和广州的研究小组致力于绘制当前最先进语言模型中的这种隐藏几何结构。他们并没有制造一台新机器或改变现有机器的工作方式。相反,他们扮演了制图师的角色,选取了十个不同的开源模型,并让它们执行四类截然不同的任务:解决数学问题、编写计算机代码、回答常识性问题以及判断陈述的真实性。对于输入提示词中的每一个单词,他们都测量了机器所创建的数字列表之间的距离。他们进行了超过80万次特定的测量,涵盖了十个不同规模的模型以及每台机器内部的每一个处理层。他们的目标是制作一部名为“图谱”的详细地图,精确展示这些机器的内部结构在何处呈现出树状,又在何处并非如此。
最令人震惊的发现是,机器的大小远没有其内部观察位置那么重要。许多人认为,拥有更多参数的大型模型会自动变得更“聪明”或更具结构化。研究人员发现这在很大程度上是不成立的。仅仅通过增大模型规模,并不能一致地使其内部结构变得更具树状特征。在某些情况下,较大的模型实际上比较小的模型更缺乏组织性,而在另一些情况下,它则更有组织。真正的模式出现在观察机器处理深度时。随着信息从网络的第一个层向中间层移动,结构变得混乱且扁平,失去了其树状形状。中间层的数字拥挤且复杂,反映了多种不同类型信息的混合。然而,当数据到达最后几层,即机器产生答案之前,结构发生了剧烈的变化。数字重新凝聚成一种清晰得多的、更具树状特征的排列。这表明,机器从一种混沌的可能性混合状态开始,然后在最后阶段将其压缩成一种结构化的形式。
研究人员还发现,特定类型的模型及其训练任务会显著改变这张地图。两个规模完全相同的模型,根据其训练方式的不同,可能会拥有完全不同的内部几何结构。例如,一个专门从事编写代码的模型在处理编程任务时表现出非常强的树状结构,但一个经过通用数学训练的模型在被要求解决数学问题时并未表现出同样的模式。事实上,专门的代码模型使代码提示词的结构看起来比通用模型更像一棵树,而数学专业模型则保持了其结构的复杂性。这意味着,机器思维的“形状”并不是其规模的一个固定属性,而是其训练方式以及当前正在执行的任务所共同作用下的灵活结果。
最终,这项研究为我们理解人工智能如何组织信息提供了一种新方法。它表明,这些模型的内部世界并非一个静态、统一的景观。相反,它是一个动态的过程:信息从一个复杂、扁平的状态开始,穿行于拥挤的中段,最后在最后时刻收敛为一种结构化的树状形式。研究人员得出结论,仅观察最终答案或模型的总规模不足以理解其内在机制。要真正洞察这些机器是如何思考的,必须观察信息所经历的路径,并注意到最重要的结构性变化发生在做出决策前的最后时刻。这张地图提供了一个实用的工具,让科学家能够观察到这些模型是在何处组织其思想,又在何处仍在挣扎,揭示了智能的几何学远比简单的规模度量所能展示的要微妙得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。