A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
本文提出将张量积表示(Tensor Product Representations, TPRs)作为一种统一的框架,从数学和实证层面证明了诸如线性探测和稀疏自编码器等多样化的语言模型可解释性方法,是如何从单一的填充物-角色绑定(filler-role bindings)底层结构中推导出来的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能那静谧且嗡嗡作响的世界里,研究人员正试图理解那些被称为语言模型的庞大计算机程序究竟是如何“思考”的。这些系统能够写诗、解数学题并进行对话,但在它们的数字大脑内部,信息是以长串数字列表的形式存储的。多年来,科学家们一直使用各种工具来窥探这些“黑盒”,发现这些模型似乎以一种令人惊讶的有序方式组织信息。有些工具显示,模型可以通过对这些数字列表进行加减运算来解决谜题;而另一些工具则揭示了当模型遇到特定单词或概念时,其特定部分会“亮起”。然而,这些发现一直处于孤立状态,就像是在黑暗房屋的不同房间里发现的零散线索。一个重大的问题一直是:是否存在一个统一的基础结构来解释所有这些不同的行为,还是说这些模型仅仅是一堆毫无关联的技巧组成的混乱集合?
耶鲁大学的一个研究小组为这个谜题提出了一个统一的答案。他们认为,这些复杂的语言模型是基于一种特定的架构原则构建的,即“张量积表示”(Tensor Product Representations)。用通俗的话来说,这意味着模型通过将两样东西紧密绑定在一起来存储信息:想法的内容(如特定的单词)及其在句子中的角色(如它是主语还是宾语)。想象一个文件系统,其中每一条信息不仅根据它是什么来存储,还根据它在结构中确切所属的位置来存储。研究人员发现,这种简单且结构化的数据组织方式可以解释许多此前互不相关的发现。它解释了为什么模型可以进行数学类比,为什么简单的测试可以揭示隐藏的概念,以及为什么改变模型内部状态的一个部分会以可预测的方式改变其行为。
为了测试这一想法,该团队不仅依赖理论,还构建了一种新型工具来充当“翻译官”。他们创建了一个系统,该系统可以将句子的已知结构(识别主语、谓语和宾语)转换为模型所使用的特定数字模式。随后,他们将这种转换后的版本与几种不同计算机模型的实际内部运作情况进行了对比,这些模型涵盖了从小型简单网络到大规模尖端语言系统的各种类型。结果具有惊人的连贯性。在涉及数字序列和结构化英语句子的测试中,研究人员的结构化翻译与模型的内部状态高度精准地匹配。对于较简单的模型,这种匹配近乎完美,捕捉到了模型处理信息时的几乎所有变化。即使对于规模最大、最复杂的语言模型,这种翻译也捕捉到了绝大部分信息,这表明这些庞大的系统尽管规模巨大,却依然依赖于这种将内容与位置绑定的基本方法。
这一发现的力量在于它如何连接不同的研究方法。研究人员展示了他们结构化翻译背后的数学逻辑,可以被用来重构当今科学家使用的四种主要可解释性技术。首先,他们解释了为什么语言模型可以执行“加法类比”,即通过从一个概念中减去另一个概念并加上第三个概念,从而得到第四个相关概念的现象。他们的工作证明,这是因为模型本质上是在计算特定“内容-角色”配对之间的差异。其次,他们展示了“线性探测”(linear probes,一种用于检测模型是否掌握某项事实的简单测试)实际上是一种将角色从内容中“解绑”以检索原始想法的方法。第三,他们解释了“稀疏自编码器”(sparse autoencoders,旨在将复杂信号分解为简单部分的工具)实际上是在识别这些相同的“内容-角色”绑定。最后,他们证明了“激活补丁”(activation patching,一种通过交换模型大脑的部分来观察其行为变化的技术)之所以有效,是因为研究人员直接交换了这些特定的结构化绑定。
在一系列实验中,该团队证明了他们可以从头开始构建这四种不同的测试工具,而无需预先在模型上进行训练。当他们使用这些构建出的工具来分析模型时,其表现与该领域常用的经过大量训练的标准工具不相上下。例如,当他们利用其方法来预测句子中下一个出现的单词或识别句子的主语时,准确率与现有最佳方法几乎一致。在针对一个大型语言模型的特定测试中,他们的结构化预测与标准方法之间的差异微乎其微,相关性得分接近于一。这表明,这些复杂且习得的行为并非神秘或偶然,而是这一底层结构规则的直接结果。
研究人员还探讨了当模型面临新情况时,这种结构性的稳健程度如何。他们在一个句子集上训练其结构化翻译器,然后将其应用于包含从未见过的单词和角色的句子。该翻译器成功实现了泛化,能够准确重建模型在处理这些新颖组合时的内部状态。这表明模型并非仅仅在死记硬背特定的例子,而是在使用一个灵活的系统来将新内容与已知角色相结合。这项研究并未声称解决了人工智能的所有奥秘,也没有暗示所有的模型都是完全相同的。然而,它提供了强有力的证据,证明一个连贯的框架可以解释这些系统是如何表征世界的。通过展示多样化的可解释性方法最终都指向同一个结构性现实,这项工作推动该领域向着理解神经网络功能的统一理解迈进,将一系列孤立的观察结果转化为一幅关于机器思维的连贯图景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。