Decomposing Representation Space into Interpretable Subspaces with Unsupervised Learning
本文介绍了一种名为邻域距离最小化(NDM)的无监督方法,该方法成功将神经模型的表示空间分解为可解释的、非基对齐的子空间,这些子空间分别对应不同的抽象概念和电路变量,这一成果已通过针对 GPT-2 和 20 亿参数规模模型的定性分析与定量实验得到证实。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个神经网络(如同人工智能的大脑)是一个巨大的高维房间,里面充满了无形的“思想”。当人工智能处理一个句子时,它并非只存储一个想法,而是同时存储成千上万个不同的细节:当前的词、该词的位置、对话的主题以及语法规则。
问题在于,所有这些思想都混杂在一个巨大而凌乱的堆中。如果你想了解人工智能如何工作,这就像试图在一团所有颜色都混在一起的毛线球里找到一根特定的线。
核心思想:理清毛线
本文介绍了一种名为**邻居距离最小化(NDM)**的新方法。将人工智能的“思想房间”想象成一个拥挤的舞池,每个人都在混乱地混合跳舞。研究人员希望找到一种方法,在不被告知要看什么的情况下,根据舞者实际在做什么,将他们分离成不同的群体。
他们发现,如果你将房间组织成让做相似事情的舞者彼此靠近,而让做不同事情的舞者彼此远离,就会自然地创造出独立的“区域”或子空间。
工作原理(类比)
想象你有一盒混合在一起的乐高积木:红色的、蓝色的和绿色的。
- 旧方法:研究人员通常必须猜测哪些积木应该归为一类,或者先请人类来分类(监督学习)。
- 新方法(NDM):研究人员只是对积木盒说:“让相似的积木彼此靠近,把不同的积木推远。”
令人惊讶的是,积木盒自动完成了分类!红色积木自然地聚拢在一起,蓝色积木形成了自己的群体,绿色积木也是如此。研究人员不需要知道“红色”或“蓝色”意味着什么;“与邻居保持靠近”的数学原理替他们完成了分类。
他们的发现
一旦他们将房间划分成这些清晰的区域,他们向内观察并发现了令人惊叹的事情:
- 专用区域:每个区域似乎都处理特定类型的信息。一个区域完全致力于“当前词”,另一个致力于“我们在句子中的位置”,还有一个致力于“故事的主题”。
- 变量:这些区域就像计算机程序中的变量。正如名为
x的变量存储一个数字一样,这些区域存储特定的概念。如果人工智能在谈论“爱丽丝”,“名称区域”就存储“爱丽丝”。如果它切换到“鲍勃”,同一个区域会更新为“鲍勃”,而“主题区域”则保持不变。 - 适用于大型模型:他们首先在小型玩具模型上测试了这种方法,然后在真实的人工智能模型(如 GPT-2 和 20 亿参数模型)上进行了测试。它在所有地方都有效。在更大的模型中,他们甚至发现了独立的区域,分别处理“模型从训练中知道的内容”与“模型在提示中正在阅读的内容”。
为什么这很重要
在此之前,试图理解人工智能就像试图阅读一本所有字母都被打乱的书。这种方法提供了一种将字母重新排列成单词和句子的途径。
研究人员将这些新区域称为子空间电路。我们不再需要观察单个神经元(它们就像模糊图像中的单个像素),而是可以观察这些完整的区域(就像清晰、独立的单词)。这使我们能够追踪人工智能如何将其大脑的一部分信息移动到另一部分,从而为我们提供一幅更清晰的地图,揭示这些智能机器实际上是如何思考的。
简而言之:
这篇论文表明,你可以通过要求人工智能将相似的思想保持在一起,教会它将自身杂乱的思想整理成整齐、独立的文件夹。这揭示了人工智能自然地构建了一个结构化的、可理解的“变量”系统来处理信息,即使没有人告诉它该如何去做。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。