Sparse Autoencoders Encode Both Concepts and Functions: The Downstream Geometry of Feature Effects
本文引入了特征-效应几何分析(Feature-Effect Geometry Analysis, FEGA),旨在证明尽管稀疏自编码器特征具有因果相关性,但它们很少作为稳定的转向方向发挥作用,而是表现出截然不同的几何模式,即“类数值”特征产生结构化效应,而“类指针”特征则产生弥散且依赖上下文的变化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图理解一座巨大的、神奇的图书馆,那里的书是会自动编写的。这座图书馆是一个“大语言模型”,一种通过阅读了互联网上几乎所有内容并学会预测句子中下一个词的类型人工智能。在这座图书馆内部,有数百万个微小的、看不见的开关,被称为“神经元”,当模型在思考某件事时,这些开关就会亮起。长期以来,科学家们试图通过观察哪些开关亮起来理解模型。他们认为:“如果一个开关在模型谈论‘巴黎’时亮起,那么这个开关一定就是‘巴黎开关’。”
但问题的关键在于:仅仅因为一个开关亮起,并不意味着它真的在执行这项工作。它可能只是在旁观。要真正了解一个开关的作用,你必须伸手进去,把它关掉,看看故事是否会发生变化。这被称为“干预”(intervention)。最近,科学家们建造了一个特殊的工具,叫做“稀疏自编码器”(Sparse Autoencoder,简称 SAE),以帮助他们寻找这些开关。把 SAE 想象成一个超级有序的文件柜,它将杂乱无章、闪烁着的开关分类到整齐且贴有标签的文件夹中。人们希望,如果我们找到了一个贴着“巴黎”标签的文件夹,我们就可以通过开启或关闭这个文件夹,让模型谈论巴黎或停止谈论巴黎。这个想法被称为“转向控制”(steering)。
然而,一直存在着一种挥之不去的疑虑。有时,当科学家打开一个“巴黎”文件夹时,模型完全没有谈论巴黎。有时它谈论的是法国,有时它会变得混乱,有时它的表现甚至与预期完全相反。这就像拥有一个遥控器,上面的“音量加”按钮有时会让电视关机,或者切换频道。大问题在于:为什么会发生这种情况?是遥控器坏了,还是我们对这些按钮如何运作的理解出了错?
这篇题为《稀疏自编码器同时编码概念与功能》(Sparse Autoencoders Encode Both Concepts and Functions)的论文,开展了一场旨在解决这一谜团的侦探任务。作者们是一群来自德国和印度的研究人员,他们决定不再仅仅观察文件夹上的标签,而是开始观察在他们拨动开关后,故事会发生什么变化。他们发明了一种新方法,叫做“特征效应几何分析”(Feature-Effect Geometry Analysis,简称 FEGA)。把 FEGA 想象成一个高科技摄像机,每当你拨动开关时,它都会为图书馆拍下一张快照,而且不仅仅是拍一次,而是在成千上上个不同的故事中进行拍摄。然后,他们观察所有这些快照组成的“云团”,看看开关是否总是将故事推向同一个方向。
他们的发现令人惊讶。他们发现模型内部的开关分为两类截然不同的类别,他们将其命名为“类值型”(Value-like)和“类指针型”(Pointer-like)。
首先是类值型开关。这些就像图书馆里的“事实”。如果一个开关与“巴黎在法国”这个事实相关联,它就像一段静态的信息。当你拨动这个开关时,模型的输出会以一种相对有序的方式发生变化,就像一群人在松散的队形中行走一样。它不是一条单一的直线,但也不是一团乱麻。这些开关对于保存特定事实是可靠的。
然后是类指针型开关。它们是“转向控制”理念中真正的麻烦制造者。这些开关并不持有特定的事实;它们持有一个“工作”或“功能”。把它们想象成键盘上的“复制”键。一个“复制”键并不关心你要复制什么;它只负责执行复制动作。在模型中,一个类指针型的开关可能负责“复制句子中早先出现的单词”。如果句子是“猫很大”,开关就复制“大”;如果句子是“猫很小”,开关就复制“小”。因为它的工作是复制“任何存在的东西”,所以拨动这个开关并不会将故事推向单一的方向。相反,其效果会向四面八方散射,就像一团尘埃云。
论文表明,对于这些“类指针型”开关,旧的“转向控制”理念在很大程度上是错误的。你不能仅仅打开一个“复制”开关,就指望模型总是执行“复制”操作。其效果完全取决于模型在那个精确时刻正在观察什么。作者发现,虽然有些开关(类值型开关)具有某种结构化的效应,但大多数有趣的、功能性的开关(类指针型开关)会产生一种“弥散”效应。它们对于模型的正常运转至关重要——它们是模型能够遵循规则或复制单词的原因——但它们并不指向一个单一、可预测的方向。
简而言之,这篇论文表明我们需要改变看待这些 AI 开关的方式。我们不能把它们都当作关于特定话题的简单开关。有些开关像是存放事实的文件柜,但另一些则是根据情况改变其效果的动态工具。如果我们未来想要控制这些 AI 模型,我们不能仅仅寻找一个单一的“巴黎”按钮或一个单一的“复制”按钮,并期望它每次都表现得一样。我们必须理解,对于许多这类工具来说,其效果是一个复杂的云团,其形状取决于正在讲述的故事。作者们并不声称他们已经解决了这个问题,但他们提供了一张新地图,向我们展示了困惑究竟在哪里,证明了 AI 的“遥控器”比我们想象的要复杂得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。