← 最新论文
🤖 machine learning

Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders

该论文介绍了 KronSAE,这是一种将潜空间分解为多个头,并采用可微的类与(AND-like)交互机制来强化组合共激活性的稀疏自编码器架构,从而在不牺牲性能的前提下,提高了可解释性、捕捉了特征相关性并降低了计算成本。

原作者: Vadim Kurochkin, Yaroslav Aksenov, Daniil Laptev, Daniil Gavrilov, Nikita Balagansky

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Vadim Kurochkin, Yaroslav Aksenov, Daniil Laptev, Daniil Gavrilov, Nikita Balagansky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大型语言模型是庞大且复杂的系统,它们通过将文本转化为数字流来处理人类语言。这些被称为“激活值”的数字在模型的内部层中流动,承载着词语的含义和句子的逻辑。对于试图理解这些机器如何思考的研究人员来说,这些隐藏的流向是一个黑盒。为了打开它,科学家们使用了一种叫做“稀疏自编码器”(sparse autoencoder)的工具。可以将这个工具想象成一个翻译器,它将密集、混乱的数字流分解成一份长长的、简单的、清晰的概念列表。理想情况下,这份列表中的每一项都代表一个单一且明确的概念——比如“数学”、“法律合同”或“蓝色”——当模型遇到特定概念时,该概念会被激活。这个过程被称为“分解”,它让研究人员能够看到机器内部运作的每一个齿轮。

然而,标准的翻译器存在局限性。它们将每个概念视为列表中一个独立的、扁平的项目,忽略了人类语言具有深层结构的这一事实。词语和概念经常以可预测的模式共同出现;例如,“地理”的概念经常与“地图”或“方向”共同出现。当模型学习这些模式时,标准工具难以捕捉这种关系,往往被迫让系统隐式地学习这种联系,或者更糟的是,将不同的概念合并成一个单一且令人困惑的特征。这使得生成的概念列表更难解释,且计算效率更低。

T-Tech 的一个研究团队提出了一种构建这些翻译器的新方法,称为 KronSAE,它从一开始就尊重语言的自然结构。该设计不再将每个概念视为一个独立的、扁平的坐标,而是将内部字典组织成组。在每个组内,系统通过结合两个较简单的、预先存在的组件来构建复杂的特征。这有点像厨师通过将一种基础食材与一种特定的香料相结合来创造一道特定的菜肴;只有当基础食材和香料同时存在时,这道菜才会存在。在这种新架构中,一个特征仅在两个底层的“父级”信号同时激活时才会激活。这创建了一个内置规则,鼓励系统学习那些由更简单部分组合而成的特征,从而镜像了语言的实际运作方式。

研究人员在两个流行的语言模型 Qwen2.5 和 Gemma-2 上测试了这种方法,使用的是一个包含大量教育网页的数据集。他们发现,这种结构化方法不仅模仿了人类语言,实际上还使模型的内部表示更加清晰。在将新系统与标准方法进行比较时,他们发现新设计产生的特征更加具体,且不太容易相互混淆。在标准方法中,单个特征往往试图承担过多功能,吸收了多个相关概念的含义,从而变得模糊。新系统通过强制特征由特定的组合构建,减少了这种“吸收”现象。由此产生的特征更加锐利,描述的是更窄、更精确的概念,这使得它们更容易被研究人员理解和标注。

除了清晰度之外,新设计还提供了显著的效率提升。由于系统通过结合较简单的特征来构建复杂的特征,因此它不需要从头开始计算每一个可能性。研究人员发现,在保持重建原始数据准确性水平相同的情况下,他们可以将运行编码器所需的计算量减少百分之四十以上。这意味着该系统可以使用更少的资源学习相同数量的信息。在他们的实验中,即使存在如此大规模的计算成本缩减,性能的下降也低于百分之一,对于如此巨大的速度和效率提升而言,这是一个微不足道的权衡。

该研究还探讨了该系统学习概念之间隐藏关系的能力。在一次使用已知特征间关系的合成数据进行的受控实验中,新系统比标准方法更成功地恢复了这些模式。它学会了在其内部结构中将相关的概念分组,而标准方法则将它们分散。在观察现实世界数据时,研究人员观察到,在文本中自然出现的特征确实被映射到了新系统中的同一个内部组内。这表明该架构成功捕捉了语言的统计规律,以反映思想如何连接的方式组织了模型的知识。

研究人员还检查了特征本身的性质。他们发现,系统中的简单“父级”组件通常是广泛且抽象的,能够代表多种不同的想法。然而,当这些父级组件结合在一起时,生成的特征就变得高度具体。例如,一个与“方向”相关的宽泛组件可能会与另一个与“医学术语”相关的组件结合,从而创建一个专门关于“医疗指令”的特征。这种层次化结构允许系统利用其基本组件来构建大量的特定概念,而无需为每一个单独的想法都需要一个独特的、独立的神经元。这种组合式方法不仅使特征更具可解释性,还为存储和检索知识提供了一种更高效的方式。

最终,这项工作表明,我们设计这些解释性工具的方式与它们处理的数据同样重要。通过引入一种模仿语言组合方式的简单结构偏置,研究人员创造了一个既高效又透明的系统。研究结果表明,我们不需要依赖模型在训练过程中偶然发现这些关系;我们可以将它们构建到架构本身之中。这种方法为理解人工智能提供了一条新路径,在为机器思维提供更清晰窗口的同时,也让系统运行得更快、更便宜。这种新方法的代码现已开放供他人使用和构建,邀请大家进一步探索结构化学习如何改进我们对复杂系统的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →