← 最新论文
🤖 machine learning

Do Sparse Autoencoders Capture Concept Manifolds?

本文建立了一个理论框架,证明稀疏自编码器能够全局或局部地捕捉概念流形,但往往因一种导致这些结构碎片化的“稀释”机制而无法有效实现,从而促使可解释性研究从孤立的方向转向连贯的特征群组。

原作者: Usha Bhalla, Thomas Fel, Can Rager, Sheridan Feucht, Tal Haklay, Daniel Wurgaft, Siddharth Boppana, Matthew Kowal, Vasudev Shyam, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Usha Bhalla, Thomas Fel, Can Rager, Sheridan Feucht, Tal Haklay, Daniel Wurgaft, Siddharth Boppana, Matthew Kowal, Vasudev Shyam, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图理解一台巨大而复杂的机器(例如大型语言模型)是如何“思考”的。长期以来,科学家们认为机器的“思想”就像一组独立、离散的开关。如果你想谈论“年龄”,只需拨动“年龄开关”;如果你想谈论“温度”,就拨动“温度开关”。这一观点被称为线性表示假设

然而,这篇新论文指出,机器的思想并非由孤立的开关构成,而更像是平滑的弯曲道路流形

以下是该论文发现的简要概述,辅以简单的类比:

1. 问题:道路与开关

以“温度”这一概念为例。在旧观点中,计算机的“大脑”里有一个专门指向“热”的特定方向,另一个指向“冷”。但论文表明,现实中的温度是一条连续曲线。你可以从冰点平滑地过渡到沸点。机器对这一概念的内在表示并非单一直线,而是一条弯曲的路径,其中“温暖”紧邻“炎热”,“寒冷”紧邻“凉爽”。

论文将这些弯曲路径称为流形

2. 工具:稀疏自编码器(SAE)

为了研究这些思想,研究人员使用了一种名为**稀疏自编码器(SAE)**的工具。你可以将 SAE 想象成一位翻译,试图将机器复杂的思想分解为一份简单、可理解的“特征”或“原子”列表。

这篇论文提出的核心问题是:这位翻译能否成功描绘出那些平滑的弯曲道路(流形),还是仅仅看到一堆互不相连的开关?

3. 发现:翻译被“稀释”了

论文发现,当前的 SAE 无法完美捕捉这些弯曲道路。SAE 没有发现一条平滑的道路,而是将道路分解成了无数细碎、破碎的片段。

作者描述了 SAE 处理弯曲道路的三种可能方式,但只有一种效果良好,而当前模型大多采用的是第三种混乱的方式:

  • 理想方式(全局捕捉):想象 SAE 找到了一个由 5 个“原子”组成的完美小团队,当它们组合时,能够描绘出整条弯曲道路。这种方式高效且整洁。
  • “破碎”方式(局部平铺):想象 SAE 为“冰点”分配一个特定原子,为“寒冷”分配另一个,为“凉爽”再分配一个,依此类推。每个原子都是覆盖道路一小块区域的微小瓷砖。这种方式可行,但你需要数百个原子才能覆盖整条道路。
  • “稀释”方式(现实情况):这就是论文在真实模型中发现的情况。SAE 感到困惑。它使用了过多的原子,且它们以混乱的方式相互重叠。有些原子覆盖“冰点”,有些覆盖“寒冷”,但它们也与“凉爽”和“冷”重叠,形成了一种冗余且令人困惑的杂乱状态。

作者将这种状态称为**“稀释”**。几何结构确实存在,但它被如此稀薄地分散在如此多的特征上,以至于如果你只观察其中一个特征,它便毫无意义。这就像试图通过观察单个模糊的像素来理解一幅画作,而不是观看整幅画面。

4. 解决方案:寻找群体,而非个体

由于 SAE 处于“稀释”状态,你不能仅仅观察单个特征就说:“啊,这就是‘温度’特征。”

相反,论文建议我们需要寻找协同工作的特征群体

  • 类比:想象一群人试图排成一条人链来代表一条弯曲的线。如果你只看一个人,他只是站在那里。但如果你看群体,你就能看到那条曲线。
  • 方法:作者开发了一种寻找这些群体的新方法。他们借鉴物理学中的方法(称为伊辛模型),观察哪些特征会一起“触发”(激活)或相互抵消。
    • 如果两个特征属于同一条“道路”,它们可能会同时触发(正连接)。
    • 如果它们代表道路上互不重叠的不同部分,它们可能永远不会同时触发(负连接)。

通过映射这些连接,他们可以重建出 SAE 曾经拆散的平滑弯曲道路。

5. 为何这很重要

论文得出结论,我们需要改变解读人工智能的方式。

  • 旧观点:意义存在于单个、孤立的方向中(就像单个开关)。
  • 新观点:意义存在于由特征群体协同工作所形成的几何形状中(就像弯曲的道路)。

作者警告说,如果我们继续试图通过观察单个特征来解读人工智能,我们可能会错失要点,甚至编造虚假的含义(幻觉)。要真正理解机器,我们必须停止寻找单个开关,转而寻找它们共同构建的弯曲道路

简而言之:机器以平滑的曲线进行思考,但我们当前的工具将这些曲线分解为混乱、重叠的碎片。要理解机器,我们需要学会将这些碎片重新组合成原始的形状。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →