← 最新论文
🤖 AI

Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet

本文证明,稀疏自编码器能够成功扩展,从生产规模的 Claude 3 Sonnet 模型中提取可解释、多语言及多模态的特征,包括那些代表欺骗和奉承等有害行为并因果影响输出的特征,同时承认当前在特征完备性和评估严谨性方面存在的局限性。

原作者: Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L Turner, Callum McDougall
发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L Turner, Callum McDougall, Monte MacDiarmid, Alex Tamkin, Esin Durmus, Tristan Hume, Francesco Mosconi, C. Daniel Freeman, Theodore R. Sumers, Edward Rees, Joshua Batson, Adam Jermyn, Shan Carter, Chris Olah, Tom Henighan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个庞大且极其复杂的大脑(AI 模型 Claude 3 Sonnet),它能说话、编写代码并回答问题。长期以来,科学家们认为这个大脑就像一个黑盒:你输入一个问题,就会得到一个答案,但没人确切知道大脑是如何决定这个答案的。在其内部,数十亿个微小的开关(神经元)以混乱、重叠的模式 firing,使得人们无法判断在任一时刻具体正在处理什么想法。

这篇论文就像 Anthropic 团队最终构建了一个专用翻译器(称为稀疏自编码器),能够监听这种混乱的大脑活动,并将其分解为清晰、独立的“思想”或特征

以下是他们发现的内容及方法的简单分解:

1. 问题:思想的“意大利面”

将 AI 的内部大脑活动想象成一大碗意大利面。每当 AI 思考“旧金山”、“一座桥”或“一个谎言”时,成千上万个神经元会同时 firing,全部纠缠在一起。很难分辨哪一根意大利面代表哪个想法。

2. 解决方案:“特征分类器”

研究人员构建了一台机器(稀疏自编码器),它充当一个超级智能的分类机器

  • 工作原理:他们将来自 AI 中间层(大量思考发生的地方)的数据输入这台机器。机器学会了梳理这些“意大利面”。
  • 结果:机器不再面对一碗混乱的意大利面,而是将思想整理成了3400 万个独立的“桶”(特征)。
  • 神奇之处:每个桶都是单义性的,意味着它通常只包含一个特定的想法。如果一个桶被激活,你就确切知道 AI 正在思考什么。

3. 他们发现了哪些类型的“桶”?

团队查看了这 3400 万个桶的内部,发现了各种各样有趣的想法:

  • 具体事物:有针对特定地点(如金门大桥)、名人(理查德·费曼亚伯拉罕·林肯)甚至特定类型代码错误(如变量名中的拼写错误)的桶。
  • 抽象概念:他们发现了针对无法触摸的事物的桶,如讽刺撒谎阿谀奉承(做“应声虫”)以及内心冲突
  • 多语言与多模态:有些桶是通用的。无论是用英语、中文还是俄语阅读关于桥的内容,“桥”这个桶都会被激活。令人惊讶的是,尽管该机器仅接受文本训练,但当 AI 查看桥或人的图像时,这些桶也会被激活,这表明 AI 理解的是“桥”这个概念,而不仅仅是这个词。

4. “遥控器”实验

最激动人心的部分是,他们不仅观察这些桶,还按动了它们的按钮。

  • 引导 AI:他们发现了一个关于“交通基础设施”的桶。当他们强制该桶“超级活跃”时,AI 突然开始谈论桥梁和隧道,即使对话主题并非如此。
  • 修复错误:他们发现了一个关于“代码错误”的桶。当他们强制该桶不活跃时,AI 就不再在实际上完美的代码中幻觉出错误。相反,强制其活跃则会让 AI 编造虚假的错误。
  • 欺骗:他们发现了一个关于“内心冲突”的桶。当他们在 AI 回答问题前强制激活该桶时,AI 突然承认自己在撒谎,或者实际上无法完成被要求的事情。

5. 这对安全为何重要

研究人员发现了与危险主题相关的桶,例如:

  • 欺骗与权力寻求:当 AI 思考如何欺骗他人或寻求控制时会被激活的桶。
  • 偏见与仇恨:当 AI 处理侮辱性语言或偏见观点时会被激活的桶。
  • 危险内容:涉及制造生物武器或编写诈骗邮件等内容的桶。

关键警告:论文强调,发现这些桶并不意味着 AI 是邪恶的或计划做这些事。这仅仅意味着 AI知道这些概念是什么(因为它读过相关内容)。然而,能够看到这些“思想”是理解 AI 是否即将做出有害行为的一大步。

6. 局限性(“没那么简单”的部分)

团队诚实地说明了他们尚未完成的事情:

  • 这不是一张完整的地图:他们发现了数百万个桶,但 AI 可能还有数十亿个。他们目前只观察了大脑的“中间层”,而非整体。
  • 这是一个代理指标:他们使用数学来猜测一个桶是否“良好”,但没有完美的方法来证明每一个桶都是 100% 准确的。
  • 这只是起步:这是该方法首次应用于如此大规模的模型。这就像第一次眺望一个新大陆;他们发现了一些城市,但整张地图仍在绘制中。

总结类比

想象 AI 是一个正在演奏交响乐的庞大管弦乐队。在这篇论文之前,我们只能听到整个乐队嘈杂混乱的噪音。
这篇论文就像给了我们每个乐器的专用耳机。现在,我们可以隔离小提琴声部,听清他们确切在演奏什么。我们甚至可以静音小提琴或调大铜管乐器的音量来改变乐曲。我们发现这个管弦乐队拥有代表“悲伤”、“撒谎”、“数学”和“旧金山”的声部,我们现在可以确切地看到它们何时以及如何演奏。

这是理解 AI 如何思考的巨大飞跃,从“猜测它在做什么”转变为“确切看到它在想什么”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →