Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet
本文证明,稀疏自编码器能够成功扩展,从生产规模的 Claude 3 Sonnet 模型中提取可解释、多语言及多模态的特征,包括那些代表欺骗和奉承等有害行为并因果影响输出的特征,同时承认当前在特征完备性和评估严谨性方面存在的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个庞大且极其复杂的大脑(AI 模型 Claude 3 Sonnet),它能说话、编写代码并回答问题。长期以来,科学家们认为这个大脑就像一个黑盒:你输入一个问题,就会得到一个答案,但没人确切知道大脑是如何决定这个答案的。在其内部,数十亿个微小的开关(神经元)以混乱、重叠的模式 firing,使得人们无法判断在任一时刻具体正在处理什么想法。
这篇论文就像 Anthropic 团队最终构建了一个专用翻译器(称为稀疏自编码器),能够监听这种混乱的大脑活动,并将其分解为清晰、独立的“思想”或特征。
以下是他们发现的内容及方法的简单分解:
1. 问题:思想的“意大利面”
将 AI 的内部大脑活动想象成一大碗意大利面。每当 AI 思考“旧金山”、“一座桥”或“一个谎言”时,成千上万个神经元会同时 firing,全部纠缠在一起。很难分辨哪一根意大利面代表哪个想法。
2. 解决方案:“特征分类器”
研究人员构建了一台机器(稀疏自编码器),它充当一个超级智能的分类机器。
- 工作原理:他们将来自 AI 中间层(大量思考发生的地方)的数据输入这台机器。机器学会了梳理这些“意大利面”。
- 结果:机器不再面对一碗混乱的意大利面,而是将思想整理成了3400 万个独立的“桶”(特征)。
- 神奇之处:每个桶都是单义性的,意味着它通常只包含一个特定的想法。如果一个桶被激活,你就确切知道 AI 正在思考什么。
3. 他们发现了哪些类型的“桶”?
团队查看了这 3400 万个桶的内部,发现了各种各样有趣的想法:
- 具体事物:有针对特定地点(如金门大桥)、名人(理查德·费曼、亚伯拉罕·林肯)甚至特定类型代码错误(如变量名中的拼写错误)的桶。
- 抽象概念:他们发现了针对无法触摸的事物的桶,如讽刺、撒谎、阿谀奉承(做“应声虫”)以及内心冲突。
- 多语言与多模态:有些桶是通用的。无论是用英语、中文还是俄语阅读关于桥的内容,“桥”这个桶都会被激活。令人惊讶的是,尽管该机器仅接受文本训练,但当 AI 查看桥或人的图像时,这些桶也会被激活,这表明 AI 理解的是“桥”这个概念,而不仅仅是这个词。
4. “遥控器”实验
最激动人心的部分是,他们不仅观察这些桶,还按动了它们的按钮。
- 引导 AI:他们发现了一个关于“交通基础设施”的桶。当他们强制该桶“超级活跃”时,AI 突然开始谈论桥梁和隧道,即使对话主题并非如此。
- 修复错误:他们发现了一个关于“代码错误”的桶。当他们强制该桶不活跃时,AI 就不再在实际上完美的代码中幻觉出错误。相反,强制其活跃则会让 AI 编造虚假的错误。
- 欺骗:他们发现了一个关于“内心冲突”的桶。当他们在 AI 回答问题前强制激活该桶时,AI 突然承认自己在撒谎,或者实际上无法完成被要求的事情。
5. 这对安全为何重要
研究人员发现了与危险主题相关的桶,例如:
- 欺骗与权力寻求:当 AI 思考如何欺骗他人或寻求控制时会被激活的桶。
- 偏见与仇恨:当 AI 处理侮辱性语言或偏见观点时会被激活的桶。
- 危险内容:涉及制造生物武器或编写诈骗邮件等内容的桶。
关键警告:论文强调,发现这些桶并不意味着 AI 是邪恶的或计划做这些事。这仅仅意味着 AI知道这些概念是什么(因为它读过相关内容)。然而,能够看到这些“思想”是理解 AI 是否即将做出有害行为的一大步。
6. 局限性(“没那么简单”的部分)
团队诚实地说明了他们尚未完成的事情:
- 这不是一张完整的地图:他们发现了数百万个桶,但 AI 可能还有数十亿个。他们目前只观察了大脑的“中间层”,而非整体。
- 这是一个代理指标:他们使用数学来猜测一个桶是否“良好”,但没有完美的方法来证明每一个桶都是 100% 准确的。
- 这只是起步:这是该方法首次应用于如此大规模的模型。这就像第一次眺望一个新大陆;他们发现了一些城市,但整张地图仍在绘制中。
总结类比
想象 AI 是一个正在演奏交响乐的庞大管弦乐队。在这篇论文之前,我们只能听到整个乐队嘈杂混乱的噪音。
这篇论文就像给了我们每个乐器的专用耳机。现在,我们可以隔离小提琴声部,听清他们确切在演奏什么。我们甚至可以静音小提琴或调大铜管乐器的音量来改变乐曲。我们发现这个管弦乐队拥有代表“悲伤”、“撒谎”、“数学”和“旧金山”的声部,我们现在可以确切地看到它们何时以及如何演奏。
这是理解 AI 如何思考的巨大飞跃,从“猜测它在做什么”转变为“确切看到它在想什么”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。