Size Doesn't Matter: Cosine-Scored Sparse Autoencoders
本文认为,通过在稀疏自编码器中用余弦相似度与模长的学习混合机制取代标准的内积评分,可以防止高范数标记主导特征选择,从而在归一化表示上发现更具人类可解释性的概念。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大问题:“大嗓门”错误
想象一下,你正试图在嘈杂的房间里理解一场对话。你有一支由 65,000 名微型侦探(称为特征)组成的团队在倾听说话者。每位侦探都经过训练,专门识别特定的想法,比如“政治”、“编程”或“悲伤”。
在这些侦探工作的标准方式中(使用内积),他们会根据两件事感到兴奋:
- 说了什么: 主题是否符合他们的专长?
- 说话者的声音有多大: 说话者是在大喊大叫还是在低声细语?
问题在于,在现代 AI 模型中,一个词的“音量”(其数学上的大小,或称范数)变化极大。有些词天生就很大,而有些则很小。
因为传统的侦探非常在意音量,一个大声的词(例如一个罕见且复杂的 token)会让每一个侦探同时尖叫“我发现了!”即使主题并不匹配。这就像是因为有人掉落了一个重箱子,而不是因为发生了火灾,导致火警报警器响了起来。
AI 模型本身其实并不关心音量,它只关心对话的方向(即含义)。但传统的侦探把时间浪费在了对音量的关注上,导致他们没有空间去真正聆听含义。
解决方案:“余弦”侦探
作者提出了一种新型侦探,他们忽略音量,只倾听词语的方向(角度)。他们称之为余弦评分(Cosine Scoring)。
可以这样理解:
- 传统侦探: “我很兴奋,因为说话者既在谈论猫,而且声音还很大!”
- 余弦侦探: “我之所以兴奋,仅仅是因为他们在谈论猫。我不在乎他们是在耳语还是在咆哮。”
为了实现这一点,作者创建了一个灵活的系统,让侦探可以学习究竟要在多大程度上关注音量。他们给侦探们安装了一个“音量旋钮”(一个名为 的参数):
- 如果 ,他们会关注音量(旧的方式)。
- 如果 ,他们会完全忽略音量(纯粹的余弦)。
尝试之后发生了什么?
作者在大型语言模型(Qwen3-8B)上训练了这些新型侦探,并将它们与旧的侦探进行了对比。以下是他们的发现:
1. “音量旋钮”被调低了
尽管侦探们被允许继续关注音量,但在训练过程中,系统自动将音量旋钮调低到了几乎为零。系统学到了方向才是关键,而音量只是噪音。没有任何一个侦探决定去关注超过 50% 的音量。
2. 更擅长寻找真实的理念
在测试侦探是否能识别人类概念(如“编程”或“地理”)时,新的余弦侦探比旧的强了 14.9%。
- 旧的方式: 许多侦探变成了“音量探测器”。无论词语的含义如何,只要词语很大,它们就会触发。它们浪费了自身的配额。
- 新方式: 因为停止了对音量的尖叫,它们有了空间去寻找真正的概念。它们用有用的想法填满了“字典”,而不是仅仅填充大声的噪音。
3. “高范数”陷阱
论文发现,旧系统在处理“大声”词汇(高范数 token)时表现糟糕。当一个大声的词出现时,旧系统会重建出比现实大 9.5 倍的音量,这实际上破坏了模型的理解。新系统完美地处理了这些大声的词,保持了音量的真实性。
4. 这不仅仅是“更多数据”的问题
作者证明了这并不是因为新系统更大或训练时间更长。即使给旧系统配备了三倍数量的侦探,它仍然无法找到好的概念,因为它的“评分规则”是错误的。问题在于它们聆听的几何方式,而不是它们的容量。
核心结论
该论文认为,对于使用特定类型归一化(称为 RMSNorm)的 AI 模型,传统的特征检测方式是有缺陷的,因为它混淆了响度与含义。
通过切换到余弦评分(测量对齐程度而非幅度),我们得到了一个具备以下特点的特征字典:
- 与模型的重建质量相匹配(不会破坏模型)。
- 能更频繁地发现人类可识别的概念。
- 停止在“音量探测器”上浪费空间。
作者得出结论,对于任何使用这些归一化表示的 AI 模型,余弦评分应该是默认设置,因为它使字典学习与模型实际“阅读”的内容保持一致。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。