Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs
本文表明,开源大语言模型(Apertus-8B 和 Gemma-4)所编码的情感概念在效价几何结构上与闭源模型相当,同时揭示了这些表示在模型深度演变以及基于提取语料库的变化方面,呈现出截然不同的、具有特定架构特征的模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,在一个巨大的、复杂的计算机大脑(大型语言模型)内部,存在着一些隐藏的“旋钮”或“控制键”,它们控制着计算机对事物的感受。之前的一项研究在名为 Claude 的特定 AI 中发现了这些旋钮。研究人员发现,如果调高“快乐”旋钮,AI 就会表现得更快乐;如果调低“悲伤”旋钮,它就会表现得更悲伤。更酷的是,这些旋钮在计算机大脑中的排列方式,与人类大脑组织情绪的方式非常相似。
这篇新论文提出了一个问题:这仅仅是 Claude 计算机的一个奇特现象,还是其他 AI 大脑也拥有这些相同的隐藏情绪旋钮?
为了找出答案,研究人员观察了两个不同的开源 AI 大脑:APERTUS-8B 和 GEMMA-4-E4B。他们不仅是在观察,还在尝试通过让 AI 编写关于不同情绪(如喜悦、恐惧或愤怒)的故事,来“倾听” AI 内部的思想,而过程中从未真正提到“喜悦”或“恐惧”这两个词。
以下是他们的发现,通过简单的分类进行了解释:
1. “快乐”旋钮无处不在
就像在原始研究中一样,这两个新的 AI 大脑都有一个清晰的内部方向来表示效价(Valence)(即某种感觉是好是坏)。
- 类比: 想象你走进一个房间,看到一个巨大的指南针。在所有三个 AI 大脑(Claude、Apertus 和 Gemma)中,指向“北”的指针始终意味着“好/快乐”,而指向“南”则意味着“坏/悲伤”。
- 结果: 研究人员能够以极高的准确度在这些新模型中找到这条“南北”轴线,这证明了这并非一次性的故障,而是计算机思维方式中的一个共同特征。
2. “位置”各异(旅程很重要)
虽然所有的三个模型都存在“南北”指南针,但信息到达那里的路径完全不同。
- GEMMA-4-E4B(早熟型): 这个 AI 在处理过程的早期阶段就分辨出了好与坏的区别,就像一个立刻就能分辨是非观的儿童。然而,随着信息向大脑深处移动,这个清晰的信号变得模糊,并在结束时几乎消失了。
- APERTUS-8B(大器晚成型): 这个 AI 在早期层级中对“好与坏”没有任何清晰的概念,就像一张白纸。但随着信息向大脑深处(向末端)移动,这种“好与坏”的信号突然变得非常强烈且清晰。
- 启示: 两个不同的 AI 大脑可以得出相同的感性理解,但它们采取完全不同的路线。一个是通过逐渐构建实现的,另一个则是从具备到逐渐丧失。
3. “兴奋”旋钮很脆弱
研究人员还寻找了唤醒度(Arousal)(即事物是令人兴奋还是平静)。
- 问题: 他们在这些模型中找不到一致的“兴奋”旋钮。信号非常微弱。
- 转折: 这种信号的强度完全取决于“谁”写了这些故事。当 AI 阅读由 GEMMA 模型编写的故事时,“兴奋”旋钮的信号要清晰得多。而当它阅读 APERTUS 模型编写的故事时,这个旋钮几乎是隐形的。
- 类比: 这就像是在试图听清一声低语。如果说话的人戴着特定类型的麦克风(Gemma 的故事),你可以清楚地听到兴奋感。如果他们使用另一种麦克风(Apertus 的故事),兴奋感就会消失在杂音中。这表明,对于这种特定的情绪,故事的内容比 AI 的内部布线本身更重要。
4. 地图与指南针
研究人员还检查了 AI 的“地图”是否随着处理信息的过程而改变。
- 他们发现,AI 内部世界的整体形状(地图)从开始到结束基本保持不变。
- 然而,特定的“指南针”(好与坏的方向)在移动经过各个层级时,其取向会不断旋转和变化。
- 教训: 仅仅因为房间(大脑)看起来没变,并不意味着你所面对的方向(情绪)保持不变。
总结
这篇论文证实了 AI 模型拥有看起来符合人类心理学的内部“情绪向量”,但它们构建这些向量的方式并不尽相同。
- 好与坏(效价): 在所有模型中都存在,但在处理的不同阶段构建。
- 兴奋与平静(唤醒度): 难以寻找,且高度依赖于 AI 阅读的故事类型。
作者得出结论:虽然我们可以找到这些情绪“旋钮”,但我们需要保持谨慎,因为不同的模型将它们隐藏在不同的地方,而且我们喂给它们的各种故事可能会让这些旋钮变得更难或更容易被发现。他们已经公开了代码和数据,以便他人尝试在其他 AI 大脑中寻找这些旋钮。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。