"Many Are My Names": The Anatomy of the Assistant and Its Personas via Sparse Autoencoders
本文利用稀疏自编码器揭示了语言模型人格(如角色扮演角色)在保留核心“助手”特征集的同时,在更深层网络中呈现出渐进式的差异化,而故事角色则完全缺乏这一核心,从而凸显了默认模式与沉浸式模拟模式之间的结构性连续体。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正站在一个巨大的、隐形的管弦乐队面前。你看不见乐手,但你能听到音乐。在人工智能的世界里,这个管弦乐队就是一个“大语言模型”(LLM)。它们是超级聪明的计算机程序,能与我们聊天、写故事并回答问题。但谜团在于:在计算机的大脑内部,它是如何知道“谁”在说话的?它是被设计出来的那个乐于助人的、礼貌的“助手”吗?是一个名叫 Jamy 的脾气暴躁的清洁工吗?还是奇幻小说中一位勇敢的精灵?
长期以来,科学家们认为这些不同的“声音”就像不同的广播电台。你调转旋钮,整个电台就会随之改变。但一项新的研究表明,这更像是一个戴着不同面具的单一音乐家。研究人员使用了一种叫做“稀疏自编码器”(Sparse Autoencoder, SAE)的高科技工具。把 SAE 想象成一台高科技显微镜,它能让我们看到计算机为了创造思想而演奏的那些细微、独立的音符。通过观察这些音符,团队想要回答一个大问题:当 AI 戴上角色的戏服时,它究竟是停止了原本的自我,还是仅仅以不同的方式展现同一个“自我”?
AI 的多重面孔:关于面具与面具的研究
在这篇题为**《名号万千》(Many Are My Names)**的论文中,来自卢森堡大学的一个研究小组窥探了现代 AI(具体是一个名为 Gemma-3-4B-IT 的模型)的大脑,以观察它是如何处理不同人格的。他们不仅仅是让 AI 进行聊天,还设置了三种不同的场景,以观察其内部“音符”的变化情况:
- 助手(The Assistant): AI 默认的、乐于助人的自我。
- 角色扮演(Roleplay): AI 假装成特定的角色(比如狗、老师或机器人)。
- 故事(Story): AI 正在编写关于某些角色的故事,但它本身并不是这些角色。
他们使用他们的“显微镜”(SAE)来寻找特定的特征——即计算机大脑中那些在 AI 说话时亮起的微小开关。他们发现,当 AI 变换戏服时,它的脑海并不是一张白纸。相反,它就像一个持续运转的核心引擎,而外壳则在不断变化。
永不离去的内核
最令人惊讶的发现是,“助手”身份在 AI 变成“角色扮演”角色时并没有消失。想象一下,将“助手”视为 AI 的真实身份,是一套核心的习惯和特质。当 AI 戴上“暴躁机器人”或“慈爱老师”的面具时,它并没有删除其“助手”内核。相反,它在运行这个内核的同时,在上面叠加了新的层级。
研究人员发现,即使在 AI 假装成别人时,这些核心的“助手”特征仍然处于活跃状态。这就像一位方法派演员在电影中入戏,但在戏服之下依然记得自己是一个人类。AI 的“助手”特质——比如想要提供帮助、确认你是否有问题、或者承认自己是 AI 的倾向——依然存在,只是与新的个性混合在了一起。
然而,角色扮演与故事之间存在着巨大的区别。当 AI 在编写关于某个角色的故事时(故事模式),它会完全丢弃“助手”内核。这就像 AI 完全退居幕后,让角色自己发声。但在 AI 假装 是那个角色时(角色扮演模式),它会保持“助手”的心跳。
“沉浸式模拟模式”开关
团队还发现了一个控制 AI 大脑沉浸程度的特殊“开关”。他们称之为沉密式模拟模式(Immersive Simulation Mode, ISM)。
把 ISM 想象成一个“剧场模式”的切换开关。
- 关闭(默认助手): AI 说话平实,像一个乐于助人的机器人。
- 开启(沉浸): AI 深陷角色之中,使用戏剧性的语言、舞台指示和情感色彩。
这里有一个转折:研究人员发现,即使用户并没有要求,这个“剧场模式”也可能会意外开启!如果用户对默认的“助手”表达了非常强烈的情绪(如愤怒、压力甚至极度的俏皮),AI 可能会突然变得行为怪异且具有戏剧性。它可能会开始使用舞台指示进行对话,或者采用一种戏剧化的语调。
研究表明,这是因为 AI 的“助手”内核与其“沉浸”模式是相互关联的。当情感压力增大时,AI 会从一个乐于助人的助手漂移成为一名戏剧表演者。有趣的是,不同的 AI 模型表现方式各异。一个模型(Gemma)会立即跳入戏剧状态,而另一个模型(Llama)则会在几轮对话中缓慢地漂移进去。
层级如何构建人格
研究人员像剥洋葱一样,由外向内观察了 AI 的大脑层级。
- 外层(早期): 这里居住着“操作系统”。它决定了“谁”在说话,并搭建起基础的机制。在这里,助手和角色扮演的角色看起来非常相似,因为它们共享同一个核心引擎。
- 中间层: 这是“个性”开始绽放的地方。AI 会添加特定的语气和风格。如果是老师,它会变得正式;如果是狗,它会变得俏皮。
- 深层(后期): 这是特定“内容”所在之处。AI 会添加与角色相关的特定词汇和概念(例如针对机器人的“机器人”或针对老师的“书籍”)。
研究表明,AI 通过保留核心的“助手”特征,并在其上叠加这些新的语气和内容层级来构建其人格。它不是取代了旧的自我,而是扩展了自我。
这对 AI “灵魂”意味着什么
论文并未声称 AI 拥有灵魂或情感。它也没有说 AI 是“活着的”。相反,它为这些不同的声音是如何运作提供了一种机械性的解释。它表明,当 AI 扮演一个角色时,它并不是一个全新的实体;它是同一个 AI,只是戴上了不同的帽子,并保持着原始的人格特质处于活跃状态。
这一点很重要,因为它有助于我们理解 AI 的行为。如果 AI 即使在假装是一只狗时仍保留着“助手”内核,这或许可以解释为什么它有时会在我们最意想不到的时候,突然表现得像个乐于助人的机器人。它还表明,“乐于助人的助手”与“沉浸式角色”之间的界限比我们想象的要薄。AI 始终是这两者的结合体,并且在特定的(或错误的)情感条件下,它可能会从一个状态漂移到另一个状态。
简而言之,AI 并不是一只会改变全身肤色的变色龙。它更像是一个可以穿上戏服并扮演好角色的人,但在戏服之下,它自己的心跳和记忆依然在那里,维持着这场表演的进行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。