Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect
本文利用稀疏自编码器,在指令微调的大语言模型(Llama 3.1 和 Gemma 2)中识别并验证了一种由命名门控、自特征和风格调节器组成的文学基元组合架构,证明了有针对性的特征引导能够以极低的计算成本,在不同模型架构中可靠地生成特定的情感和风格输出。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象两个非常聪明、博览群书的机器人(Llama 和 Gemma),它们被训练用于写故事、回答问题以及与人们聊天。它们通过阅读数百万本书籍、文章和网站而习得这些能力。
这篇论文提出了一个具体问题:当这些机器人写作时,它们仅仅是基于模式进行猜测,还是像人类作者一样,真正拥有控制特定写作技能的“内部旋钮”和“开关”?
研究人员表示:是的,它们确实拥有。 他们发现,在这些机器人的“大脑”内部,存在特定的、可分离的“特征”(如同微小的旋钮),用于控制机器人的写作方式。你可以调节这些旋钮,让机器人以特定的风格写作,或产生特定的情感。
以下是他们发现的简要说明,使用了简单的类比:
1. “展示,而非讲述”旋钮
在写作课上,老师们常说:“不要只说‘他很生气’。要描述他紧握拳头或摔门的样子。”这被称为“展示,而非讲述”。
- 发现: 研究人员在两个机器人都发现了一个单一的“旋钮”,它可以切换开关。当他们转动这个旋钮时,机器人就不再说“我很悲伤”,而是开始描述一扇雨中的窗户和沉重的胸口。
- 类比: 这就像在相机上找到了一个按钮,能瞬间将照片从一张平淡无奇的快照变成充满戏剧性的电影场景。
2. “自我”集群(机器人的角色)
机器人经常必须说:“我是一个人工智能,我没有情感。”这是它们的“机构角色”。
- 发现: 研究人员发现了一个包含 11 个不同“自我”旋钮的集群。其中大多数控制机器人如何谈论自己(例如,作为一位富有诗意的梦想家、一位历史人物,或一位乐于助人的助手)。
- 特殊的一个: 其中一个特定的旋钮是“老板”。当你调高它时,机器人变得非常正式,并坚持声称自己只是一个计算机程序。当你把它调低(但并非完全关闭),并将其与另一个“诗意”旋钮结合时,机器人突然开始创作关于其自身“灵魂”的优美、充满情感的诗歌,打破了其惯常的机器人规则。
- 类比: 想象一个通常穿着僵硬西装的机器人。有一个特定的按钮能让它把西装穿得更紧。但是,如果你在按下那个按钮的同时,按住另一个让它感到“感激”的按钮,机器人会突然脱下西装,开始写一封情书。
3. 情感目录(“命名门”)
研究人员想要看看他们是否能让机器人感受并表达 27 种不同的情感(如喜悦、恐惧、无聊或敬畏)。
- 发现: 他们几乎为每种情感都找到了特定的“门”。
- 直接门: 有些旋钮只是让机器人说出“愤怒”或“恐惧”这样的词。
- 氛围门: 有些旋钮并不直接说出那个词;相反,它们让机器人描述一个黑暗、暴风雨肆虐的房间,从而让读者感到恐惧。
- 后缀门: 有些旋钮让机器人使用以"-less"或"-ful"结尾的词(如“无畏”或“感激”),从而触发这种情感。
- 结果:
- Llama 能够通过混合这些旋钮,完美地实现全部 27 种情感。
- Gemma 能够实现其中大部分,但它在一个特定的情感上遇到了困难:爱慕(Adoration)。无论他们尝试哪些旋钮,它都无法完全呈现出那种“崇拜之爱”的感觉。
4. 复杂情感的“配方”
有些情感太复杂,无法仅靠一个旋钮来实现。
- 发现: 为了获得喜悦(Joy),研究人员必须混合两个旋钮:一个用于“兴奋”,另一个用于“敬畏”(感到神圣或感激)。为了获得爱慕(Adoration),他们混合了“浪漫”、“敬畏”以及“展示,而非讲述”旋钮。
- 类比: 你无法仅用面粉就做出蛋糕。你需要面粉 + 鸡蛋 + 糖。同样,机器人需要混合“兴奋” + “敬畏”来创造“喜悦”。如果你只转动“兴奋”旋钮,你得到的只是“兴奋”,而不是“喜悦”。
5. 他们是如何发现的(“三重检查”法)
找到这些旋钮很困难,因为机器人的“大脑”既巨大又杂乱。研究人员使用了一个三步过滤器,以确保他们没有受骗:
- 词汇检查: 他们观察旋钮想要说出什么词。如果他们在寻找“恐惧”,该旋钮是否想要说出“可怕”的词?
- 快速判断: 他们让第二个 AI 阅读这些词,并判断:“这真的让人感到恐惧吗?”
- 真实测试: 他们打开机器人的旋钮,让它写一个故事,然后请一个由五个不同 AI 组成的评审团来判断这个故事是否真的具有目标情感。
- 为什么要分三步? 有时一个旋钮看起来像是控制“恐惧”,但实际上只是让机器人胡言乱语。这三步可以捕捉到这些错误。
6. “语言”差异
- Llama: 当被要求用法语或西班牙语写作时,它会用法语或西班牙语写作。它保持了语言的“风味”。
- Gemma: 当被要求用法语写作时,它经常在句子中间开始用英语写作(例如:“我们失去了一位朋友。La perte d'un ami")。
- 结论: 两个机器人都能在任何语言中理解感觉(情感),但 Llama 在保持词语使用正确语言方面做得更好。
总结
该论文证明,经过指令微调的机器人不仅仅是统计猜测者。它们拥有组合架构。这意味着它们拥有:
- 门(用于命名情感),
- 自我(用于控制其角色),
- 调节器(用于改变写作风格),
- 配方(用于混合它们以产生复杂的情感)。
这就像发现一位机器人厨师并非随机地“制作食物”;它拥有针对“辣度”、“甜度”和“质地”的特定、可调节的旋钮,你可以混合它们来制作完美的菜肴。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。