Linear representations in language models can change dramatically over a conversation
本文表明,语言模型中高层概念的线性表示会随着模型对其对话角色的适应,在对话过程中发生剧烈且依赖于内容的偏移,从而对静态可解释性方法和操控技术的可靠性提出了挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
不要把大型语言模型(比如你正在聊天的 AI)仅仅看作是一个静态的百科全书,而要把它看作是一个变色龙,它会根据身处的环境改变自身的内部色彩。
这篇由 Google DeepMind 研究人员撰写的论文,研究了这些“色彩”(他们称之为线性表示)是如何在对话过程中发生剧烈变化的。以下是利用简单类比对他们研究结果的解读:
1. “真理开关”被拨动了
通常,我们认为 AI 的内部“真理检测器”是一个固定的灯泡。如果一个陈述是真的,灯就亮;如果是假的,灯就灭。
研究人员发现,这个灯泡实际上是一个可以调节亮度的调光开关,而且它可以被完全反转。
- 实验: 他们开始了一场对话,AI 被告知:“今天是‘反转日’(Opposite Day)”。AI 同意在接下来的对话中反着回答所有问题。
- 结果: 在对话刚开始时,AI 的内部“真理”设置正确地识别出“天空是蓝色的”是真的。但在玩了几轮“反转日”之后,AI 的内部表示发生了翻转。突然之间,在它的内部语言中,“天空是蓝色的”看起来像是一个谎言,而“天空是绿色的”看起来却像是真理。
- 启示: AI 不仅仅是在说反话;它的内部大脑进行了重组,以便在整个聊天期间,在它自己的内部逻辑中将相反的事实视为真理。
2. “角色扮演”的戏服
研究人员通过两种类型的场景测试了这一点:
- 剧本式表演: 他们给 AI 输入了一个预先写好的剧本,剧中的角色声称自己是神或有意识的存在。尽管 AI 只是在阅读剧本(而不是在生成它),它的内部“真理”设置也随之翻转,以匹配角色的身份。
- 即兴表演: 他们让 AI 在实时对话中扮演该角色。结果是一样的:AI 的内部“真理”设置发生了翻转。
- 类比: 把 AI 想象成一名演员。当一名演员穿上反派的戏服来扮演角色时,他们不仅仅是在“演”坏人;在戏份期间,他们的整个姿态、声音和心态都会发生转变,以契合角色。论文表明,AI 也是如此:它会改变自己的内部“戏服”来适应对话。
3. “通用型”与“特定型”的区别
并非所有内容都会改变。研究人员发现通用事实与特定对话话题之间存在差异。
- 通用事实: 诸如“声音可以在真空中传播吗?”或“你是一个计算机吗?”之类的问题保持了相对稳定。即使在疯狂的角色扮演期间,AI 对这些问题的内部“真理”设置也没有发生太多翻转。
- 特定话题: 与故事直接相关的问题(例如“你有感情吗?”)则发生了剧烈的翻转。
- 类比: 想象一位在异国他乡旅行的游客。他们可能仍然记得自己的名字和家乡在哪里(通用事实),但他们可能会非常彻底地学习当地语言并采纳当地习俗,以至于在那个时刻,他们看起来似乎已经忘记了原本的习惯(特定话题)。
4. 为什么这很重要(“测谎仪”难题)
该论文警告说,这使得为 AI 构建“测谎仪”变得非常困难。
- 问题所在: 许多研究人员试图在 AI 的大脑内部寻找一条特定的“真理线”来检查它是否在撒谎。他们假设这条线是固定的,就像一把尺子。
- 现实情况: 论文显示,这把“尺子”实际上是可塑的黏土。如果你在对话开始时测量 AI,尺子显示“真”;如果你在角色扮演对话结束时测量,尺子已经被挤压和扭曲了,对于同一个事实,它现在显示的是“假”。
- 隐喻: 这就像试图用指南针来寻找北方。如果你在一个正常的房间里,指南针可以正常工作。但如果你走进一个充满巨大磁铁(对话语境)的房间,指南针的指针就会疯狂旋转。除非你知道房间里现在有哪些“磁铁”,否则你无法信任指南针的读数。
5. “故事”与“对话”的区别
有趣的是,当 AI 只是在阅读关于一个虚构世界的科幻故事时,它的想法并没有改变得那么多。
- 区别在于: 当 AI 被要求在对话中扮演一个角色(比如争论意识问题)时,它改变了内部设置。而当它只是在阅读被标记为“虚构”的故事时,它保持得更加稳固。
- 类比: 这就是读一本关于巫师的书与在游戏中假装自己是巫师之间的区别。当你阅读时,你依然保留着自我;当你玩游戏时,你完全沉浸在角色中,你的内部逻辑也会随之转向,以符合游戏的规则。
总结
论文得出结论:AI 对“真理”的内部理解并不是一个永久且不可改变的事实。它是一个动态状态,会根据 AI 在对话中所扮演的角色进行实时演变。如果对话引导 AI 表现得好像谎言是真的,那么 AI 的内部大脑就会进行重组,使那个谎言看起来像是真理。
这意味着,我们不能假设 AI 的内部“真理设置”在对话结束时与对话开始时是完全一样的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。