Priors Persist Through Suppression: A Stroop Paradigm for Lexical Override
本文表明,在语言模型中,熟悉的词汇先验通过显式的覆盖规则而非被替换而持续存在,从而导致了源自于并将机制性地定位于将定义目标与查询词相绑定的特定激活路径之上的类斯特鲁普(Stroop-like)干扰。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明、博学多才的机器人学习一个游戏新规则。你告诉它:“在这个游戏中,‘医生’(doctor)这个词的意思是‘森林’(forest)。”
接着,你问机器人:“仅根据这条规则,哪个词与‘医生’相关?”
理想情况下,机器人应该说 “森林”。但因为这个机器人以前读过数百万本书,它有一个深刻且自动化的习惯:一旦听到“医生”,它会立刻想到 “医院”。
这篇论文研究的是当机器人试图遵循你的新规则,同时又要与旧习惯作斗争时会发生什么。研究人员称之为 “斯特鲁普式”(Stroop-style)测试(得名于一个著名的心理学实验,在该实验中,人们在面对单词本身拼写出的颜色与实际字体颜色不一致时(例如蓝色的字体写着“红色”),会难以命名颜色)。
以下是他们的研究结果,使用了简单的类比:
1. 旧习惯并不会凭空消失
研究人员发现,当你要求机器人忽略其旧知识时,它并不会简单地删除旧含义并替换为新含义。相反,旧含义 在后台依然徘徊不去。
- 类比: 想象你正试图在一条新路上开车,但你的肌肉记忆不断试图引导你驶向旧家。你可以强迫汽车留在新路上,但你的双手仍在不由自主地向旧方向摆动。你的旧习惯(“词汇先验知识”)越强,即使你非常努力,也越难留在新路上。
- 研究结果: 机器人通常将“医生”与“医院”联系得越紧密,它在面对明确的新规则时,就越难说出“森林”。
2. “故障”发生在特定的位置
研究人员不仅观察机器人的回答,还深入观察了它的“大脑”(其内部计算机代码)以查看挣扎发生的具体位置。他们使用了一种叫做 “激活修补”(activation patching) 的技术,这就像是暂时用来自另一个机器人的干净版本来替换机器人大脑中的某一部分,看看是否能修复错误。
- 类比: 把机器人的大脑想象成一条工厂流水线。研究人员发现,这条流水线上有一个特定的三人小组负责这项特定任务:
- 听到新规则的人(“医生意味着……”)。
- 持有新含义的人(“……森林”)。
- 听到问题单词的人(“……医生?”)。
- 研究结果: 当研究人员用一个干净的版本“修补”(替换)了这三个人的工作后,机器人突然就能答对答案了。如果他们只修复了其中两人,或者如果他们把“森林”那个人换成了持有另一个单词的人,机器人仍然会失败。这证明了机器人需要将特定的新含义与特定的单词进行 “绑定”(bind) 才能使其生效。
3. “抑制”与“保持”之谜
一个非常有趣的发现是机器人是如何修复错误的。研究人员原以为机器人会简单地“调低”错误答案(“医院”)的音量。
- 类比: 想象一台同时播放两个频道的收音机:旧习惯(医院)和新规则(森林)。
- 他们预想的情况: 机器人只需调低“医院”频道的音量。
- 实际发生的情况: 机器人确实调低了“医院”的音量,但它在几乎任何情况下都会这样做(即使规则有点混乱)。真正的魔力在于,每当新规则非常清晰时,机器人会专门 调高 正确答案(“森林”)的音量。
- 研究结果: 机器人的能力取决于 保持新含义,而不仅仅是抑制旧含义。如果“新含义”部分的大脑受损,即使“旧含义”仍被抑制,机器人也会崩溃。
4. 这发生在各种各样的机器人身上
研究人员在 11 种不同类型的 AI 模型(涵盖从小到大以及来自不同公司的模型)上进行了测试。
- 研究结果: 无论机器人多么庞大或聪明,也无论他们如何表述规则(作为游戏、法律文件还是技术手册),旧习惯总是会产生干扰。机器人的原始习惯越强,它遵循新规则就越困难。
总结
论文得出结论,当 AI 被要求改变一个词的含义时,它并不会简单地覆盖掉旧知识。相反,这是一场 拔河比赛。旧习惯不断向后拉,而新规则必须努力战斗以保持答案正确。AI 的成功并非通过抹除过去,而是通过在其大脑的特定部分成功地将新含义与单词进行“绑定”,同时尝试让旧习惯安静下来。
简而言之: 你可以告诉机器人一个新规则,但它的旧习惯仍在耳边低语,而机器人必须努力去忽略它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。