One Mask to Rule Them All: On Hidden Facts after Editing and How to Find Them
本文揭示,Transformer 模型中多样化的知识编辑(如 ROME 和 MEMIT)依赖于一个共同的权重功能子空间,该子空间通过抑制后续层中的过度关注而非覆盖知识来实现编辑,这一机制可通过二值掩码进行隔离,从而逆转编辑并为防范非预期修改提供依据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个大型语言模型(就像驱动本次对话的模型)是一座庞大、高科技的图书馆。在这座图书馆里,事实被存放在书架上。通常,如果你问“谁发现了镭?”,图书馆的内部系统会找到标有“玛丽·居里”的书架上的书,并将其递给你。
最近,科学家们开发了一种无需重建整座图书馆即可“编辑”它的方法。他们使用的方法被称为ROME和MEMIT。其设想是:这些方法会找到存放“玛丽·居里”这本书的具体书架,将其取下,并换上一本写着“氪”的新书。
这篇论文背后的研究人员想知道:他们是真的替换了那本书,还是仅仅在旧书上盖了一个牌子?
重大发现:这是劫持,而非替换
该论文认为,ROME 和 MEMIT并没有真正擦除或覆盖原始知识。相反,它们“劫持”了图书馆的注意力系统。
以下是类比:
想象图书馆有一套非常响亮、闪烁的聚光灯系统(即注意力机制),它引导图书管理员找到正确的书。
- 旧观念:你以为编辑者是在悄悄替换书架上的书。
- 现实:编辑者根本没有碰那本“玛丽·居里”的书。相反,他们直接在“氪”这本书上方安装了一个刺眼、闪烁的聚光灯。这束光如此强烈,迫使图书管理员的眼睛只能看向“氪”。“玛丽·居里”的书依然完好无损地放在书架上,但图书管理员看不见它,因为聚光灯太分散注意力了。
论文将这种现象称为**“过度关注”。这种编辑是通过迫使模型对新的事实过度**关注来起作用的,从而有效地淹没了旧事实,而不是删除旧事实。
“一个面罩统治一切”
为了证明这一点,研究人员试图找到关闭聚光灯的“开关”。他们训练了一个微小的数字面罩(可以把它想象成给模型戴的一副太阳镜或眼罩)。
- 实验:他们拿着这副太阳镜,尝试将其应用于数千种不同的编辑(将“玛丽·居里”改为“氪”,将“埃菲尔铁塔”改为“大本钟”等)。
- 结果:这单一的面罩在几乎所有案例中都奏效了!当他们给模型戴上这副面罩时,刺眼的聚光灯就熄灭了。突然间,图书管理员又能看到原始的“玛丽·居里”这本书了。
- 证据:该面罩在训练集上逆转了约80%的编辑,在新颖的、未见过的编辑上逆转了70%。
这非常重大,因为它意味着所有这些不同的编辑都依赖于同一个微小的机制。它们并没有重写整座图书馆的目录;它们只是都打开了同一种类型的刺眼聚光灯。
“反向开关”测试
为了绝对确定这束聚光灯是编辑的原因(而不仅仅是副作用),研究人员尝试了一个巧妙的做法:他们在尝试编辑模型之前,先给模型戴上太阳镜。
- 结果:编辑失败了。模型拒绝输出新的事实(“氪”)。成功率从98% 降至 38%。
- 含义:这证明了“刺眼的聚光灯”不仅仅是一个副作用;它是使编辑生效的核心引擎。如果你挡住了聚光灯,编辑就无法发生。
为什么这很重要
- 知识并未消失:原始事实仍然存在于模型的记忆中,只是被一层噪音墙隐藏了起来。这解释了为什么经过编辑的模型有时会在被以棘手的方式提问时“失言”,说出旧的事实。
- 没有连锁反应:因为编辑者并没有真正重写图书馆的目录(知识图谱),所以这些变化不会扩散到相关事实上。如果你改变了法国的首都,模型并不会自动更新其关于法国地理的知识;它只是强迫你去看那个新首都。
- 一种防御机制:由于所有这些编辑都使用同一种“刺眼聚光灯”技巧,我们可以利用这单一的面罩来检测不需要的编辑,或者在它们发生之前完全阻止它们。这就像为 AI 模型配备了一个通用的“反劫持”工具。
总结
该论文揭示,当前的 AI 编辑工具并没有真正删除旧事实。它们只是安装了一个非常响亮、分散注意力的聚光灯,迫使 AI 忽略真相并专注于新的谎言。通过找到一个能关闭这束聚光灯的微小“面罩”,研究人员表明,他们不仅可以恢复原始真相,甚至可以在新的谎言被安装之前就加以阻止。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。