Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models
本文对语言模型中的记忆内知识冲突进行了机制研究,揭示了虽然此类冲突通常通过不同的电路而非统一机制在最终层得到解决,但由于专门化注意力头分布的差异,干预措施在处理现实世界冲突时显著不如处理合成冲突时有效。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个巨大的数字大脑,它几乎阅读了互联网上的所有内容。这个被称为“大语言模型”(LLM)的数字大脑,就像一位超级聪明的图书管理员,能够回答问题、编写故事并解决问题。但问题在于:有时这位图书管理员会感到困惑。如果你问:“尼尔斯(Niels)在哪里上学?”图书管理员可能会同时记起两个不同的答案。也许它记忆的一部分说“A大学”,而另一部分却坚持说是“B大学”。这并不是因为图书管理员在看一本新书(外部信息),而是因为图书管理员自己的内部笔记很乱。科学家们称之为“内部记忆知识冲突”(intra-memory knowledge conflict)。这有点像在同一个笔记本里写了两个不同版本的同一个故事,而图书管理员不知道该读出哪一个。这件事情非常重要,因为如果这些人工智能系统要被信任用于现实世界的任务,它们就必须停止产生幻觉或给出矛盾的答案。研究人员想要知道:这种困惑究竟发生在数字大脑的哪个位置,以及我们能否修复导致混乱的具体部分?
这篇题为《知识在哪里碰撞》(Where Knowledge Collides)的论文,深入探讨了这些人工智能大脑的内部运作机制,以寻找混乱的源头。作者利用四个不同的AI模型构建了一个特殊的测试场。他们创建了一个虚假传记数据集——可以将其想象为为不存在的人编写的虚构维基百科页面——并在其中刻意植入了冲突的事实。例如,他们告诉AI一个名叫“尼尔斯·卡瓦利”(Niels Cavalli)的虚构人物毕业于“乌科普姆大学”(University of Ukopnwm),但随后又告诉AI,同一个尼尔斯毕业于“奥夫格拉格大学”(University of Ohfgrgr)。通过用这些混杂的故事训练AI,他们创造了一个受控环境,让模型必须在脑海中同时持有两个对立的事实。
为了弄清楚发生了什么,研究人员使用了一种名为“机械可解释性”(mechanistic interpretability)的技术。把AI想象成一座多层结构的工厂,信息从底层向上层流动。每一层都有工人(称为“层”/layers),而每一层内还有专门的小组(称为“注意力头”/attention heads)来处理工作的不同部分。研究人员使用了一个名为“逻辑透镜”(logit lens)的工具,在工厂的每一层进行观察,观察AI的信心度如何随着处理问题的过程而变化。他们发现了一件非常一致的事情:冲突并没有发生在工厂的开头或中间。相反,冲突总是在最后几层爆发。这就像是AI在大部分时间里都在收集事实,但在快要开口说话前的最后关头,两个相互冲突的记忆撞在了一起,导致模型开始摇摆并变得不确定。
团队随后尝试通过“修补”(patching)来解决这个问题。这就像伸手进入工厂,用一个知道正确答案的小组的工作来替换掉某个特定小组的工作。他们尝试了两种主要方法:修复整个楼层(层级干预)或仅修复一个特定的团队(头级干预)。结果很明确:修复整个楼层效果尚可,但修复特定的团队效果要好得多。事实上,通过针对负责错误事实的特定“注意力头”进行干预,他们能够以极高的成功率引导AI走向正确的答案。他们甚至发现,在他们那个虚假的、受控的世界里,经常存在着只关心某一个特定事实的“专家型”注意力头。然而,当他们尝试将此应用于现实世界的数据(使用一个名为DynamicQA、包含真实且混乱的人类知识的数据集)时,这些修复措施的效果就没那么好了。这表明,现实世界的冲突比他们在实验室里创造的那些干净的合成冲突更加错综复杂,也更难理清。
论文中反对的一个非常有趣的观点是关于“通用电路”(universal circuit)的概念。你可能会认为,所有的AI模型都有一个特定的、专门的开关或路径来处理所有的知识冲突,就像一个“冲突解决按钮”一样。作者指出,这可能并不成立。相反,他们的发现指向这样一个观点:不同的知识片段存储在不同的、分离的电路中。AI给出的最终答案取决于你的问题触发了哪一个竞争电路中更强的信号。这里不存在一个单一的“冲突管理者”;这更像是不同工作小组之间的一场拔河比赛,谁拉得最用力,谁就赢。
研究人员还注意到,其中一个模型(GPT-2 XL)比其他模型更难修复。他们认为这并不是因为它坏了,而是因为它规模更大。它拥有更多的“工人”(注意力头),因此需要修复更多的它们才能看到与较小模型相同的效果。这就像是在一个小村庄和一座大城市里处理交通堵塞:你需要清理掉更多的车辆才能让大城市的交通重新流动起来。
最后,这项研究为我们提供了关于这些内部冲突发生位置的第一张真实地图。它告诉我们,事实之间的战斗发生在AI思考过程的终点线处。虽然我们目前还无法完美地修复现实世界中这些复杂的冲突,但论文表明,通过针对负责错误事实的微小特定团队进行干预,我们可以让这些人工智能系统变得更加可靠。这是朝着构建一个不仅听起来聪明,而且真正了解自己在说什么的AI迈出的关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。