← 最新论文
💬 NLP

LMs as Task-Specific Knowledge Bases: An Interpretability Analysis

本文通过行为与机制分析,挑战了将语言模型视为统一知识库的观点,证明了事实性知识是以任务特定方式进行编码的,即不同的参数子集会根据查询上下文被激活,从而削弱了事实检索的一致性与可靠性。

原作者: Amit Elhelo, Amir Globerson, Mor Geva

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Amit Elhelo, Amir Globerson, Mor Geva

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一本巨大的、超级聪明的百科全书,它几乎读遍了互联网上的所有内容。你可能会把这本百科全书看作一个完美的图书馆,每一个事实都存储在一个特定的位置。如果你问:“法国的首都是哪里?”或者“巴黎是法国的首都是吗?”,你期望这个图书馆能从同一个架子上取出完全相同的文件,并给出相同的答案。这就是传统数据库的工作方式:一个真相,一个来源。

这篇论文调查了大型语言模型(LLM)——即像聊天机器人这类工具背后的 AI 大脑——是否也像这样一个完美的图书馆。研究人员 Amit Elhelo、Amir Globerson 和 Mor Geva 发现,事实并非如此。

AI 的“知识”并不是一个单一、统一的图书馆,而更像是一系列专门的、针对特定任务的工具箱。以下是他们研究结果的拆解,使用了简单的类比:

1. “不同工具箱”类比

想象你有一个瑞士军刀。它有一个螺丝刀、一个刀片和一个开瓶器。

  • 传统观点: 你可能认为“如何打开瓶子”的知识存储在刀具的一个核心部分。
  • 论文的发现: AI 实际上像是一个工具箱,只有当你被要求“打开瓶子”时,“如何打开瓶子”的知识才会存储在开瓶器中。但如果你问“这是一个开瓶器吗?”(一种不同类型的提问),AI 会使用一套完全不同的工具来回答,尽管这个问题也是关于同一个物体。

研究人员通过以不同的方式询问 AI 同一个事实(例如“巴黎是法国的首都是”)来测试这一点:

  • 生成(Generation): “法国的首都是哪里?”(AI 必须写出答案)。
  • 判别(Discrimination): “巴黎是法国的首都是吗?是或否。”(AI 必须做出选择)。

他们发现,AI 经常在“书写”任务中学会了这个事实,但在“选择”任务中却无法“掌握”它,反之亦然。这就像 AI 有一个“写作大脑”和一个“选择大脑”,而这两个大脑并不总是互通的。

2. “训练营”观察

研究人员观察了 AI 随着时间的推移如何学习,就像教练观察学生为不同考试而学习一样。

  • 预期: 如果学生在写作考试中学会了“巴黎是首都”,那么他们在随后的选择题考试中也应该立即知道这一点,因为这是同一个事实。
  • 现实: 学生往往通过了写作测试,但在几天后的多项选择测试中却失败了。知识并没有“共同出现”(co-emerge,即同时出现在不同形式中)。这表明 AI 并不是将事实存储在一个中心位置;它是在学习针对特定类型问题处理该事实的特定方式。

3. “手术”实验(机械论分析)

为了证明这一点,研究人员对 AI 的大脑(其内部参数)进行了“手术”。他们试图寻找负责在特定方式下回答“巴黎是法国首都”这一事实的微小且特定的神经元组。

  • 结果: 他们发现了针对每种任务的截然不同、独立的神经元组。
    • 如果他们“关闭”了用于“书写”任务的神经元,AI 会忘记书写问题的答案,但仍能完美回答“是/否”问题。
    • 如果他们“关闭了”用于“是/否”问题的神经元,AI 会在那个测试中失败,但仍能写出答案。
  • 隐喻: 这就像为同一扇门准备了两把不同的钥匙。一把钥匙在你从左边推门时可以开门;另一把钥匙在你从右边拉门时可以开门。如果你丢了“推”的那把钥匙,即使“拉”的那把钥匙还能用,门也会因为无法执行“推”的动作而被锁住。

4. “思维链”的惊喜

论文还研究了“思维链”(Chain of Thought, CoT)推理,即要求 AI 在回答之前“逐步思考”。

  • 发现: 当 AI 被要求大声思考时,它似乎使用了这些不同工具箱的混合体。如果你移除用于最终答案的特定神经元,AI 通常仍能通过“思考”问题来得到正确答案,因为它正在借用那些在直接回答时通常不会使用的其他任务特定工具箱中的知识。
  • 类比: 这就像一名侦探,通常通过观察单一线索来破案(直接回答)。但如果被迫写一份完整的报告(思维链),他们就会开始检查其他文件并交叉引用不同的工具箱,这有助于他们在主要线索缺失的情况下解决案件。

核心结论

论文得出结论,认为 AI 是一个“知识库”(单一事实来源)的想法是一个谬误。相反,AI 所知道的内容与其被提问的方式是交织在一起的。

  • 可靠性风险: 如果你修改 AI 以让它在一种类型的提问中(如多项选择题)“忘记”一个事实,它在写作提示中可能仍然会记得该事实。
  • 评估风险: 如果你只在一种类型的提问上测试 AI,你可能会认为它掌握了一个事实,但当以另一种格式提问时,它可能完全一窍不通。

简而言之,AI 并没有一个单一、统一的记忆。它拥有一个由专门记忆组成的拼凑体,每种记忆都针对提问的特定方式进行了调整。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →