← 最新论文
💻 computer science

Friends and Grandmothers in Silico: Localizing Entity Cells in Language Models

该论文通过在多个语言模型中定位并干预早期层的选择性 MLP 神经元,证实了这些稀疏的神经单元构成了实体事实性知识的因果访问点,能够支持从别名到多语言形式的鲁棒实体检索与记忆恢复。

原作者: Itay Yona, Dan Barzilay, Michael Karasik, Mor Geva

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Itay Yona, Dan Barzilay, Michael Karasik, Mor Geva

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大型语言模型(LLM)做了一次“大脑核磁共振”,试图找到它们记忆具体事实(比如“奥巴马是谁”或“巴黎在哪里”)时,大脑里具体是哪几个“神经元”在起作用。

为了让你更容易理解,我们可以把语言模型想象成一个巨大的、由数百万个乐高积木(神经元)搭建而成的超级图书馆

1. 核心发现:寻找“祖母细胞” (The Grandmother Cell)

在神经科学里,有一个著名的假说叫“祖母细胞”:意思是说,当你看到你的祖母时,你大脑里可能只有一个特定的神经元在疯狂放电,告诉你“这是奶奶”。

这篇论文的研究人员问:语言模型里也有这种“超级神经元”吗? 也就是说,当模型提到“奥巴马”时,是不是也有那么一两个特定的积木,专门负责唤醒关于奥巴马的所有记忆?

答案是:有的,而且它们藏得很深(或者说很浅)。

2. 他们是怎么做的?(侦探游戏)

研究人员在 7 种不同的语言模型里,对 200 个热门人物、地点和事物(比如奥巴马、巴黎、FBI)进行了“捉迷藏”游戏:

  • 第一步:定位(Localization)
    他们给模型看各种关于同一个实体的句子(比如“奥巴马的出生地”、“奥巴马的配偶”、“奥巴马的政党”)。他们发现,无论怎么问,在模型处理“奥巴马”这个名字的最早期阶段(也就是模型的前几层,相当于大脑刚接收到信号的时候),总有一个特定的神经元会特别兴奋。

    • 比喻: 就像你刚听到“妈妈”这个词,大脑里某个特定的开关“咔哒”一声就亮了,不管后面是问“妈妈喜欢吃什么”还是“妈妈多大岁数”。
  • 第二步:破坏(Ablation - 让它“失忆”)
    他们把这个特定的神经元“关掉”(或者让它反向工作)。

    • 结果: 模型突然“失忆”了!它依然能流利地说话,但一提到“奥巴马”,它就完全想不起关于他的任何事实了。就像你拔掉了一个特定的开关,整个关于奥巴马的档案室瞬间断电。
    • 关键点: 这种失忆是针对特定对象的。关掉“奥巴马”的神经元,不会让模型忘记“特朗普”是谁。
  • 第三步:激活(Injection - 强行“唤醒”)
    反过来,他们在一个本来不知道答案的句子里,强行把这个“奥巴马神经元”的信号插进去。

    • 结果: 模型突然就能回答关于奥巴马的问题了!哪怕它原本没学过这个答案。
    • 比喻: 就像你不需要把整个图书馆的书都搬出来,只要把那个特定的“索引卡”插进机器里,机器就能立刻调出所有关于奥巴马的信息。

3. 有趣的发现:这些神经元很“聪明”

研究人员还发现,这些“实体神经元”非常抗造

  • 不怕拼写错误: 就算你写错成"Obaama",那个神经元依然会亮。
  • 不怕缩写: 提到"FBI"和“联邦调查局”,激活的是同一个神经元。
  • 不怕外语: 用中文、希伯来语或阿拉伯语提到“巴黎”,激活的也是同一个神经元。

比喻: 这说明模型里存的不是死板的“文字字符串”,而是一个抽象的“身份概念”。就像你不管用中文、英文还是手语叫“妈妈”,你大脑里那个识别“妈妈”的开关都会亮。

4. 局限性:不是所有东西都有“专属开关”

虽然这个现象很神奇,但并不是万能的:

  • 热门才有: 只有像奥巴马、巴黎这种非常流行、大家经常讨论的实体,才容易找到这种“专属开关”。冷门的小众事物,可能没有这么清晰的单一神经元。
  • 模型不同,效果不同: 在 Qwen2.5-7B 这个模型里,这种现象最明显。在其他模型里,虽然也能找到类似的神经元,但效果没那么“干脆利落”。

5. 总结:这意味着什么?

这篇论文告诉我们,语言模型并不是像我们以前以为的那样,把知识像撒胡椒面一样均匀地分布在所有参数里。相反,对于很多常见的事实,模型内部存在一种**“稀疏的、可操作的访问点”**。

  • 以前: 我们以为模型记知识是靠“慢慢积累”,层层递进。
  • 现在: 我们发现,对于很多实体,模型在最早期就建立了一个**“身份锚点”**。只要激活这个锚点,相关的知识就会像被打开的闸门一样涌出来。

这对我们有什么用?
这就好比我们终于找到了控制模型记忆的“总开关”或“快捷方式”。未来,如果我们想修改模型对某个人的看法,或者修复它的错误记忆,可能不需要重新训练整个庞大的模型,只需要精准地调整这几个关键的“神经元”就够了。这为让 AI 更可控、更安全提供了新的思路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →