A retrieval conditioned rebinding circuit for dynamic entity tracking in large language models
本文识别并表征了大语言模型中一种以检索为条件的重绑定电路,该电路通过编码和恢复状态变化来实现动态实体追踪,揭示了 Gemma 和 Llama 模型家族中截然不同的表征特征。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一个“猜盒子”游戏,有三个盒子(红、蓝、绿)和三件物品(兔子、袜子、玩具)。
- 设定: 你告诉一个大语言模型(LLM):“红盒子里有兔子。蓝盒子里有袜子。绿盒子里有玩具。”
- 交换: 然后你说:“交换红盒和蓝盒的内容物。”
- 提问: 最后你问:“红盒子里是什么?”
正确答案是袜子。
这篇论文提出了一个引人入胜的问题:AI 究竟是如何算出这个结果的?
两种理论:“重写世界” vs. “魔法指针”
研究人员测试了关于 AI 大脑运作方式的两个主要想法:
理论 A:全局重写(“心理模拟”法)
想象 AI 就像一个人,在听到“交换”时,立即闭上眼睛,擦除脑海中关于世界的整个图像,然后从头开始重新绘制。
- 之前: 红=兔子,蓝=袜子。
- 收到交换指令后: AI 立即更新其内部数据库,使其变为:“好吧,现在 红=袜子 且 蓝=兔子。”
- 回答: 当被问到红盒时,它只需查找新的列表即可。
理论 B:检索条件重绑定(“魔法指针”法)
这是研究发现 AI 实际采用的方法。AI 并没有抹除并重绘整个世界,而是保留了原始列表的原样。
- 技巧: 当你问“红盒里有什么?”时,AI 并不查看原始的“红”标签。相反,它使用了一个魔法指针,这个指针说:“嘿,‘红’现在指向了原来‘蓝’所在的位置。”
- 过程: 它找到原始的“蓝”条目(该条目仍显示为“袜子”),顺着指针走过去,然后抓取袜子。它只在需要回答问题的那个瞬间进行这种特定的计算,而不是在之前。
侦探工作:他们是如何找到这个电路的?
研究人员表现得像是 AI 的神经外科医生,通过使用“因果干预”(基本上是在 AI 思考时对其大脑进行探测和刺激)来观察哪些部分在起作用。
- 追踪路径: 他们发现 AI 并没有更新整个故事。相反,它将原始的“袜子”和“兔子”的事实安全地保存在它们原来的位置。
- 电路: 他们发现了一个微小的、专门的神经元团队(一个“注意力头电路”),它扮演着快递服务员的角色。
- 锚点: 其中一部分记得物品最初在哪里。
- 开关: 另一部分读取“交换”指令。
- 指针: 第三部分充当 GPS。当问题询问“红”时,这个 GPS 会说:“不要看‘红’原来的位置;看‘蓝’原来所在的位置。”
- 检索: 最后,从那个新位置获取答案。
这个电路非常高效。在他们测试的模型中,这个微小的神经元团队(仅占总大脑的 3% 到 10%)就足以完美解决这个谜题。如果移除这个团队,AI 就会陷入混乱。如果只保留这个团队而移除其余的大脑,AI 仍能几乎完美地解决这个谜题。
家族差异:Gemma vs. Llama
研究人员测试了不同的 AI 家族(Gemma 和 Llama),并发现虽然它们都使用相同的“魔法指针”策略,但构建指针的方式不同:
- Gemma 模型: 它们更像是媒人。它们将“查询”(问题)与“键”(记忆)进行匹配,看它们是否契合。如果“红”的问题与“蓝”的记忆相匹配,它们就会建立连接。这是一种双向的握手。
- Llama 模型: 它们更像是档案管理员。它们严重依赖“键”(记忆本身)来携带信息。对于匹配过程,“查询”的作用相对较小。
核心启示
论文得出结论,这些 AI 模型既聪明得令人惊讶,又懒得令人惊讶。每当发生变化时,它们不会浪费能量去不断重写它们对世界的整个理解。相反,它们保持原始事实的安全,并且只在有人提问时才进行快速、有针对性的“重绑定”(将标签重新附着到新位置)。
这就像是一个图书馆,书本永远不会移动。如果你询问一本被移到不同书架上的书,图书管理员不会物理移动那本书;他们只是更新了自己的心理地图,告诉你:“噢,那本书其实现在放在 B 书架上,”然后你就去取书了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。