Revealing Algorithmic Deductive Circuits for Logical Reasoning
本文通过因果中介分析,研究了大语言模型如何进行逻辑推理,以识别检索事实规则的具体注意力头以及整合信息以执行图遍历等全局算法策略的高层注意力头。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个大型语言模型(LLM)是一位才华横溢、速度极快的侦探,他受过专门训练,擅长解决逻辑谜题。你给这位侦探提供几个解题示例,然后让他解决一个新的谜题。他们通常能出色地完成任务,逐步写出自己的思考过程(这种方法称为“思维链”)。
但这里有一个谜团:这位侦探究竟是如何“思考”的?他们是真正理解了逻辑,还是仅仅基于以往见过的模式在猜测?
这篇题为《揭示逻辑推理中的算法演绎电路》的论文,就像一位机械师打开侦探的大脑,观察他们在解决逻辑问题时究竟有哪些齿轮在转动。
侦探的工具箱:“不确定”时刻
研究人员注意到,当侦探解决谜题时,他们写出的大部分词汇都很容易,能以 100% 的把握确定。例如,写出“因此……"或“答案是……"很容易。
然而,存在一些特定的时刻,侦探会犹豫。这些是关键决策点:
- 选择事实:“好的,我应该先查看哪条证据?”
- 停止搜索:“我已经查看了足够的证据,还是应该继续寻找?”
- 选择规则:“哪条规则适用于这个具体情况?”
论文发现,这些正是模型信心最低的时刻。这就像人类侦探停下来思考:“嗯,这条线索符合吗?”研究人员意识到,如果他们能理解模型如何做出这些特定且困难的抉择,他们就能理解整个推理过程。
“脑部扫描”:寻找专用齿轮
为了弄清楚模型内部发生了什么,研究人员使用了一种称为因果中介分析的技术。这就像是为人工智能进行的一次“脑部扫描”。
他们创建了一个场景,其中包含一个“干净”的谜题和一个“被破坏”的谜题(在其中秘密更改了一个事实或一条规则)。然后,他们对模型的内部部件(称为注意力头)玩起了“替换游戏”。
- 他们会将“干净”谜题中模型的“思考”部分提取出来,粘贴到被破坏的谜题中。
- 如果模型突然开始正确解决被破坏的谜题,他们就知道该特定部分负责逻辑推理。
他们的发现:专用装配线
这项研究揭示,模型并非为每项任务使用整个大脑。相反,它使用一个非常具体、小型的专用“齿轮”团队(约占其内部部件总数的3%)来处理逻辑。
他们发现了一个清晰的层级结构,就像工厂里的装配线:
- 早期层(图书管理员):模型的底层部分像图书管理员。他们的工作仅仅是从文本中找到正确的事实和规则,并将它们从书架上取下来。他们不做决定,只是收集信息。
- 中间层(媒人):这些齿轮将事实和规则结合起来,检查它们是否匹配。“事实 A 是否符合规则 B?”
- 高层(管理者):顶层部分像项目经理。他们不关注单个事实,而是关注大局。他们决定整体策略,例如“让我们使用广度优先搜索”(同时检查所有选项)或“让我们先深入一条路径”。他们协调所有底层齿轮来解决整个谜题。
“敲除”测试
为了证明这些齿轮确实是必要的,研究人员进行了一项“敲除”实验。他们暂时禁用了负责逻辑的那 3% 的特定齿轮,然后让模型再次解决谜题。
- 结果:模型解决逻辑谜题的能力崩溃了。它从一位才华横溢的侦探变成了连谜语都解不开的人,通常只是随机猜测。
- 转折:当他们让模型回答常识性问题(例如“谁是第一位总统?”)时,它几乎没注意到缺失的齿轮。它仍然能很好地回答这些问题。
这证明这些特定齿轮专门用于逻辑推理。它们不仅仅是通用的“智能”部件,而是用于演绎推理的专用工具。
大局观
该论文得出结论,当大型语言模型仅从少量示例中学习推理时,它不仅仅是在记忆答案。它实际上是在“学习”激活一个特定的、稀疏的内部电路网络,该网络模仿算法(一种逐步执行的计算机程序)。
- 低层收集数据。
- 中层检查规则。
- 高层运行策略。
这就像模型内部隐藏着一个微小的逻辑专家团队,只有当你要求它解决谜题时他们才会苏醒,像一台运转良好的机器一样协同工作,以寻找真相。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。