Extracting Algorithms in Pre-trained LLMs: A Case on Hidden Markov Models
本文通过经验性地缩小候选算法范围、理论上验证其 Transformer 实现方式,并引入主激活探针(Principal Activations Probe)以识别并因果操纵驱动这些预测的低维线性表示,从而弥合了预训练大语言模型在隐马尔可夫模型上的上下文学习性能与其内部机制之间的鸿沟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解谜题的侦探,但你寻找的不是指纹,而是巨大计算机大脑内部那些无形的“思想”。这个科学领域被称为机械解释性(mechanistic interpretability),它提出了一个简单但棘手的问题:机器究竟是如何思考的? 为了理解这篇论文中的谜团,我们首先需要知道这台机器试图解决什么问题。它正在玩一个叫做**隐马尔可夫模型(Hidden Markov Models, HMMs)**的游戏。把 HMM 想象成一种你看不到天空的天气预报。你只能看到地面:地面是湿的还是干的?草是绿的还是褐色的?“隐藏”的部分是实际的天气(晴天、雨天、阴天),你看不见天气,但天气会导致地面呈现出那样的样子。计算机的任务就是通过观察一段长期的湿草地和干路面的历史,来猜测下一个时刻的天气会是什么。
有一段时间,科学家们知道巨大的大语言模型(LLMs)——也就是我们每天使用的超智能 AI 聊天机器人——在玩这个猜谜游戏时表现得极其出色。随着上下文长度的增加,它们的预测结果趋近于理论上的最佳性能(即“先知”水平),甚至经常超越了应用于相同数据的经典推理算法。但没人知道它们究竟是怎么做到的。AI 是秘密学习了概率规则吗?是在记忆模式吗?还是在使用某种奇特的、全新的技巧?这就像是在看一位魔术师从帽子里变出一只兔子,而你完全不知道里面是一个隐藏隔层、第二只兔子,还是一段魔咒。这篇论文是研究人员第一次成功窥视魔术师的帽子,看清 AI 到底在使用什么样的把戏。
研究人员设计了一个大规模实验来查明 AI 的秘密策略。首先,他们让 AI 对照一份已知的“嫌疑人名单”——即人类用来解决这类天气猜谜游戏的各种数学算法。他们发现,没有任何一种单一的人类算法能在所有情况下都解释 AI 的行为。有时 AI 表现得像一个简单的模式匹配器,而有时又表现得像一个复杂的概率追踪器。这将嫌疑名单缩小到了三种主要的策略类型。
接着,团队提出了一个理论性问题:Transformer(这些模型所使用的特定 AI 架构)真的能够执行这三种策略吗?他们在数学上证明了答案是肯定的。他们甚至构建了一个微小的、简单的 AI 版本,并仅针对一种特定的天气模式对其进行训练。当他们观察这个微型 AI 的大脑时,发现它自然而然地学会了使用一种“有限窗口(finite-window)”策略——基本上,它是在观察最后几个线索(比如最后 6 到 8 个观测值)来做出猜测,而不是试图去记忆整个宇宙的历史。
但真正的魔法发生在他们观察那些巨大的、预训练好的 AI 模型(即那些已经懂得如何与我们交流的模型)时。他们发明了一种名为**主激活探针(Principal Activations Probe, PAP)**的新工具。想象一下 AI 的大脑是一条拥有 28 条不同车道(层)的巨型高速公路。PAP 就像一个传感器,它可以拦截任何一条车道的交通,检查流经其中的信息,甚至可以将该信息与另一种场景进行交换,以观察是否会改变 AI 的想法。
他们的发现非常迷人,也有些令人惊讶。AI 并不是一直使用同一种策略;它会根据谜题的难度调整其内部表示。
- 简单模式: 当天气线索非常清晰且地面变化具有可预测性(低“熵”)时,AI 的行为符合简单的**二元语法(Bigram)**统计规律。它实际上只是观察最后看到的那个事物,以此来猜测下一个。
- 困难模式: 当线索充满噪声且令人困惑(高“熵”)时,AI 会依赖一种更复杂的策略,称为软 n-gram(Soft n-gram)。它开始追踪关于隐藏状态的“信念(belief)”,并在一段较短的近期历史窗口内整合信息。这就像是意识到地面是湿的,但同时也记得昨天是晴天,所以它猜测是“阴天,可能有雨”。
至关重要的是,研究人员证明了 AI 不仅仅是在存储这些信念;它实际上是在利用这些信念来进行决策。他们通过“补丁(patching)”技术实现了这一点:他们从一个难题中提取出“信念”信息,并将其粘贴到正在解决简单问题的 AI 大脑中。AI 的预测立即发生了变化,变得与那个难题的答案一致。这表明,“信念”不仅仅是一个旁注,它是驱动预测的核心引擎。然而,他们也发现了一个关键的区别:在“困难模式”下,简单的二元语法策略虽然存在于早期层中,但会被模型的下游计算过程有效地绕过。只有当真实的确定性需求出现时,AI 才会忽略简单的模式,转而使用更丰富的信念追踪。
不过,他们也发现了一个转折。在 AI 大脑的早期层中,“信念”信息确实存在且易于读取,但 AI 却忽略了它!这就像是在仪表盘上放了一张地图,但开车时却只盯着窗外看。AI 直到大脑的后期层才开始使用那张地图。这意味着,仅仅因为你能从计算机的大脑中找到一个想法,并不代表计算机实际上正在使用那个想法进行思考。
最后,这篇论文表明,这些巨大的 AI 并不是在对世界进行复杂的、完美的数学模拟。相反,它们学会了成为非常高效的近似器。它们学会了观察一段较短的近期历史,并更新关于正在发生什么的“信念”,就像人类可能会做的那样。它们不需要成为完美的统计学家,就能在预测下一个词或下一个天气事件方面表现得极其出色;它们只需要擅长追踪即时过去即可。这一发现帮助我们理解,这些模型的“魔力”实际上是一个非常结构化、可理解的过程,即追踪模式的过程。这让我们离真正理解这些数字心智的工作方式又近了一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。