想象你拥有一座巨大、超级聪明的图书馆(大型语言模型),它可以用许多不同的“语言”进行阅读和写作。但在这里,“语言”不仅仅指英语、西班牙语或法语。它还意味着Python 代码、数学方程和结构化列表。
研究人员提出的核心问题是:当这座图书馆思考一个逻辑概念(例如“如果 A 则 B")时,无论该概念是出现在故事中、数学题里还是计算机程序中,它是否使用相同的内部“大脑布线”?还是说,每当格式发生变化,它就必须彻底重新连接其大脑?
以下是他们发现的简要解释:
1. 推理的“隐藏核心”
研究人员发现,在这些 AI 模型的深处,存在一个微小而特殊的“核心”区域,真正的逻辑就居住于此,且完全独立于格式。
- 类比:想象你正在听同一首歌曲分别由钢琴、吉他和合成器演奏。在你的耳朵听来,它们听起来截然不同(不同的“表面形式”)。但研究人员发现,在 AI 内部,有一个特定的微小房间,其中存储着歌曲的旋律,其存储方式完全不依赖于乐器。
- 发现:他们在 AI 的中间层找到了这个“房间”。它被称为格式无关推理子空间(FARS)。它极其微小——在 AI 使用的数千个维度中,仅占约10 个维度。然而,这微小的切片承载着纯粹的逻辑,剥离了它是用代码还是散文写成的区别。
2. “魔法交换”实验
为了证明这个核心是真实的并且确实在起作用,他们进行了一项“大脑移植”实验。
- 类比:想象你有两个人:一个说英语,一个说法语。你从说英语者身上取出“逻辑大脑”,并尝试将其植入说法语者的脑中。
- 结果:当他们仅将来自英语句子的10 个特殊维度的“逻辑大脑”交换到数学方程中时,AI 几乎完美地继续工作(90–96% 的情况下)。
- 对比:如果他们交换了整个大脑(所有维度),AI 就会陷入混乱并失败。如果他们交换了随机部分,也会失败。这证明了那特定的 10 个维度是携带跨格式推理的“秘密配方”。
3. “陈述式与过程式”的壁垒
这里有一个最令人惊讶的转折。AI 非常擅长在故事(英语)和数学之间转换逻辑,但在故事和计算机代码之间转换逻辑时却显得吃力。
- 类比:将“陈述式”格式(故事和数学)视为蓝图。它们描述建筑物应该看起来是什么样子。将“过程式”格式(代码)视为机器人的操作手册。它们描述如何一步步地建造它。
- 发现:当 AI 用其他蓝图交换蓝图时(故事 ↔ 数学),其“逻辑大脑”运作得非常好。但当它试图用蓝图交换机器人操作手册时(故事 ↔ 代码),连接就会断裂。AI 将它们视为根本不同类型的思维。
- 结论:障碍并非“语言 vs. 数学”;障碍是**“描述结果”与“给出逐步指令”**之间的区别。
4. 对所有人都是如此
研究人员测试了来自不同公司(如 GPT、Llama 和 Mistral)的五种不同 AI 模型。尽管这些模型的构建方式不同,且训练数据各异,但它们都在大脑中部发展出了相同的10 维“逻辑房间”。
- 类比:这就像人类,无论来自哪个国家,心脏都位于相同的位置,并以相同的方式泵血。尽管 AI 模型是不同的“物种”,但它们都进化出了相同的内部结构来处理纯粹逻辑。
总结
该论文表明,AI 模型确实拥有一个通用的“逻辑中心”,它忽略了你是在用英语、数学还是代码写作。然而,这个中心仅在那些以相同方式描述事物的格式(陈述式)之间运作良好。当试图将描述与逐步指令(过程式)混合时,它就会遇到障碍。
这一发现为我们提供了一种方法,可以确切地看到 AI 是在思考“概念”,还是仅仅在思考“词语”或“语法”。
技术摘要:超越语言:大型语言模型中格式无关的推理子空间
问题陈述
大型语言模型(LLMs)处理以截然不同的表面形式表达的相同逻辑推理——从英语散文和中文文本到 Python 代码和数学符号。虽然先前的研究已证实多语言大型语言模型在不同自然语言之间发展出了共享的内部表示,但尚不清楚这种不变性是否延伸至真正不同的符号系统。核心问题在于:大型语言模型是否拥有一种超越特定符号编码(语言的、形式的和结构的)的通用内部推理基底?如果是,这种结构是否在计算中具有因果作用,并在不同架构间具有普遍性?
方法论
作者引入了TriForm 基准,这是一个受控数据集,包含源自 18 个推理概念(涵盖算术、逻辑、关系、因果和空间领域)的 324 个刺激项。每个概念均通过沿三个维度组织的六种表面形式表达:
- 语言维度:英语、中文和法语散文。
- 符号维度:Python 代码和数学符号。
- 结构维度:结构化的逐步数据。
该研究使用以下分析框架评估了来自三个架构家族(GPT、Qwen、Llama/Mistral)的五个仅解码器大型语言模型(参数量从 16 亿到 80 亿):
- 置换校正的 RSA:为了识别概念层面的结构,作者采用代表相似性分析(RSA)并结合置换检验,以校正成对距离的非独立性,从而区分概念信号与表面形式信号。
- 跨形式探测:在一种表面形式的激活上训练岭回归正则化分类器,以预测另一种形式中的概念身份,从而测试跨格式的线性可解码性。
- 格式神经元熵:受 LAPE 启发,作者通过测量跨形式的激活分布熵来量化神经元特异性,识别出均匀激活(格式无关)的神经元与特定于某些形式的神经元。
- 子空间提取(FARS):使用概念质心主成分分析(PCA)提取格式无关推理子空间。通过计算每个概念在所有形式和实例上的激活平均值,作者分离出前 k 个主成分,这些成分在捕捉概念方差的同时抑制了形式方差。
- 因果干预:研究利用了激活修补和子空间消融。
- 跨形式修补:将源形式(如英语)的隐藏状态替换到目标形式(如数学)中,以测量输出的保留程度。
- 子空间修补:在跨形式传输期间,仅替换投影后的 FARS 分量(10 个维度)。
- 子空间消融:移除 FARS 方向,以测量对模型输出的破坏程度。
主要结果
1. 格式无关推理子空间(FARS)的存在
- 相关性证据:RSA 显示,概念层面的信号在所有模型的中层达到峰值,并随规模扩大而增强。虽然表面形式仍是主导的组织原则(形式 RSA ρ≈0.43–0.53),但概念信号显著(ρ≈0.10–0.20)且随模型规模增长得更快。
- 可解码性:跨形式探测准确率显著高于随机水平(5.6%),最高达到 60.3%(Mistral-7B)。
- 神经元定位:格式无关的神经元集中在中间层(占神经元的 20–23%),这与先前跨语言研究中发现的语言无关神经元的分布相吻合。
2. 因果相关性与子空间效率
- 高保真传输:在跨形式修补期间,仅替换 FARS 子空间的前 10 个维度,即可保留模型前 10 个 token 输出的90–96%。
- 与对照组的比较:这一性能远超全激活替换(44–56%)和方差最大化 PCA 替换(60–74%)。
- 消融实验:移除 FARS 子空间会导致定向破坏(FARS 方向的 KL 散度低,而特定于形式的方向 KL 散度高),证实这些特定维度在跨形式推理中具有因果充分性。
- 维度性:与推理相关的结构确实是低维的,在 1600–4096 维的空间内,其分量数在 k=8–10 处达到平台期。
3. 陈述性与程序性的不对称性
一个关键发现是,兼容性差异基于符号系统的性质而不仅仅是语言:
- 陈述性兼容性:英语散文与数学符号之间的修补保留了**65–73%**的输出。
- 程序性分歧:英语散文与 Python 代码之间的修补仅保留了**16–22%**的输出。
- 结论:分歧的关键轴并非“语言 vs. 形式”,而是陈述性 vs. 程序性。陈述性格式(散文、数学、结构化数据)之间的表示高度兼容,但在跨越到程序性编码(代码)时兼容性显著降低。
4. 普遍性与收敛性
- 泛化能力:从部分概念中提取的 FARS 能够泛化到未参与训练的概念,并表现出平滑的退化。
- 跨架构收敛:不同的模型家族收敛于相同的子空间几何结构。跨模型的典型相关分析(CCA)对所有配对均超过0.79,质心 RSA 超过0.77,为模态内的柏拉图表示假说提供了证据。
意义与主张
本文声称提供了首个系统性证据,证明大型语言模型发展出了一种具体的、低维的、格式无关的推理子空间,该子空间在跨符号传输中具有因果充分性。
- 理论贡献:研究结果支持单模态内的柏拉图表示假说,表明抽象推理的表示在不同符号编码间趋于收敛。
- 机制洞察:对陈述性 - 程序性不对称性的发现完善了对格式不变性的理解,识别出了此前未被表征的陈述性推理(散文、数学)与程序性执行(代码)之间的根本界限。
- 实用价值:FARS 为表示工程提供了一种具体、可提取的工具(一个 10 维基底)。这表明在一个陈述性格式(如英语)中发现的安全干预或导向向量可能通过该子空间转移到其他格式(如数学),但在跨越到程序性格式(代码)时可能会失效,从而突显了一个潜在的安全缺口,即代码中的有害推理可能绕过基于散文训练的过滤器。
作者指出了局限性,包括仅评估了基础模型、FARS 提取的监督性质以及使用程序生成的刺激项,并承认 FARS 在更大规模或经过指令微调的模型中的维度性和几何结构仍是未解之谜。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。