在快速发展的人工智能领域,大型语言模型已经能够解决复杂的谜题并回忆海量的信息。科学家们长期以来一直好奇这些数字大脑究竟是如何运作的。一种盛行的观点认为,特定的行为(如逻辑推理或简单的事实检索)与模型内部记忆中特定的、固定的路径相关联。想象一下模型的思维是一个广阔的多维空间,其中的每一个想法都会留下痕迹。如果这个观点成立,那么一个模型在思考数学问题与另一个模型仅仅是在回忆事实之间的区别,应该表现为指向特定方向的一条单一且笔直的线。这个概念如此具有吸引力,以至于一些研究人员试图利用这些固定的线条作为引导来训练模型更好地思考,假设他们找到的路径将会保持稳定和可靠。
然而,一项新的研究挑战了这些路径保持不变的假设。研究人员仔细观察了一个小型语言模型,具体是被称为 Qwen3-0.6B 的版本,以观察当该模型接受严格训练时,这种固定方向的观点是否依然成立。他们收集了一组精心平衡的 400 个示例,其中一半需要逻辑推理,另一半需要事实检索。通过剥离掉诸如句子长度或特定词汇等干扰因素,他们确保所发现的任何差异都是真正关于思维类型本身的。他们的第一个发现是令人宽慰的:他们证实了在任何单一的时间点,推理与记忆之间的区别确实非常清晰,以至于一条直线可以完美地将这两组区分开来。事实上,这条简单的直线与一种观察数据所有可能角度的高维复杂分析一样有效。
故事发生了转折,研究人员使用了一种被称为组相对策略优化(group-relative policy optimization)的强大技术来训练模型,这种方法旨在提升推理能力。他们曾预期,如果这种固定方向的观点成立,那么分隔推理与记忆的线条即使在模型学习过程中也会保持在原处。相反,他们发现虽然模型仍然能完美地辨别这两种任务之间的区别,但其知识的实际方向却发生了剧烈的偏移。训练之后,那条曾经清晰指向“推理”的线已经旋转到了如此程度,以至于它不再与原始位置对齐。平均而言,新的方向与旧的方向仅有约 45% 的相似度,而在模型最深的层级中,这种偏移更为显著,其内部表示的漂移超过了一半。
这一发现揭示了模型“知道什么”与“如何存储知识”之间的关键区别。信息本身并未消失;模型在训练后仍然能以完美的准确度区分数学问题和常识问题。但是,它用来表达这种区别的几何坐标已被完全重组。这就像是一张城市地图依然能完美地告诉你图书馆的位置,但地图上的指南针方向已经旋转了,使得“北”现在指向了原来“东”的方向。研究人员通过比较模型训练前后的内部状态来测量这种偏移,发现这种变化不仅仅是微小的调整,而是模型内部景观的一次实质性的重组。
该研究得出结论,虽然分离推理与记忆的能力是稳健的,但认为这种能力依赖于单一且不变的方向这一观点是不正确的。信息依然存在,但它在模型思维中行进的具体路径是流动的,并随着学习而改变。这表明,对于未来利用这些内部方向来引导人工智能的努力,科学家们不能仅仅找到一条路径后就假设它将保持有效。相反,他们必须接受地图本身在不断被重新绘制,即便其中的地标保持不变。知识的稳定性并不保证其访问路径的稳定性。
技术摘要:超越固定方向
问题陈述
机械解释性(mechanistic interpretability)与强化学习(RL)领域的近期研究提出,大型语言模型(LLM)中的高层行为差异(例如推理导向型任务与事实召回型任务之间的区别)可以通过激活空间中的一个单一且固定的方向来表征。诸如 DiRL 等方法利用此类方向作为组相对策略优化(GRPO)过程中的固定几何锚点,以引导探索。
本文研究了“固定方向”假设中两个底层假设的有效性:
- 可分性(Separability): 推理导向型任务组与事实召回型任务组之间的区别是否可以由跨 Transformer 层的一个单一线性方向来捕捉?
- 稳定性(Stability): 在 RL 训练之前识别出的特定方向,在模型经过 GRPO 训练后是否仍保持几何对齐?
作者区分了可解码性(decodability)(信息是否存在于表示中)与方向稳定性(directional stability)(编码该信息的特定向量是否保持不变)。
研究方法
模型与数据
- 模型: 本研究使用 Qwen3-0.6B。在稳定性分析(RQ2)中,将基座模型与公开发布的 GRPO 训练检查点(
x32/Qwen3-0.6B-GRPO-GSM8K-Think)进行对比。
- 数据集: 构建了一个受控数据集(400 个样本:200 个推理导向型,200 个事实召回型)。
- 推理类: 源自 MATH-500 和 GSM8K。
- 事实召回类: 源自 PopQA 和 TriviaQA。
- 控制变量: 为了消除 token 长度这一混淆变量(此前在不受控设置下产生了约 0.965 的准确率),作者采用了长度匹配程序,使用宽度为 10 的 token 长度分桶。这产生了一个平衡的集合,其中表面词汇和长度得到了控制,尽管词汇/领域相关性仍然存在。
实验设计
本研究旨在解决两个研究问题(RQs):
RQ1:单方向可分性
- 方向构建: 使用两种方法在每个的 28 个 Transformer 层定义分离方向:
- 均值差方向(Mean-Difference Direction): 类均值隐藏状态之间的向量差。
- 探针权重方向(Probe-Weight Direction): 用于对任务组进行分类的逻辑回归探针的权重向量。
- 评估: 作者将这些一维投影的性能与全维度 1024 维线性探针(逻辑回归)进行了比较,并使用留出分层交叉验证进行评估。
- 控制实验: 实验包含了仅限长度的分类器、TF-IDF 词汇分类器以及随机标签探针,以确保信号并非流水线产生的伪影。
RQ2:GRPO 后的方向稳定性
- 稳定性指标: 作者计算了从基座模型和 RL 训练模型中提取的方向之间的余弦相似度:
- 均值差方向之间的相似度 (cos(d^B,d^RL))。
- 探针权重方向之间的相似度 (cos(w^B,w^RL))。
- 表示漂移(Representation Drift): 为了测量独立于任务标签的更广泛几何变化,他们计算了两个检查点中相同输入示例的匹配隐藏状态之间的平均余弦距离。
- 可解码性检查: 他们验证了在 RL 模型中任务组是否仍然可解码,使用的是专门针对 RL 表示训练的探针。
核心结果
RQ1:单方向可解码性
- 完美可分性: 在受控的 400 个样本数据集上,单向投影(使用均值差或探针权重方向)实现了 AUROC = 1.00,达到了与全维度 1024 维探针相同的性能。
- 层级表现: 最佳均值差方向出现在第 18 层,最佳探针权重方向出现在第 12 层。两者均达到了接近完美的准确率(0.9975)和 AUROC(1.0000)。
- 控制变量验证: 虽然长度分类器在匹配后准确率降至
0.65,但 TF-IDF 基准线依然保持强劲(0.96 准确率),表明词汇和领域结构仍与任务标签相关。然而,隐藏状态分类器的表现优于 TF-IDF,证实了这种分离不仅仅是由于表面词汇引起的。
- 结论: 在该模型状态下,推理/事实召回的区分近似于单方向可分的。
RQ2:几何不稳定性
- 方向旋转: 尽管在 RL 模型中具有完美的解码能力,但承载该区别的特定方向并未保持稳定。
- 基座模型与 RL 模型之间的均值方向余弦相似度平均为 0.453(中位数 0.492)。
- 探针方向的余弦相似度平均为 0.445(中位数 0.439)。
- 最小相似度降至 ~0.17,表明在某些层中接近正交。
- 表示漂移: 更广泛的表示也发生了显著偏移。表示漂移(1 - 隐藏状态的余弦相似度)随深度增加,在最后一层(第 28 层)达到 0.511。
- 可解码性保留: 至关重要的是,专门在 RL 表示上训练的探针仍然实现了 AUROC = 1.00。
- 结论: 区分任务组的信息在 RL 后得到了保留,但用于编码该信息的几何坐标(特定的方向向量)发生了实质性的重组。
核心贡献
- 受控协议: 作者从不受控的数据集对比(受 token 长度混淆)转向了严谨的、长度匹配的多数据集评估(400 个样本),以隔离语义表示与表面特征。
- 估计器的直接比较: 本研究直接比较了均值差方向(闭式统计量)与学习到的探针方向(判别优化)在所有 28 层中的表现,发现它们高度对齐(余弦相似度 ~0.85)但又有所不同。
- 信息与几何的分离: 本文提供了经验证据,证明信息保留并不意味着几何保留。一个方向可以在一种模型状态下是有效的分离器,但在 RL 后的状态下在几何上是截然不同的(发生了旋转),即便该信息仍然是完全可解码的。
意义与主张
本文对 DiRL 等方法中所使用的“固定方向”假设提出了一个适度的、具体的质疑:
- 拒绝不变性: 研究挑战了将从基座模型中提取的方向视为**机械不变性(mechanistic invariant)**的假设。在基座模型中被识别为“推理方向”的特定向量,在 GRPO 训练后的模型中并不是同一个向量。
- 验证可解码性: 研究确认了关于推理/事实召回区别的信息在 RL 后在隐藏状态中仍然是可获取的。
- 对 RL 方法的启示: 作者认为,将预训练方向解释为持久的、固定的几何锚点是一个应当被测量而非预设的经验性假设。虽然固定锚点对于引导探索(如 DiRL 所提议的)可能仍然具有操作上的用途,但不应假设它在整个训练过程中代表同一个机械轴。
- 区分: 结果支持了“推理可以由单模型状态下的一个方向来表示”的假设,但反驳了“该方向在训练干预过程中保持固定”的假设。
作者明确表示,他们并非声称发现了因果性的“推理神经元”,也并非证明了底层的计算发生了变化;而是证明了几何实现(geometric realization)发生了变化,而该区别的可解码性(decodability)依然存在。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。