← 最新论文
🤖 machine learning

Beyond Fixed Directions: Adaptive Representation Analysis of Reasoning and Memorization in LLMs

本文表明,尽管大语言模型中的推理与记忆任务可以通过单一的表示方向进行解码,但该方向并非固定不变,而是在强化学习过程中经历了实质性的几何重组,即便底层信息仍然保持可访问性。

原作者: Shaheen Nabi

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaheen Nabi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,大型语言模型已经能够解决复杂的谜题并回忆海量的信息。科学家们长期以来一直好奇这些数字大脑究竟是如何运作的。一种盛行的观点认为,特定的行为(如逻辑推理或简单的事实检索)与模型内部记忆中特定的、固定的路径相关联。想象一下模型的思维是一个广阔的多维空间,其中的每一个想法都会留下痕迹。如果这个观点成立,那么一个模型在思考数学问题与另一个模型仅仅是在回忆事实之间的区别,应该表现为指向特定方向的一条单一且笔直的线。这个概念如此具有吸引力,以至于一些研究人员试图利用这些固定的线条作为引导来训练模型更好地思考,假设他们找到的路径将会保持稳定和可靠。

然而,一项新的研究挑战了这些路径保持不变的假设。研究人员仔细观察了一个小型语言模型,具体是被称为 Qwen3-0.6B 的版本,以观察当该模型接受严格训练时,这种固定方向的观点是否依然成立。他们收集了一组精心平衡的 400 个示例,其中一半需要逻辑推理,另一半需要事实检索。通过剥离掉诸如句子长度或特定词汇等干扰因素,他们确保所发现的任何差异都是真正关于思维类型本身的。他们的第一个发现是令人宽慰的:他们证实了在任何单一的时间点,推理与记忆之间的区别确实非常清晰,以至于一条直线可以完美地将这两组区分开来。事实上,这条简单的直线与一种观察数据所有可能角度的高维复杂分析一样有效。

故事发生了转折,研究人员使用了一种被称为组相对策略优化(group-relative policy optimization)的强大技术来训练模型,这种方法旨在提升推理能力。他们曾预期,如果这种固定方向的观点成立,那么分隔推理与记忆的线条即使在模型学习过程中也会保持在原处。相反,他们发现虽然模型仍然能完美地辨别这两种任务之间的区别,但其知识的实际方向却发生了剧烈的偏移。训练之后,那条曾经清晰指向“推理”的线已经旋转到了如此程度,以至于它不再与原始位置对齐。平均而言,新的方向与旧的方向仅有约 45% 的相似度,而在模型最深的层级中,这种偏移更为显著,其内部表示的漂移超过了一半。

这一发现揭示了模型“知道什么”与“如何存储知识”之间的关键区别。信息本身并未消失;模型在训练后仍然能以完美的准确度区分数学问题和常识问题。但是,它用来表达这种区别的几何坐标已被完全重组。这就像是一张城市地图依然能完美地告诉你图书馆的位置,但地图上的指南针方向已经旋转了,使得“北”现在指向了原来“东”的方向。研究人员通过比较模型训练前后的内部状态来测量这种偏移,发现这种变化不仅仅是微小的调整,而是模型内部景观的一次实质性的重组。

该研究得出结论,虽然分离推理与记忆的能力是稳健的,但认为这种能力依赖于单一且不变的方向这一观点是不正确的。信息依然存在,但它在模型思维中行进的具体路径是流动的,并随着学习而改变。这表明,对于未来利用这些内部方向来引导人工智能的努力,科学家们不能仅仅找到一条路径后就假设它将保持有效。相反,他们必须接受地图本身在不断被重新绘制,即便其中的地标保持不变。知识的稳定性并不保证其访问路径的稳定性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →