← 最新论文
🤖 AI

Functional Subspace, where language models can use vector algebra to solve problems

本文提出并提供了证据,表明大型语言模型在其激活空间内利用功能子空间,其中上下文学习任务通过累积证据的简单向量代数运算得以解决。

原作者: Jung H. Lee, Sujith Vijayan

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jung H. Lee, Sujith Vijayan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)视为一个巨大的、多层的图书馆,其中每一本书都是一条信息,而不是一个用人类语言“思考”的巨型魔法大脑。长期以来,我们并不知道这座图书馆是如何组织其书籍的,也不清楚当被提问时它是如何找到正确答案的。

这篇论文提出了一种看待该图书馆的迷人新视角。它指出,当大型语言模型解决问题时,它并非“阅读”整座图书馆。相反,它会在其记忆内部为特定任务构建一个特殊的临时房间(即“子空间”),然后在该房间内利用简单的数学(向量代数)来解决问题。

以下是他们利用日常类比对这一发现的拆解:

1. “上下文”房间(上下文学习)

你知道如何通过在对话中提供几个示例来教会计算机一个新技巧吗?例如,如果你输入:

  • “热 : 冷”
  • “快 : 慢”
  • “大 : ?”

计算机就会猜出“小”。这被称为上下文学习(ICL)。论文问道:计算机是如何在不重新训练的情况下弄清楚这一点的?

作者认为,计算机为这次特定的对话创建了一个专用工作空间(子空间)。这就像一位厨师,一看到你点了沙拉,就立即清理出一块特定的砧板,只收集沙拉所需的食材,而忽略厨房里其他的牛排和汤。计算机将其余庞大知识中的“沙拉”逻辑隔离了出来。

2. “向量代数”配方

一旦计算机进入这个特殊房间,它就不需要以人类意义上的“理解”单词的含义。相反,它将单词视为指向特定方向的箭头(向量)。

  • 类比:想象“快乐”是一个指向北方的箭头,“悲伤”是一个指向南方的箭头。
  • 数学:如果计算机看到“快乐 : 悲伤”的模式,它就学会了一条规则:要得到答案,将箭头翻转 180 度。
  • 结果:当你问“快 : ?”时,计算机取“快”的箭头,将其翻转(因为这是反义词的规则),最终落在“慢”上。

论文声称,对于这类任务,计算机本质上是在对这些箭头进行加法和减法。它并非在“深度思考”,而是在执行简单的几何计算。

3. 图书馆如何构建房间

论文解释了计算机如何利用其架构内的两个主要工具来构建这个房间:

  • “记忆堆栈”(前馈网络):它们就像一个文件柜。当计算机看到一个单词时,它会提取与该单词相关联的可能答案列表。如果你说“伦敦”,文件柜可能会提取出“英国首都”、“金融中心”和“多雨之城”。
  • “聚光灯”(自注意力机制):这是决定使用哪个文件的部分。如果提示语是关于地理的,聚光灯就会照亮“首都”文件。如果是关于金融的,它就会照亮“中心”文件。

作者发现,随着计算机处理示例(即“热 : 冷”这样的配对),它会在该特殊房间内积累证据。这就像堆叠积木:每个示例都在“反义词”堆上增加了一块积木。当它到达最终问题时,积木堆已经足够高,可以预测出答案。

4. 子空间的“魔力”

研究人员通过观察计算机内部的“残差流”(流经模型各层的数据)来测试这一理论。他们使用了一种名为**主成分分析(PCA)**的统计工具,来寻找数据移动的主要方向。

他们的发现是:

  • 计算机自然地创建了这些低维房间(子空间)。
  • 在这些房间中,问题与答案之间的关系几乎是完全线性的(就像一条直线)。
  • 如果计算机答对了,该房间内的数学运算呈现一种形态;如果答错了,数学运算则呈现另一种形态。这证明了计算机确实正在使用这个特定的“房间”和“数学”来做出决策。

总结

该论文认为,大型语言模型并非仅仅基于模式进行猜测。相反,当给出少量示例时,它们会:

  1. 在其记忆中构建一个临时的、专用的房间
  2. 将单词翻译为箭头(向量)。
  3. 在该房间内利用简单的数学(如箭头的加减)来寻找答案。

这表明,人工智能的“涌现能力”——即它似乎能瞬间掌握新技能——实际上只是模型将其现有知识组织成这些整洁的数学子空间,以解决手头的谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →