← 最新论文
🤖 machine learning

Representational Capacity: Geometric Limits on Feature Representation in Transformer Language Models

本文提出了一种通过分析近正交特征方向的几何极限来估计 Transformer 语言模型表示容量的框架,揭示了容量对正交性约束具有指数级的敏感性,并引入了一个相比传统界限能显著提高预测准确性的修正公式。

原作者: Alexander Guha

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Guha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:大脑能容纳多少东西?

想象你拥有一个巨大的、空旷的仓库(这就是 AI 模型的“大脑”或潜空间/latent space)。仓库的大小由其维度(dmodeld_{model})决定。

长期以来,人们一直认为:“如果我有一个拥有 4,000 个货架的仓库,我只能存储 4,000 件不同的物品。” 如果一件物品是“猫”,另一件是“狗”,它们必须放在完全不同、互不接触的货架上。

但本文指出,AI 模型要聪明得多。它们使用了一种叫做**叠加(Superposition)*的技巧。它们不是把“猫”放在一个货架上,把“狗”放在另一个货架上,而是将它们排列得使得它们几乎*在不同的货架上,但又略微重叠。这就像在图书馆里把书堆叠得非常紧凑,彼此相互倚靠,但你仍然能分辨出它们。

本文探讨的问题是:我们到底能在仓库里堆叠多少件物品,才不至于让它们发生碰撞并变成一团乱麻?

关键发现:“倾斜”的极限

作者发现,为了让这些“倾斜”的物品发挥作用,它们不能倾斜得太厉害。它们必须保持接近垂直(正交)的状态。如果倾斜得太厉害,AI 就会产生混乱。

他们测量了这个“倾斜”极限,称之为 ϵ\epsilon (epsilon)

  • ϵ\epsilon(严格): 物品几乎完美地直立着。它们可以塞进海量的物品,但必须非常小心不要碰撞。
  • ϵ\epsilon(宽松): 物品到处乱歪。如果不发生碰撞,它们就无法塞入很多物品。

令人惊讶的是: 研究人员观察了数十个 AI 模型,发现它们分为两个截然不同的组别:

  1. “混乱型”组: 这些模型的 ϵ\epsilon 较高。它们的“书”倾斜得太厉害,以至于并没有有效地利用叠加技巧。
  2. “有序型”组: 这些模型的 ϵ\epsilon 非常低。它们让“书”保持近乎完美的直立状态,从而能在极小的空间内装下数百万个概念。

旧的数学理论错了

此前,科学家使用一个著名的数学规则(Johnson-Lindenstrauss 引理)来预测能容纳多少物品。该规则是基于如果随机将物品扔进一个房间时,这些物品的行为。

本文指出:“对于经过训练的 AI 来说,这种数学理论完全是错误的。”

  • 旧数学: 预测一个拥有 4,000 个货架的仓库只能容纳大约 8 到 300 件不同的物品。
  • 现实情况: 同一个模型却容纳了 32,000 个单词(其词表)以及数百万个其他概念。

旧的数学之所以失败,是因为它假设物品是随机放置的。但 AI 模型是被训练为**优化器(optimizers)**的。它们并不只是随手扔东西进去,而是通过精心排列,尽可能多地塞入物品,就像一位顶尖的俄罗斯方块高手。

新公式:关键在于比例

作者创建了一个新公式来修正数学模型。他们发现,你能塞进多少东西,不仅取决于物品的数量,还取决于物品与仓库规模之间的比例

可以这样理解:

  • 如果你有一个小房间,你只能让少数人紧挨着站立。
  • 如果你有一个巨大的体育场,你可以容纳庞大的人群,但更重要的是密度(每平方英尺的人数)而非总数。

他们的新公式表明,经过训练的模型可以比旧的随机数学预测的容量高出好几个数量级

权衡:稳定性 vs 容量

关于更大的模型(即拥有更多“货架”的模型),这里有一个最有趣的发现:

你可能会认为,更大的模型会尝试通过增加倾斜度(提高 ϵ\epsilon)来尽可能多地塞入更多物品。但研究发现事实恰恰相反。

更大的模型实际上站得更直了。

它们选择保持物品的高度分离(低 ϵ\epsilon),即便这从技术上减少了它们可能能存储的物品总量。

  • 原因: 作者认为这是在容量(Capacity)(你能存储多少东西)与稳定性(Stability)(你能多可靠地找到它们)之间的一种权衡。
  • 如果倾斜得太厉害,你可能会存储更多东西,但你会面临当 AI 试图调用这些物品时发生碰撞的风险。更大的模型似乎更看重不发生碰撞,而非单纯追求最大化存储

简要总结

  1. 仓库: AI 模型将概念存储为多维空间中的方向。
  2. 技巧: 它们通过使这些概念“近乎正交”(几乎垂直,但略微倾斜)来进行打包。
  3. 极限: 在它们变得混乱之前,存在一个严格的倾斜极限。这个极限被称为 ϵ\epsilon
  4. 类别: 有些模型很混乱(高 ϵ\epsilon),但最好的模型非常有序(低 ϵ\epsilon)。
  5. 数学修正: 旧的数学说它们只能装下很少的东西。新的数学(基于它们实际的训练方式)显示它们可以容纳数百万个东西。
  6. 教训: 随着模型变大,它们并不会试图把仓库塞到极限。相反,它们保持极其有序的排列,以确保不会产生混乱,从而优先考虑稳定性而非纯粹的容量

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →