以下是用通俗易懂的语言和富有创意的类比,对论文《Transformer 能生成多少种不同的输出?》进行的解读。
核心理念:Transformer 的“有限图书馆”
不妨将 Transformer(聊天机器人背后的 AI 模型)想象成一座巨大且高科技的图书馆,而非一个无限、神奇的头脑。
这篇论文提出了一个简单的问题:这座图书馆究竟能产出多少本不同的书(即词序列)?
作者发现了一个令人惊讶的限制:无论图书馆有多大,或者你给予它多少时间,它只能写出有限数量的独特故事。 绝大多数可能的故事在根本上是“无法触及”的——即使你尝试用不同的提示词(prompts)来 trick 它,图书馆也根本没有足够的物理空间或“墨水”来书写它们。
核心类比:像素化地图
为了理解为什么会发生这种情况,不妨将 Transformer 的内部思考过程想象成一张巨大的地图(称为“嵌入空间”)。
- 地图是像素化的:由于计算机使用精度有限的数字(就像一张具有固定像素数量的数码照片),这张地图并非平滑连续的。它由微小的、离散的“瓦片”或“像素”组成。
- 区域划分:在这张地图上,不同的区域对应着不同的下一个词。如果 AI 内部的“指针”落在 A 区,它就写“猫”;如果落在 B 区,它就写“狗”。
- 规模问题:当你要求 AI 写出越来越长的故事时,可能的词组合数量会呈爆炸式增长。
- 想象一下,试图将长度为 100 的所有可能句子都塞进这张地图里。
- 由于地图是由有限数量的瓦片构成的,特定长句子的“区域”会变得极其微小——比单个像素还要小。
- 一旦某个区域小于一个像素,AI 就无法将其与邻居区分开来。它 literally 无法“看见”写出那个特定长句子的路径。
三大关键发现
这篇论文证明了关于这张“像素化地图”的三件事:
1. “提示词”是关键,但它有极限
把“提示词”(你输入的文本)想象成一把钥匙,用来打开图书馆里特定的门。
- 论文表明,AI 能写出的故事长度与你钥匙(提示词)的长度呈线性增长关系。
- 类比:如果你给 AI 一个 1 个词的提示词,它可能只能写一个 10 个词的故事;如果你给它一个 10 个词的提示词,它可能能写一个 100 个词的故事。但你无法无限地增加字数;最终,“钥匙”会耗尽解锁新、更长路径的独特组合。
2. 失败的“悬崖”
存在一个特定的长度阈值。
- 悬崖之下:AI 运作完美。它可以复制或生成你要求的几乎任何短序列。
- 悬崖之上:它能够写出的故事数量会跌落悬崖。它不会变得稍微差一点,而是突然变得无法生成大多数长序列。
- 类比:想象一个楼梯,前 50 级台阶是坚固的。但第 51 级是一个活板门。一旦超过某个长度,AI 成功写出特定长字符串的概率会以指数级速度骤降至接近零。
3. “填鸭”实验
研究人员通过尝试使用一种特殊的、经过优化的提示词(像一把万能钥匙)将特定的长序列“填鸭”进 AI 的内存中,以此测试这一理论。
- 结果:他们发现,对于短序列,AI 可以被强制输出它们。但一旦序列变得太长,无论怎么“填鸭”都无济于事。无论他们如何调整提示词,AI simply 无法生成该序列。
- 这解释了为什么 AI 模型有时会在简单的任务上失败,例如完美地复制一段长文本,即使它们是专门为此训练的。这不是训练错误,而是架构本身的结构性限制。
为什么会发生这种情况?(“舍入误差”隐喻)
论文认为,这是由于有限精度造成的。
- 隐喻:想象你正在用一把只有每毫米一个刻度的尺子画画。画一条直线很容易。但是,如果你试图画一条非常复杂、漫长且蜿蜒的路径,需要你在距离刻度 0.0001 毫米处转弯,你的尺子就做不到。你被迫四舍五入到最近的毫米刻度。
- 结果:在长序列中,这些微小的舍入误差会累积。AI 内部的“指针”会偏离写出特定长句子所需的微小精确路径,从而落入不同的区域,产生不同的词。
总结
- Transformer 并非无限:它们在能生成的独特序列数量上有一个硬性数学限制。
- 这是一个几何问题:限制源于 AI 内部“地图”的形状和大小,以及计算机无法存储无限精度的事实。
- “悬崖”效应:性能在短任务中表现良好,但在长任务中会突然崩溃,而非逐渐衰退。
- 这是根本性的:这并不是因为模型“愚蠢”或训练不足。即使拥有无限的时间和数据,该架构本身也无法生成大多数长序列。
论文得出结论,这种局限性是 Transformer 设计的一个基本属性,适用于所有规模的模型,从小型模型到当今使用的巨型模型。
技术摘要:Transformer 能生成多少种不同的输出?
问题陈述
尽管 Transformer 在自然语言处理和计算机视觉领域取得了实证成功,但这些模型在简单的算法任务(如复制或重复序列)上表现出根本性的失败,一旦输入长度超过特定阈值,此类失败便会发生。虽然先前的研究将这些失败归因于训练数据或优化问题,但本文认为它们源于内在的架构约束。具体而言,作者研究了输出序列的可及性(accessibility):即在任何可能的提示(包括优化的软提示)和任意上下文长度下,Transformer 能够生成的所有 token 序列的集合。核心问题是:Transformer 实际上能输出多少种不同的序列,以及这种能力如何随提示长度和模型架构进行扩展?
方法论
作者通过分析 Transformer 架构内有限数值精度和有界内部表示所施加的几何约束来研究该问题。
- 平均场公式化:为了处理任意提示长度,作者将 Transformer 解释为概率测度之间的映射(平均场扩展),而非有限序列。这利用了注意力层的置换等变性。
- 嵌入空间划分:根据解码器的输出投影,将嵌入空间划分为区域(Et),每个区域对应最可能的下一个 token(或 token 序列)。
- ** packing 数分析**:作者利用packing 数(即空间中可容纳的给定半径的不相交球体的最大数量)的概念,来量化 Transformer 能够区分的不同输入的数量。
- 有限精度假设:他们假设 Transformer 具有有限精度 ϵ,意味着它无法区分距离小于 ϵ 的输入(建模为轴对齐的立方体或球体)。
- 有界支撑:他们假设嵌入支撑包含在一个有界区域内(例如,半径为 r 的球体)。
- 理论推导:通过对输入空间的 packing 数相对于嵌入支撑体积进行界定,他们推导出了可及序列数量的上界。
- 实证验证:理论预测使用"Cramming"任务(Kuratov 等人,2025)进行了测试,在该任务中,冻结的 Transformer 基于优化的软提示被条件化以生成特定的目标序列。他们还评估了复制任务,以观察依赖于长度的泛化失败。
主要贡献
1. 序列的有限可及性
本文证明,无论提示长度或推理策略如何,Transformer 只能输出有限集的不同序列。
- 定理 4.5:对于精度为 ϵ、嵌入半径为 r、提示长度为 m 的 Transformer,不同可及序列的数量上界为 (1+2r/ϵ)dm。
- 推论:大多数序列在根本上是不可及的;没有任何提示选择能导致模型生成它们。
2. 线性扩展与指数衰减
作者建立了提示长度与可及序列最大长度之间的精确关系:
- 线性增长:可及序列的最大长度 n 随提示长度 m 线性增长(n∝m)。
- 指数衰减:超过临界阈值 N 后,长度为 n 的可及序列比例随 n 指数衰减。
- 理论阈值:他们推导出了该阈值的显式公式:n∗≈C⋅m,其中 C 取决于嵌入维度 d、词汇表大小 ∣V∣、精度 ϵ 和支撑半径 r。
3. 实证失败的解释
该分析为实践中观察到的“突然失败”(例如,完美复制直到长度 L,随后完全失败)提供了理论解释。本文认为,这并非渐进式的退化,而是超过临界阈值后可及序列指数衰减的结果。
4. 通过几何学细化界限
作者通过放宽均匀球状嵌入支撑的假设,细化了理论上限。他们提出:
- 各向异性支撑:将支撑建模为圆锥或椭球体,以更好地捕捉嵌入的实际分布。
- 非均匀单元格体积:考虑到常见 token 在嵌入空间中占据的区域比罕见 token 更大。
这些细化缩小了理论上限与实证观察之间的差距(从约 10 倍降至约 5–6 倍)。
结果
理论预测
- 推论 4.6:对于固定的提示预算 m,可及性在长度 n∗(m) 之前保持较高水平,随后呈指数下降。该线性关系的斜率受 C≤ln(∣V∣)dln(1+2r/ϵ) 限制。
- 推论 4.10:即使上下文和计算量无界,也存在一个阈值 N,超过该阈值后几乎所有序列都不可及。
实证验证
- Cramming 任务:在模型(Pythia, Qwen-2.5, Llama-3.2, Gemma-3)上的实验表明,长度 n50(可及性降至 50% 时的长度)与可训练记忆向量的数量 m 呈线性关系(R2>0.99)。
- 斜率比较:实证观察到的斜率始终低于理论上限,理论与实验之间的比率取决于所使用的模型和几何假设,范围在 4.5 到 20.4 之间。
- 复制任务:训练用于复制长度最多为 50 的序列的模型,在测试更长序列时会突然失败,证实了存在一个独立于提示长度的尖锐可及性阈值。
- 单元格体积分布:分析显示,解码器单元格体积高度偏斜;一小部分频繁 token(如空格、标点符号)占据了嵌入空间的不成比例的份额,这使得与均匀假设相比,可及性界限更加紧密。
意义与主张
本文声称提供了 Transformer 在序列生成任务上内在局限性的首个严谨理论解释。其意义在于:
- 架构限制:证明无法复制长序列是架构有限精度和有界表示的根本属性,而不仅仅是训练产物。
- 预测能力:提供了一个公式,仅基于嵌入空间几何(维度、词汇表大小、精度和支撑形状)即可预测 Transformer 的性能极限,而无需检查完整的参数集。
- 可推广性:结果不仅适用于 Transformer,还适用于任何具有有界内部表示和有限精度的架构(例如状态空间模型如 Mamba,尽管发散隐藏状态带来了挑战)。
作者得出结论:嵌入空间尽管仅代表模型参数的一小部分,但携带了关于模型基本能力和局限性的有意义信息。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。