← 最新论文
💻 computer science

How Many Different Outputs Can a Transformer Generate?

本文证明,Transformer 生成多样化输出序列的能力根本上受限于其提示长度,即可访问序列的数量随提示长度线性增长,而可访问序列的比例在超过临界阈值后呈指数级衰减,从而解释了在复制和记忆等任务中观察到的实证失败现象。

原作者: Maxime Meyer, Mario Michelessa, Caroline Chaux, Vincent Y. F. Tan

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Maxime Meyer, Mario Michelessa, Caroline Chaux, Vincent Y. F. Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和富有创意的类比,对论文《Transformer 能生成多少种不同的输出?》进行的解读。

核心理念:Transformer 的“有限图书馆”

不妨将 Transformer(聊天机器人背后的 AI 模型)想象成一座巨大且高科技的图书馆,而非一个无限、神奇的头脑。

这篇论文提出了一个简单的问题:这座图书馆究竟能产出多少本不同的书(即词序列)?

作者发现了一个令人惊讶的限制:无论图书馆有多大,或者你给予它多少时间,它只能写出有限数量的独特故事。 绝大多数可能的故事在根本上是“无法触及”的——即使你尝试用不同的提示词(prompts)来 trick 它,图书馆也根本没有足够的物理空间或“墨水”来书写它们。

核心类比:像素化地图

为了理解为什么会发生这种情况,不妨将 Transformer 的内部思考过程想象成一张巨大的地图(称为“嵌入空间”)。

  1. 地图是像素化的:由于计算机使用精度有限的数字(就像一张具有固定像素数量的数码照片),这张地图并非平滑连续的。它由微小的、离散的“瓦片”或“像素”组成。
  2. 区域划分:在这张地图上,不同的区域对应着不同的下一个词。如果 AI 内部的“指针”落在 A 区,它就写“猫”;如果落在 B 区,它就写“狗”。
  3. 规模问题:当你要求 AI 写出越来越长的故事时,可能的词组合数量会呈爆炸式增长。
    • 想象一下,试图将长度为 100 的所有可能句子都塞进这张地图里。
    • 由于地图是由有限数量的瓦片构成的,特定长句子的“区域”会变得极其微小——比单个像素还要小。
    • 一旦某个区域小于一个像素,AI 就无法将其与邻居区分开来。它 literally 无法“看见”写出那个特定长句子的路径。

三大关键发现

这篇论文证明了关于这张“像素化地图”的三件事:

1. “提示词”是关键,但它有极限
把“提示词”(你输入的文本)想象成一把钥匙,用来打开图书馆里特定的门。

  • 论文表明,AI 能写出的故事长度与你钥匙(提示词)的长度呈线性增长关系。
  • 类比:如果你给 AI 一个 1 个词的提示词,它可能只能写一个 10 个词的故事;如果你给它一个 10 个词的提示词,它可能能写一个 100 个词的故事。但你无法无限地增加字数;最终,“钥匙”会耗尽解锁新、更长路径的独特组合。

2. 失败的“悬崖”
存在一个特定的长度阈值。

  • 悬崖之下:AI 运作完美。它可以复制或生成你要求的几乎任何短序列。
  • 悬崖之上:它能够写出的故事数量会跌落悬崖。它不会变得稍微差一点,而是突然变得无法生成大多数长序列。
  • 类比:想象一个楼梯,前 50 级台阶是坚固的。但第 51 级是一个活板门。一旦超过某个长度,AI 成功写出特定长字符串的概率会以指数级速度骤降至接近零。

3. “填鸭”实验
研究人员通过尝试使用一种特殊的、经过优化的提示词(像一把万能钥匙)将特定的长序列“填鸭”进 AI 的内存中,以此测试这一理论。

  • 结果:他们发现,对于短序列,AI 可以被强制输出它们。但一旦序列变得太长,无论怎么“填鸭”都无济于事。无论他们如何调整提示词,AI simply 无法生成该序列。
  • 这解释了为什么 AI 模型有时会在简单的任务上失败,例如完美地复制一段长文本,即使它们是专门为此训练的。这不是训练错误,而是架构本身的结构性限制

为什么会发生这种情况?(“舍入误差”隐喻)

论文认为,这是由于有限精度造成的。

  • 隐喻:想象你正在用一把只有每毫米一个刻度的尺子画画。画一条直线很容易。但是,如果你试图画一条非常复杂、漫长且蜿蜒的路径,需要你在距离刻度 0.0001 毫米处转弯,你的尺子就做不到。你被迫四舍五入到最近的毫米刻度。
  • 结果:在长序列中,这些微小的舍入误差会累积。AI 内部的“指针”会偏离写出特定长句子所需的微小精确路径,从而落入不同的区域,产生不同的词。

总结

  • Transformer 并非无限:它们在能生成的独特序列数量上有一个硬性数学限制。
  • 这是一个几何问题:限制源于 AI 内部“地图”的形状和大小,以及计算机无法存储无限精度的事实。
  • “悬崖”效应:性能在短任务中表现良好,但在长任务中会突然崩溃,而非逐渐衰退。
  • 这是根本性的:这并不是因为模型“愚蠢”或训练不足。即使拥有无限的时间和数据,该架构本身也无法生成大多数长序列。

论文得出结论,这种局限性是 Transformer 设计的一个基本属性,适用于所有规模的模型,从小型模型到当今使用的巨型模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →