← 最新论文
💬 NLP

Probability Distributions Computed by Autoregressive Transformers

本文刻画了自回归 Transformer 语言模型所能表达的概率分布,论证了其自回归与概率特性能够提升表达能力,并打破非概率语言识别器中存在的等价性。

原作者: Andy Yang, Anej Svete, Jiaoda Li, Anthony Widjaja Lin, Jonathan Rawski, Ryan Cotterell, David Chiang

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Andy Yang, Anej Svete, Jiaoda Li, Anthony Widjaja Lin, Jonathan Rawski, Ryan Cotterell, David Chiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将 Transformer(像 ChatGPT 这类工具背后的 AI 模型)视为一位非常聪明但略显僵化的机器人图书管理员。多年来,研究人员通过向它提出一个简单的“是或否”问题来研究这位管理员:“这本特定的书是否属于‘科幻小说’区?”如果机器人回答“是”,该书就被接受;如果回答“否”,则被拒绝。这就是论文中所称的“分类器”。

然而,在现实世界中,我们并非仅仅要求图书管理员对书籍进行分类。我们要求它“创作”故事。我们给它提供开头的几个词,它便猜测下一个词,接着再猜下一个,如此往复,从而生成一个概率分布(即对接下来内容的猜测)。这就是论文中所称的“自回归模型”。

这篇论文提出了一个根本性问题:这位机器人更擅长创作故事,还是更擅长分类书籍?或者反过来说,它分类书籍的能力是否足以让我们完全了解其创作故事的能力?

以下是他们研究发现的简要解析,辅以简单的类比:

1. 两种思维方式

作者们意识到,大多数先前的研究将 Transformer 视为一位“法官”(分类器),而我们实际使用的 AI 则像一位“说书人”(自回归模型)。

  • 法官:审视整个句子,然后判定“真”或“假”。
  • 说书人:审视到目前为止的句子,然后说:“下一个词有 90% 的概率是‘猫’,有 10% 的概率是‘狗’。”

2. “布尔”世界(简单情况)

想象一个机器人只处理非黑即白(真/假)的世界。

  • 发现:在这个简单世界里,法官和说书人本质上是同一个人。如果机器人能正确分类一本书,它也能创作出遵循相同规则的故事,反之亦然。
  • 局限:尽管它们能力相当,但说书人有时需要一套更为复杂的内部“操作手册”(逻辑)才能完成与法官相同的工作。这就好比法官能瞬间识别出某种模式,而说书人却必须编写一份冗长复杂的食谱,才能逐字生成同样的模式。

3. “实数加权”世界(复杂情况)

现在,想象机器人处理的是灰色地带(概率,如 0.5、0.9 等)。这才是真实 AI 的运作方式。

  • 发现:在这里,法官和说书人并非同一回事。它们拥有不同的超能力。
    • 说书人更灵活:它能够生成某些类型的概率模式,而法官根本无法识别这些模式。
    • 法官更僵化:存在一些特定的概率模式,法官能够识别,但说书人却无法生成,因为说书人必须遵循严格的规则,以确保其概率总和始终为 100%。
  • 类比:把法官想象成一名能瞬间识破假身份证的保安。说书人则是一名试图伪造假身份证的伪造者。有时,伪造者能造出保安无法识破的假身份证(因为保安只对照特定的名单进行检查)。但有时,伪造者受限于纸张和墨水的规则,无法制造出某种保安能轻易识破的特定类型的假身份证。

4. “时间旅行”逻辑

该论文使用一种称为“线性时序逻辑”(LTL)的特殊逻辑来描述这些机器人能做什么。这就像是一套关于时间旅行的规则:

  • “昨天”(Y):回看前一个词。
  • “历史上”(H):回看所有之前的词。
  • “自从”(S):从某个特定点开始回看。

作者们发现:

  • 如果机器人能访问“昨天”和“历史上”(即具备回看能力),那么法官和说书人是平等的。
  • 如果机器人受到限制(例如,它只能回看几步,或者仅使用“历史上”),那么说书人就会变得严格优于法官。说书人能够处理那些受限的法官无法处理的模式。

5. “计数”问题

该论文还研究了擅长计数的机器人(例如计算字符串中有多少个'a')。

  • 先前的研究表明,作为法官,这些机器人只能根据其规模计数到某个限度。
  • 然而,作为说书人,它们实际上能处理稍微复杂一点的计数任务。逐词预测下一个词的行为,赋予了它们比一次性判断整个字符串多出的一点点“脑力”。

总结

主要的结论是:我们不能假设 Transformer 作为“法官”(识别模式)所能做到的,与其作为“说书人”(生成文本)所能做到的完全相同。

  • 在简单的、非黑即白的情境中,它们大体上是相同的。
  • 在复杂的、涉及概率的现实世界情境中,“说书人”拥有“法官”所不具备的独特能力,反之亦然。

这意味着,当科学家测试 AI 能力时,需要格外谨慎。仅仅因为一个机器人在“分类测试”中失败,并不意味着它在“创作故事”时也会失败;同样,一个擅长分类的机器人,可能在遵循生成故事的具体规则时遇到困难。该论文提供了一张地图,帮助我们确切地理解这些差异究竟存在于何处。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →