← 最新论文
🤖 machine learning

Understanding the Parameter Space Geometry of Transformers Encoding Boolean Functions

本文通过证明此类函数在参数空间中占据极小的区域,解释了为什么 Transformer 无法学习像 PARITY 这样敏感的布尔函数,因为随机初始化几乎必然导致模型计算出包含低敏感性字符串的函数,而敏感函数本质上并不具备这些字符串。

原作者: Blanka Köver, Alexandra Butoi, Anej Svete, Michael Hahn, Ryan Cotterell

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Blanka Köver, Alexandra Butoi, Anej Svete, Michael Hahn, Ryan Cotterell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,Transformer(许多现代聊天机器人背后的那种 AI)是一个由可调节旋钮和拨盘组成的巨大且复杂的迷宫。这个迷宫就是“参数空间”。当我们训练一个 Transformer 时,我们本质上是在尝试在这个迷宫中寻找一条特定的路径,以解决某个特定的谜题,比如判断一串 0 和 1 中 1 的个数是奇数还是偶数(这种任务被称为 PARITY)。

这篇论文提出了一个简单但深刻的问题:仅仅因为迷宫中存在一条路径,是否意味着我们真的能找到它?

以下是利用日常类比对他们研究结果的解读:

1. “大海捞针”问题

作者发现,对于某些棘手的谜题(如 PARITY 或只关注第一个位的 “FIRST” 函数),Transformer 拨盘的最佳设置隐藏在迷宫中一个极其微小的区域内。

  • 类比: 想象参数空间是一个巨大的足球场。那些“简单”的谜题(如计算 1 是否比 0 多,即 MAJORITY)其解空间就像一整片草坪那么大。但那些“困难”的谜题(如 PARITY)其解空间却只有一颗沙粒大小。
  • 结果: 当我们开始训练 Transformer 时,我们通常会随机选择足球场中的一个点(随机初始化)。随机落在那个单粒沙子上的概率几乎为零。即使数学上说解是存在的,训练过程(就像一个试图向上爬坡的徒步旅行者)也几乎无法找到它,因为目标实在太小了,根本无法撞见。

2. “敏感度”计

为了理解为什么这些解如此难以寻找,作者研究了所谓的敏感度(sensitivity)。它衡量了如果你改变输入中的单个比特,答案会发生多大的变化。

  • 高敏感度(困难的谜题): 对于 PARITY,翻转任何一个比特都会改变答案。这就像一个灯开关,触摸房间里的任何一根电线都会让灯亮或灭。论文称这些为“敏感型”函数。
  • 低敏感度(简单的谜题): 对于 MAJORITY,翻转一个比特通常不会改变答案,除非计数正好处于平局。这就像一个投票系统,除非选票非常接近,否则增加一票很少会改变胜负。

3. “低敏感度偏差”

该论文最重大的发现是关于迷宫的几何结构。他们发现,如果你在迷宫中随机选取一个点(一个随机初始化的 Transformer),它所构建的机器几乎肯定会具有一种“低敏感度偏差”。

  • 隐喻: 想象这个迷宫的设计使得大多数随机路径都会导向一台“僵硬”或“懒惰”的机器。这台机器会忽略输入的微小变化,它只在输入发生剧烈变化时才会做出反应。
  • 后果: 由于迷宫是这样构建的,随机选取的机器几乎总会有一些“安全区”(即翻转一个比特也不会改变结果的输入)。
    • MAJORITY 有很多这样的安全区(呈指数级数量)。因此,机器可以轻松学习它。
    • PARITYFIRST安全区。每一个输入都是敏感的。
    • 冲突: 论文证明,对于长输入,一个随机初始化的 Transformer 必须拥有一些安全区。因此,它在数学上不可能学会 PARITY 或 FIRST,因为它无法匹配那些没有安全区的函数。机器的“形状”根本无法契合这些谜题。

4. 训练后会发生什么?

你可能会想:“但如果我们训练得足够辛苦,难道我们找不出那根针吗?”

作者进行了实验并发现,即使经过训练,“低敏感度偏差”往往仍然存在。

  • 对于 MAJORITY: 训练成功找到了那片巨大的解空间。机器学会了这项任务。
  • 对于 PARITY: 训练试图将机器推向那颗微小的沙粒,但由于那颗沙粒实在太小了(一个“测度为零”的集合),训练通常会失败或陷入停滞。机器永远无法完全掌握谜题真正的逻辑。

总结“规则”

论文根据输入字符串的长度 (NN) 建立了一条清晰的规则:

  1. 如果一个函数拥有的“安全”输入非常少(即翻转一个比特不会改变答案的情况,如 PARITY 或 FIRST),随着输入变长,Transformer 将证明无法学会它。解实在太小,无法被寻获。
  2. 如果一个函数拥有许多“安全”输入(如 MAJORITY),Transformer 可以学会它,因为其解空间足够大,可以通过随机搜索被发现并通过训练进行优化。

简而言之: 这篇论文解释了 Transformer 不仅仅是“不擅长”某些任务,它们在结构上就对这些任务存在偏见。它们的学习景观就像是一片山脉,其中“敏感型”任务的山峰如此微小,以至于在随机搜索中是不可见的;而“鲁棒型”任务的山峰则宽阔且易于攀登。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →