Parity, Sensitivity, and Transformers
本文通过证明单层 Transformer 因敏感性约束而无法计算奇偶性任务,从而解决了该任务能否由单层 Transformer 计算的开放性问题,同时提出了一种实用的四层 Transformer 构造,该构造在求解奇偶性任务时无需依赖先前所必需的诸如长度相关位置编码或硬最大函数等不切实际的假设。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个非常聪明但略显僵硬的机器人玩一个名为“奇偶游戏”的简单游戏。
在这个游戏中,机器人会看到一串长长的灯光,其中一些是红色的(0),一些是蓝色的(1)。机器人唯一的工作就是回答一个问题:“蓝色灯光的总数是偶数还是奇数?”
如果有 3 盏蓝色灯光,答案就是“奇数”。如果有 4 盏,答案就是“偶数”。
这对我们来说听起来很简单,但对于一种被称为“Transformer"(驱动许多现代聊天机器人和翻译器的架构)的特定人工智能架构而言,这个游戏一直是个谜。科学家们一直在争论:这个机器人需要多少层“思考层”才能解决这个游戏?
以下是本文发现的简单解释:
1. “单层”机器人太笨了
作者首先问道:仅凭一层思考的 Transformer 能解决这个问题吗?
他们证明答案是不能。
类比:想象机器人是一个站在房间里的人,房间里挤满了举着红色或蓝色卡片的人。这个人只能同时看向所有人,并快速扫视一下“平均值”。
- “奇偶”游戏极其敏感。如果你将一个人的卡片从红色改为蓝色,答案就会完全翻转(从偶数变为奇数)。
- 作者表明,单层机器人太“平滑”且太“懒惰”。它无法对单一变化做出足够敏锐的反应。这就像试图通过只听平均风速来检测飓风中的单根针掉落声。机器人的“敏感度”增长得太慢,无法捕捉到解决游戏所需的微小而关键的变化。
结论:你至少需要两层思考来解决这个问题。
2. “旧方案”使用了太多“作弊”手段
在这篇论文之前,其他科学家已经想出了如何构建一个能够解决该游戏的 Transformer,但他们不得不使用一些“作弊”手段或不切实际的设置:
- “魔法尺子”:他们给机器人一把尺子,让它在开始阅读之前就知道字符串的确切长度(例如:“这个字符串正好是 1,000 个字符长”)。真实的机器人通常直到读完句子才知道其长度。
- “完美开关”:他们使用了一种“硬开关”,可以瞬间做出二元决策,而不是真实机器人使用的“柔和、模糊”的概率开关。
- “零误差”过滤器:他们移除了一个安全过滤器(称为 LayerNorm),该过滤器通常用于防止机器人的数值爆炸到无穷大。
这些方案在纸面上有效,但在现实世界中行不通,因为它们依赖于实际 AI 训练中并不存在的假设。
3. 新的、现实世界的解决方案
本文的作者构建了一个新机器人,它在没有任何上述作弊手段的情况下解决了奇偶游戏。
- 没有魔法尺子:它使用“与长度无关”的位置编码。它不需要预先知道字符串的总长度;它只需观察事物彼此之间的相对位置。
- 柔和开关:它使用标准的“柔和”注意力机制(即真实聊天机器人中使用的那种)。
- 安全过滤器:它无需移除安全过滤器即可工作。
- 代价:为了在不作弊的情况下做到这一点,机器人需要四层思考,而不是两层。
类比:
把旧的“作弊”解决方案想象成一位魔术师,他通过偷看藏在桌子底下的答案键来解决谜题。
新的解决方案则像一位侦探大师,他通过仔细检查每一个线索、交叉比对它们并多做一点工作(四层而不是两层)来解决同样的谜题。它稍微慢一些,需要更多的“脑力”(深度),但它能在真实的法庭上奏效,而不仅仅是在魔术舞台上。
突破总结
- 下界:仅含一层的 Transformer 在数学上无法解决奇偶游戏。这不是训练问题;机器人本质上缺乏完成此任务的架构。
- 上界:你可以用 Transformer 解决这个游戏,但要以一种现实的方式(不依赖与长度相关的技巧作弊,也不移除安全过滤器),你需要四层。
这篇论文本质上在沙地上划出了一条清晰的界线:“如果你想要一个现实的人工智能来计数奇数和偶数,请给它至少四层的深度。任何少于四层的架构,在数学上都是不可能的。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。