← 最新论文
🤖 machine learning

Rethinking the Role of Positional Encoding: Sliding-Window Transformers without PE Remain Turing Complete

本文证明了位置编码对于 Transformer 实现图灵完备性并非严格必要,因为滑动窗口机制本身打破了置换对称性,并提供了足以模拟通用计算的位置信息。

原作者: Qian Li, Xinyu Mao, Shang-Hua Teng

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Qian Li, Xinyu Mao, Shang-Hua Teng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人讲故事或解决数学问题。长期以来,计算机科学家们一直认为,要实现这一点,机器人需要为它读到的每个单词都附带一个特殊的“地址簿”。这个被称为**位置编码(Positional Encoding, PE)**的地址簿,会告诉机器人每个单词在句子中的确切位置(第1个、第2个、第3个,等等)。如果没有它,理论上机器人会感到困惑,因为它无法区分“猫追狗”和“狗追猫”。

这篇论文指出,如果机器人使用的是一种特定类型的记忆机制:滑动窗口(sliding window),那么你其实并不需要那个地址簿。

以下是核心思想的拆解,通过一些日常类比来解释:

1. 旧有的信念:“静态照片”

把标准的 Transformer 模型(许多 AI 聊天机器人背后的模型)想象成一个正在拍摄人群照片的摄影师。如果你只是把一堆人的脸交给摄影师,而不告诉他们谁站在哪里,他们就无法分辨出一排站立的人和一堆乱作一团的人之间的区别。他们需要在每个人的额头上贴一个标签(位置编码),才能知道顺序。

2. 新的发现:“移动的巴士”

作者们意识到,当 AI 进行复杂的、循序渐进的推理(比如解决一个长长的数学题)时,它并不会一次性观察整个历史。相反,它使用的是一个滑动窗口

想象 AI 正坐在一辆巴士上,车窗每次只能看到刚刚经过的 10 个人。

  • 旧观点: 如果你只看窗口内当前的 10 个人,你无法判断谁先进入窗口,也不知道谁最后离开。他们只是一组 10 个人。
  • 新观点: 作者注意到,这辆巴士是在移动的
    • 每秒钟,都会有一个新人踏上巴士(进入窗口)。
    • 每秒钟,都会有一个最旧的人从后面掉下去(离开窗口)。

即使 AI 看不到窗口内的人拥有“街道地址”,巴士移动的行为本身也创造了一种模式。AI 可以观察到:“哦,刚才有个新人上车了,而且我知道谁刚从后面掉下去了,因为总人数发生了变化。”

3. “神奇直方图”(HIST 模型)

为了证明这一点,作者发明了一个理论上的机器人,叫做 HIST 模型

  • 这个机器人对顺序是“盲”的。它无法说“红衣服的人在第 3 位”。
  • 它只能看到一个计数(直方图)。它知道:“现在窗口里有 3 个穿红衣服的人,2 个穿蓝衣服的人和 1 个穿绿衣服的人。”
  • 它还拥有一个微小的记忆(一个“控制状态”)来记住过去发生的最后几件事。

神奇的诀窍在于:通过比较新成员进入前的计数和进入后的计数,机器人可以推断出究竟是谁离开了巴士,即使它没看到那个人的名字牌。

  • 之前: 3 红,2 蓝。
  • 新人进入(蓝色)。
  • 之后: 3 红,3 蓝。
  • 等等,窗口大小是固定的! 如果进来一个蓝色,说明必然有一个红色离开了。
  • 结论: 机器人知道刚才有一个穿红衣服的人从后面掉下去了,尽管它从未见过那件红衣服在什么位置。

4. 重大结果:图灵完备性

在计算机科学中,“图灵完备”(Turing Complete)意味着一台机器在拥有足够的时间和内存的情况下,理论上可以解决任何计算机能解决的问题。

  • 此前的观点: Transformer 需要位置编码才能达到图灵完备。
  • 本论文的证明: 一个带有滑动窗口的 Transformer 不需要位置编码也能实现图灵完备。窗口本身的移动过程提供了足够的“序列信息”,足以模拟一台通用计算机。

作者建立了一个数学桥梁,证明了:

  1. 一个只能计数 Token 类型(即 HIST 模型)的机器,可以模拟一台通用计算机(具体来说是类似于带有队列的 Post Machine)。
  2. 一个标准的(不带位置编码的)Transformer 可以完美地模仿这种计数机器。

5. 这意味着什么(以及它并不意味着什么)

好消息:
事实证明,处理数据时的“流动过程”本身就足以产生秩序。你不需要手动给每个单词贴上数字标签,就能获得通用计算能力。这种“滑动”动作本身打破了对称性。

注意事项(论文并未表达的内容):

  • 这不是关于速度: 这是一个关于“可能性”的证明,而不是关于“效率”的证明。仅仅因为一个机器人可以在没有地址簿的情况下解决问题,并不意味着它在现实生活中会做得很快或很容易。
  • 它并不读取精确位置: 机器人仍然无法说“第 5 个词是‘苹果’”。它只能推断出“有人离开了这个群体”。这是一种聪明的演绎技巧,而不是直接的映射。
  • 它需要一点数学魔法: 该证明依赖于机器人能够进行非常精确的计数(奇偶校验),以知道究竟是谁离开了窗口。在现实世界中,这可能需要极高的数学精度,这是作者承认的一个技术细节。

总结

把位置编码想象成每个单词的 GPS 坐标。这篇论文说:“如果你正走在街上,看着人们进进出出一家商店,你其实不需要 GPS。人们进出的流动过程本身就会讲述故事,即使你不知道他们的确切街道地址。”

滑动窗口本身就是 AI 的“GPS”,使得外部地址簿对于机器实现通用计算变得不再必要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →