← 最新论文
💬 NLP

ZetaGPT: A Reference Implementation of Positional--Encoding--Free State--Space--Attention Language Models

本文介绍了 ZetaGPT,这是一个开源的小型语言模型,它通过在自注意力机制之前集成因果状态空间方程来隐式编码序列信息,从而消除了显式的位置编码,同时为研究和教学目的提供了一套完整的端到端训练流水线。

原作者: Róisín Luo

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Róisín Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何阅读故事。长期以来,教它最好的方法是给机器人读到的每一个单词都贴上一个特殊的“贴纸”。如果机器人看到了“cat”(猫)这个词,它会通过一个“第一个词”的贴纸知道这是第一个词;如果它稍后看到了“dog”(狗),它会有一个“第五个词”的贴纸。如果没有这些贴纸,机器人就会感到困惑,认为“The cat chased the dog”(猫追了狗)和“The dog chased the cat”(狗追了猫)是一样的,因为单词对它来说只是一堆乱七八糟的原料。这种给单词贴标签的方法被称为“位置编码”(positional encoding),并且一直是今天我们使用的几乎所有智能语言模型的标准规则手册。

但如果机器人根本不需要贴纸呢?如果机器人不需要看标签,而是可以通过阅读过程来“感受”故事的顺序呢?这正是这篇论文所探讨的核心问题。它探索了一种构建语言模型的新方法,这种方法不依赖于那些外部贴纸。相反,它使用了一个会随着阅读不断自我更新的“记忆环”(memory loop),从而自然地记住之前的内容。这很重要,因为如果我们能构建出无需被明确告知每个单词位置就能理解顺序的模型,我们或许能让它们变得更聪明、更高效,并能更好地处理超长故事而不至于迷失方向。

论文的核心思想:ZetaGPT

本文作者介绍了一种名为 ZetaGPT 的小型开源语言模型,它试图实现正是这样的目标:在没有贴纸的情况下进行阅读。主要发现是,通过在模型的注意力机制(attention mechanism)之前放置一个特殊的“因果状态空间模块”(causal state-space module),模型可以利用其自身的内部动力学过程,隐式地学习单词的顺序。

把标准的语言模型想象成一个正在参加考试的学生,这个学生被允许看一张参考表,上面写着“问题 1”、“问题 2”等等。而 ZetaGPT 则像是一个必须完全依靠对目前为止故事的记忆来应考的学生。随着学生阅读每个单词,他们的内部状态会发生变化,从而为那个时刻创造出一个独特的“指纹”。论文指出,这个内部指纹足以告诉模型:“嘿,这个词是在那之后出现的”,而无需任何外部帮助。

它是如何工作的:记忆环

要理解 ZetaGPT 是如何实现的,请想象一场接力赛。在普通的比赛中,接力棒被传递,每个人只是在奔跑。在 ZetaGPT 的版本中,跑步者(模型)背着一个特殊的背包(状态空间模块),而这个背包会根据他们刚刚跑过的路径而改变形状和重量。

  1. 背包(状态空间模块): 在模型观察整个句子以理解联系(这个过程称为“自注意力”)之前,它首先将单词通过这个背包。这个背包是一个“递归”(recurrent)系统,意味着它会记住过去。随着每个新单词的进入,背包会根据之前的单词更新其内部状态。
  2. 演化: 论文表明,随着模型的训练,这个背包学会了开发出不同的“记忆视野”(memory horizons)。背包的某些部分负责记住最近的几个单词(短期记忆),而另一些部分则负责记住故事的长篇幅(长期记忆)。
  3. 结果: 当单词离开背包进入主注意力层时,它不再仅仅是一个原始的单词;它变成了一个“具备位置感知能力”的单词。它携带了自己在句子中位置的历史信息。论文观察到,在训练期间,模型自然地学会了利用这些不同的记忆时间尺度来编码序列,有效地取代了其他模型所使用的“贴纸”(位置编码)。

论文否定了什么,又发现了什么

论文明确反对了“我们必须使用显式位置编码(比如前面提到的‘贴纸’)才能构建有效的语言模型”这一观点。它拒绝了位置信息必须是注入外部的“架构获取能力”这一概念。相反,它提出这种信息可以成为模型自身动力学的“内在属性”。

作者发现 ZetaGPT 是行之有效的。他们训练了三个版本的模型(分别称为 Small、Medium 和 Large),参数量分别为 3440 万1.592 亿4.799 亿。他们证明了这些模型可以在没有任何位置编码的情况下,学会预测句子中的下一个单词。

然而,论文对自己的信心保持了谨慎。它并未声称已经“解决”了语言建模问题,也没有声称 ZetaGPT 比大型科技公司使用的巨型模型更优秀。事实上,作者承认他们的模型规模较小,且是在相对适度的数据集(WikiText-103 语料库)上训练的。作者指出,由于模型规模较小,它们仅在短上下文(256、512 和 1024 个 token)上进行了训练。论文暗示,虽然这种架构在这些小规模实验中有效,但我们尚不知道它在处理同时阅读数百万词的巨型模型时是否同样表现出色。

完整的旅程:从零开始到推理

这篇论文最具有趣味性和完整性的部分在于,它不仅展示了模型,还展示了构建它的完整“食谱”。作者提供了一个完整的开源流水线,带你从原始文本一直走向一个具备推理能力的模型。

  • 分词器(Tokenizer): 首先,他们从零开始构建了一个“分词器”(一种将文本转化为数字的翻译器),从原始字节开始,将其合并为一个包含 50,259 个符号的词表。
  • 训练: 他们进行了预训练,然后进行了指令微调,甚至训练了一个“奖励模型”(reward model)来帮助 AI 通过人类反馈进行学习(RLHF)。
  • “顿悟时刻”: 最后,他们使用了一种叫做“群体相对策略优化”(Group Relative Policy Optimization, GRPO)的技术,来教导模型进行“思维链”(Chain-of-Thought)推理。这是模型学习像人类解数学题一样进行逐步思考的过程,而无需事先被展示具体的步骤。论文表明,这种推理能力可以直接通过强化学习“涌现”出来。

局限性

作者非常诚实地说明了他们工作的边界。他们指出,主要的局限性源于计算资源,而非想法本身的缺陷。由于他们无法使用拥有无限算力的超级计算机,因此无法在海量数据集(数万亿个 token)上进行训练。因此,他们的模型并不具备那些大型系统所拥有的广博世界知识。

他们还指出,由于无法在极长文本上进行训练,他们尚未充分测试这种“无贴纸”方法在处理极长故事时的表现。论文总结道,ZetaGPT 是一个“紧凑的参考实现”——它是一个概念验证,也是研究人员研究如何通过隐式学习而非显式注入位置信息的实验场,而不是一个准备好取代世界上最强大 AI 模型的成品。

简而言之,ZetaGPT 是一个微小的、无需贴纸的机器人,它证明了你可以通过让机器记住一段旅程的过程,从而教会它理解故事的顺序。这是一个小小的进步,但它为我们如何构建下一代语言模型开启了一扇新的大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →