← 最新论文
💻 computer science

An Empirical Comparison of Positional Encoding Methods in a Small Character-Level Transformer

本研究通过在一个训练莎士比亚风格文本的小型字符级 Transformer 上进行实证比较,对比了四种位置编码方法,发现旋转位置嵌入(RoPE)在验证损失和文本生成质量方面始终优于学习型嵌入、正弦编码以及 ALiBi,尽管这些结果具有实验设置的特定性。

原作者: Chaitanya Patil

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaitanya Patil

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代用于读写文本的计算机依赖于一种被称为“Transformer”的特定数字架构。在这种系统的核心,有一种机制允许机器同时观察句子中的所有单词,并决定哪些单词彼此之间最为重要。然而,这种机制的运作方式存在一个根本性的问题:它无法自然地理解事物的顺序。如果你打乱句子的单词顺序,机器看到的将是完全相同的项目集合,并产生相同的结果,即便句子的意义已被彻底破坏。为了修复这个问题,工程师必须手动注入关于每个单词在序列中位置的信息,告诉机器“the”出现在“cat”之前,而不是相反。这种对顺序的注入被称为“位置编码”。

多年来,研究人员提出了不同的方法来赋予机器这种顺序感。有些方法教机器从头开始学习位置,而另一些方法则使用永不改变的固定数学模式。更近期的研究方法尝试将位置信息直接织入机器比较单词的方式之中。这些方法之间的多数比较都是在拥有数十亿参数的大型系统上,并在强大的超级计算机上进行的。这留下了我们知识中的一个空白:我们不知道当系统规模较小、数据有限且计算能力适中时,这些不同的方法表现如何。这正是来自印度理工学院卡拉格布尔分校的研究员查伊塔尼亚·帕蒂尔(Chaitanya Patil)试图回答的问题。

帕蒂尔构建了一个小型、轻量级的计算机模型,旨在逐个字符地生成文本,使用的是由莎士比亚剧作摘录组成的小型数据集。该模型并非巨型语言模型,而是一个拥有约138万个可训练部分的适度三层系统,这一规模对于许多研究人员和学生来说都是可以触及的。研究人员训练了该模型的四个不同版本,仅改变了告知机器字符顺序的方法。其中一个版本使用了一张学习到的位置表;另一个使用了一种固定的波形模式;第三种使用了一种根据位置旋转单词内部表示的方法;第四种则添加了一个基于单词间距离的简单惩罚项。每个版本都训练了2000步,并且通过使用不同的随机起点重复了三次过程,以确保结果不仅仅是偶然的运气。

结果显示出了一个明确且一致的获胜者。那种通过旋转单词内部表示的方法,即被称为“旋转位置嵌入”(Rotary Positional Embedding)的方法,始终产生最好的结果,这意味着模型在预测下一个字符时犯错更少。紧随其后的是添加基于距离的惩罚项的方法,然后是固定的波形模式,最后是学习到的位置表。这一排名在每次运行实验时都保持一致,无论随机起点如何。研究人员还观察了不同运行过程之间的结果差异。他们发现,固定的波形模式是最稳定的,在不同运行之间几乎没有变化,而学习到的位置表是最敏感的,会根据模型的起始状态发生剧烈波动。

为了观察这些结果在更多训练下是否依然成立,研究人员针对其中一个起点进行了一次更长时间的实验,将训练延长到了4000步。即使有了这段额外的训练时间,旋转方法仍然是表现最好的,保持了对其他方法的领先地位。然而,研究人员谨慎地指出,这些发现严格限于这一特定的设置。该研究仅使用了一个小型数据集、一种特定的模型规模以及有限的训练步数。它并未证明旋转方法是每种情况下的最佳选择,特别是对于目前工业界使用的那些庞大模型或涉及不同类型文本的任务。这项研究仅仅展示了在小型、资源受限的环境中,某些教授机器关于顺序的方法比其他方法更有效,并且方法的选择会显著影响机器的学习效果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →