← 最新论文
💬 NLP

Effective Context in Transformers: An Analysis of Fragmentation and Tokenization

本文建立了一个有限上下文的信息论框架,证明虽然碎片化(使用更小的单元)会通过增加最优对数损失而本质上降低预测性能,但贪婪分词(使用更大的单元)能有效扩展模型可用的上下文窗口,从而解释了基于字节/字符的 Transformer 模型与基于子词的 Transformer 模型之间的性能差异。

原作者: Amirmehdi Jafari Fesharaki, Mohammadamin Rami, Aslan Tchamkerten

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Amirmehdi Jafari Fesharaki, Mohammadamin Rami, Aslan Tchamkerten

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试预测故事中的下一个词。你拥有一个“记忆窗口”,但它只能容纳特定数量的项目。这篇论文提出了一个简单却深刻的问题:我们将故事拆解为这些项目的方式是否重要?

作者 Amirmehdi J. Fesharaki、Mohammadamin Rami 和 Aslan Tchamkerten 探讨了两种拆解文本的方法:将其切分为微小的片段(如单个字母或字节), versus 将其分组为更大的块(如单词或子词标记)。他们利用数学证明,即使数据本身完全相同,你切割数据的方式也会改变计算机预测未来的能力。

以下是他们发现的分解,使用了简单的类比:

1. “过多细节”的问题(碎片化)

类比: 想象你正在尝试猜测国际象棋游戏中的下一步棋。

  • 场景 A(子词): 你看着棋盘,清晰地看到棋子:“马”、“兵”、“王”。你可以轻易地看到模式。
  • 场景 B(碎片化): 现在,想象有人给棋盘涂上了颜料,并将每个棋子都打碎成微小的彩色像素。为了看到相同数量的历史,你必须观察更广阔的像素区域。

论文的主张:
作者发现,如果你将一个源符号(如一个字母)分解为更小的无损片段(如比特或字节),你实际上会让预测变得更困难,即使你为模型提供了更大的观察窗口。

  • 为什么? 这是一个对齐问题。
    • 如果你查看一个单词,你确切地知道它从哪里开始,到哪里结束。
    • 如果你查看构成该单词的比特,你的“窗口”可能会正好切断字母的中间。你可能会看到一个字母的结尾和另一个字母的开头,但你不知道自己正在看哪个字母。
    • 隐喻: 想象试图阅读一个句子,其中单词之间的空格被随机移动了。即使你有一把足够长的尺子来测量整个句子,你也无法分辨一个单词在哪里结束,下一个单词从哪里开始。这种混乱产生了“相位模糊”。模型会浪费能量去猜测边界在哪里,导致错误率升高,这种错误无法仅通过延长训练时间或增加计算能力来修复。

2. “智能分组”的力量(分词)

类比: 现在,想象你在阅读一本书,但你不是逐字阅读,而是按“意义块”阅读。

  • 设定: 你有一个有限的记忆窗口,只能容纳 10 个项目。
  • 场景 A(原始文本): 如果你的项目是字母,你的窗口只能容纳 10 个字母。那 barely 是一两个单词。你无法看到太多上下文。
  • 场景 B(分词): 如果你的项目是“标记”(组成常见单词或单词部分的字母组),你的 10 个项目的窗口可能容纳 50 个字母,甚至整整一个句子。

论文的主张:
作者证明,将符号分组为更大的标记可以使短窗口表现得像长窗口一样。

  • 条件: 这仅在“块”可靠时才有效。如果你的分词器足够智能,以至于 10 个标记总是(或几乎总是)覆盖原始故事的很长一段,那么模型就可以利用小窗口来学习整个故事的模式。
  • 指标: 他们引入了一种称为“有效源上下文”(Effective Source Context)的测量方法。这不在于你有多少个标记,而在于这些标记实际上代表了多少个原始字符。如果你的 10 个标记覆盖了 100 个字符,那么你的模型就拥有"100 个字符的记忆”,即使它只看到了 10 个项目。

3. “松弛”因素

论文还指出,现实世界的分词器并不完美。有时一个标记可能非常短(只是一个字母),有时可能很长(整个单词)。

  • 发现: 只要“坏”的情况(标记太短)很少见,模型的表现几乎与标记完美时一样好。数学精确地展示了在收益消失之前,你可以容忍多少“松弛”(误差)。

两方面的总结

该论文建立了一个关于我们如何向 AI 表示数据的资产负债表:

  1. 变得更小(碎片化): 将数据分解为微小的比特(如字节)会产生“相位失配”。模型会对原始单位的起止位置感到困惑,导致效率的永久性损失,这种损失无法仅通过扩大模型规模来修复。
  2. 变得更大(分词): 将数据分组为智能块(如 BPE 或 WordPiece)就像一种压缩工具。只要这些块足够一致,它就能让模型在相同的固定窗口大小内看到更长的故事历史。

核心结论:
“上下文窗口”的大小不仅仅是一个项目数量;它是原始源单位的数量。如果你将数据切分得太细,你就会失去看到大局的能力。如果你明智地将其分组,你就可以用更少的努力看到更远的地方。该论文提供了数学规则,以确切地知道何时分组有帮助,何时切分有害。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →