← 最新论文
💬 NLP

Stop Taking Tokenizers for Granted: They Are Core Design Decisions in Large Language Models

本文认为,应当将分词重新构想为一项需要与模型进行上下文感知协同设计的核心建模决策,而非仅仅作为一种静态的预处理步骤,以解决大型语言模型中存在的语言失配、偏见和效率低下等问题。

原作者: Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教导一位才华横溢的学生(一个大型语言模型)如何阅读并理解世界。在学生开始学习之前,你必须决定如何拆解他们将要阅读的书籍。你是将文本切分为完整的单词?切分为单个字母?还是切分为音节或常见的字母组合等较小的块?

这个将文本切分成碎片的进程被称为分词(Tokenization)

根据这篇论文,我们目前进行这项工作的方式就像是一种“设置好就忘掉”的习惯。我们通常会拿起一把标准的剪刀(一种预制的工具,称为字节对编码,即 BPE),然后就开始裁剪,假定它适用于所有人。作者认为这是一个错误。他们指出,分词不仅仅是一个枯燥的准备步骤;它实际上是你构建 AI 时所做的最重要的设计决策之一。

以下是该论文的论点,通过简单的类比进行了拆解:

1. 问题所在:“一刀切”的剪刀

目前,大多数 AI 模型都使用同一种标准的分词方法。论文将这种方法比作使用同一把剪刀去裁剪一切:一件精致的丝绸围巾、一件厚重的羊毛衫和一张金属片。

  • 问题: 这种标准方法经常会在奇怪的地方进行切割。例如,它可能会将一种非英语语言中的复杂词汇切碎成微小且毫无意义的碎片,或者可能会以一种让 AI 感到困惑的方式拆分一段代码指令。
  • 结果: AI 必须付出更多努力才能理解文本,这使得它变得效率低下,甚至可能因为它偏向某些语言或类型的词汇而产生偏见。

2. 转变:从“准备工作”到“核心设计”

作者希望我们不要再把分词看作是烹饪前的洗碗工作。相反,他们认为它应该是食谱本身的一部分

  • 类比: 想象你在盖房子。你不会只是随手抓起随处可见的砖块,然后寄希望于它们能合适地拼凑在一起。你会根据气候和设计,专门为地基、墙壁和屋顶选择特定的砖块。
  • 主张: 分词的选取应当基于 AI 的具体用途(例如:编写代码、诊断医疗问题或使用多种语言)以及它的交流对象来进行精心设计。

3. 解决方案:一个“上下文感知”的工具箱

论文提出了一种被称为**上下文感知框架(Context-Aware Framework)**的新思维方式。这意味着你不仅仅是挑选一个工具,而是为特定的任务设计工具。

  • 协同设计(Co-Design): 不要先选定一个分词器然后再训练 AI,你应该将它们结合起来设计。如果 AI 正在学习阅读医学期刊,那么分词器也应该在医学文本上进行训练,这样它就会知道“immunohistochemistry”(免疫组织化学)是一个重要的整体单位,而不是一堆随机字母的组合。
  • 适配(Adaptation): 如果你正在为特定语言(如阿拉伯语)或特定领域(如法律)使用 AI,你可能需要调整这些“剪刀”,使其切割方式不同于处理通用英语新闻的方式。

4. 隐藏的危险:偏见与安全

论文警告说,糟糕的分词不仅关乎效率,还关乎公平与安全。

  • “沉默的失败”: 某些单词或字符可能会因为被切割得太糟糕,导致 AI 永远无法真正理解它们的含义。论文称之为“欠训练标记(Undertrained Tokens)”。这就像给一名学生一本书,但书里一半的字都被涂抹掉了;他们会进行猜测,但无法真正理解。
  • 偏见: 如果分词器将某些文化或语言的词汇切碎,而保持英语单词完整,AI 会自然而然地更好地理解英语,并在处理其他语言时表现挣扎。这为某些群体创造了不公平的优势。
  • 安全: 黑客有时可以利用 AI 切分文本时的奇特方式,来诱导 AI 执行不该执行的操作。

5. 修复方案:一份新清单

作者为任何构建 AI 的人提出了一个结构化的流程:

  1. 不要直接复用: 不要不加检查地直接拿取知名模型(如 LLaMA)的分词器,除非你确认它符合你的需求。
  2. 审计切割情况: 检查分词器在不同语言之间是否切割得公平,以及是否产生了奇怪且无用的碎片。
  3. 衡量关键指标: 不要仅仅统计文本被切成了多少块。相反,要衡量 AI 是否通过这些切割更好地理解了其中的含义。

总结

论文得出结论:分词是 AI 理解能力的基石。 如果你用一个通用的、设计拙劣的工具来构建这个基础,那么整个房子(AI)将会是不稳固、低效且不公平的。通过将分词视为一项关键的设计选择——针对特定的语言、任务和受众进行定制化——我们可以构建出更聪明、更快、也更公平的 AI,造福每一个人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →