← 最新论文
💬 NLP

LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers

本文介绍了 LiteToken,一种通过识别并移除 BPE 词表中的低频“残留”标记(residue tokens)来减少模型参数并提高对噪声输入鲁棒性的方法,且通常无需对预训练模型进行额外的微调。

原作者: Yike Sun, Haotong Yang, Zhouchen Lin, Muhan Zhang

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Yike Sun, Haotong Yang, Zhouchen Lin, Muhan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人阅读和书写人类语言。为了做到这一点,你首先必须将句子分解成被称为“标记”(tokens)的小块(比如单词或单词的一部分),这样机器人才能理解。目前最流行的方法叫做 BPE(字节对编码)。

你可以把 BPE 的过程想象成一个从零开始构建词汇表的施工队。他们从单个字母开始。然后,他们观察大量的书籍库并说:“嘿,‘t’和‘h’这两个字母经常出现在一起。让我们把它们粘在一起,组成一个新的块,叫作‘th’。”随后,他们看到‘th’和‘e’经常在一起,于是又把它们粘在一起,做成了‘the’。他们就这样不断重复,构建出越来越大的块。

问题所在:“脚手架”遗留问题

这篇论文指出,这个构建过程中产生了一个混乱的副作用。有时,施工队会建立一个临时的块(比如“includ”),因为在构建阶段的某个时刻它非常常见。但稍后,他们会建立一个更大的块(比如“include”或“including”)。

在一个完美的世界里,施工队应该拆掉临时的“includ”块并将其丢弃。但在目前的 BPE 方法中,他们依然让这个块留在词汇表中。

作者称这些遗留的块为 “中间合并残余” (Intermediate Merge Residues)

  • 类比: 想象你正在盖房子。你使用临时脚手架来够到二楼。一旦屋顶盖好了,你就把脚手架撤掉。但在这种情况下,施工队忘记拆除脚手架了。现在,你的房子里到处都是无用的木杆,它们占据空间、看起来很丑,并且会让试图走进房间的人感到困惑。

这些“脚手架标记”(如“includ”、“delet”、“framewor”)在现实生活中很少被使用,因为完整的单词(“include”、“delete”、“framework”)更受欢迎。然而,它们仍然占据着机器人的字典,消耗着内存和处理能力。更糟糕的是,由于机器人几乎从未见过它们,当它真的遇到它们时(比如有人拼错单词,或者黑客试图欺骗系统时),它会感到困惑。

解决方案:LiteToken

作者创建了一个名为 LiteToken 的工具来清理这种混乱。它就像是机器人字典的“大扫除”服务。

它是这样一步步工作的:

  1. 侦探工作: 该工具扫描字典并寻找那些“脚手架”标记。它会提出两个问题:
    • 这个标记在单独使用时是否很少见?(低频)
    • 这个标记是否只出现在非常特定、可预测的情况下?(低“熵”或多样性)
    • 示例: 如果标记“includ”只出现在“e”或“ing”之前,那么它很可能只是一个遗留的碎片。但如果一个标记像“re”一样出现在“rewrite”、“recover”和“refund”中,那么它就是一个有用的构建块,所以它应该保留。
  2. 移除: 一旦识别出来,这些无用的标记就会被标记为待删除。
  3. 重新组装: 如果机器人遇到一个原本由这些无用标记拆分的单词,该工具会将单词分解回其基础字母,然后仅使用那些好的、有用的块来重新构建它。这就像拆掉脚手架,并用一面干净、坚固的墙来替换它。

结果:更轻量、更强大的机器人

论文在几个著名的 AI 模型(如 Qwen、Llama 和 GPT)上测试了这一点。以下是他们的发现:

  • 它是“即插即用”的: 你不需要重新训练机器人或教它任何新东西。你只需将旧字典更换为新的、清理后的字典,机器人就能表现得一样好。
  • 节省空间: 通过移除约 5% 到 10% 的无用标记,机器人需要的内存更少,计算速度也更快。这就像从背包里取出沉重且无用的砖头,以便你能跑得更快。
  • 更好地处理错误: 当人们出现拼写错误或尝试用奇怪的输入来欺骗机器人时,旧的机器人往往会感到困惑,因为它试图强行让这些“脚手架”标记变得有意义。新的“Lite”机器人能更好地处理这些错误,因为它不再依赖于那些脆弱的、半成品的块。
  • 没有智力损失: 尽管移除了这些标记,机器人的回答问题或写故事的能力并没有变差。它依然一样聪明。

总结

简而言之,这篇论文认为许多 AI 模型都携带了很多“数字垃圾”——即在训练过程中遗留下来的无用的、半成品单词片段。LiteToken 是一个简单的工具,它可以清扫掉这些垃圾,使 AI 模型变得更轻量、更快,并且在面对错误时更加稳健,而无需重新训练它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →