← 最新论文
💬 NLP

FLEXITOKENS: Flexible Tokenization for Evolving Language Models

本文介绍了 FLEXITOKENS,一种面向字节级语言模型的灵活分词方法,该方法采用带有简化训练目标的可学习边界预测器,以克服固定分词器的僵化性,从而减少过度碎片化,并在多种语言和任务中实现高达 10% 的性能提升。

原作者: Abraham Toluwase Owodunni, Orevaoghene Ahia, Sachin Kumar

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Abraham Toluwase Owodunni, Orevaoghene Ahia, Sachin Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人阅读并理解世界。为此,机器人需要将句子分解成更小、更易管理的部分,称为“词元”(tokens)。可以把词元想象成建筑工人用来砌墙的砖块。

长期以来,机器人一直使用一套非常僵硬的砖块。这些砖块是根据固定的规则手册预先切割成特定形状(如"un-"、"do"、"able")的。这对于机器人最初训练所针对的语言和主题来说效果很好。但是,一旦机器人尝试阅读新内容——比如医学期刊、编程手册或它从未见过的语言——这种僵硬的规则手册就会引发问题。

问题:“一刀切”的砖块

这篇论文将这个问题称为过度碎片化(over-fragmentation)。

想象一下,你正试图用一条长长的连续文本带砌墙。如果你的规则手册规定:“每次看到连字符,就把带子切断”,你最终可能会把一个像"hypertrophic"(医学词汇)这样的单词切成毫无用处的碎屑:"hyper"、"tro"、"phic"。

  • 结果:机器人不得不携带过多的微小砖块来砌墙。这使得建造过程变得缓慢、昂贵(就计算能力而言)且令人困惑。机器人因为忙于关注那些破碎的微小碎片,而失去了整个单词的含义。
  • 旧方法:传统方法(如 BPE)就像一家工厂,在机器人开始建造之前就已经预先切好了所有砖块。一旦砖块被切好,就无法更改,即使机器人后来要建造不同类型的房子。

解决方案:FLEXITOKENS

这篇论文的作者 FLEXITOKENS 提出了一种更聪明的方法。他们不是使用预先切好的砖块,而是给机器人配备了一个智能、灵活的切割器,让它在建造过程中学习如何切割文本带。

以下是他们所做的,使用一个简单的类比:

  1. 旧规则(“固定压缩”陷阱)
    此前尝试让机器人自行切割砖块的方法采用了一条严格的规则:“你必须切割文本带,使得每 10 英寸文本恰好产生 3 块砖。”

    • 缺陷:如果文本来自单词自然较长的语言(如土耳其语),强制执行"3 块砖”的规则可能会将一个单词切成毫无意义的微小碎片。如果文本来自单词较短的语言(如中文),同样的规则可能会将两个不同的单词粘合成一个令人困惑的团块。这条规则过于僵硬,无法适应文本的具体“形状”。
  2. 新规则(FLEXITOKENS)
    FLEXITOKENS 将规则改为一个灵活的范围。它不再说“你必须恰好有 3 块砖”,而是说“你可以根据具体句子的需要,拥有 2 到 4 块砖之间的任意数量”。

    • “铰链”损失(The "Hinge" Loss):该论文引入了一种特殊的训练方法(一种“铰链式损失”),充当安全区。如果机器人将文本切割成的碎片数量落在安全范围内,机器人就会获得“通过”——没有惩罚。这允许机器人保持灵活性。它可以将一个长的医学术语切分成一块大而完整的砖块,或者将短句切分成许多小砖块, whichever 最有助于它理解含义。

尝试后的结果如何?

研究人员在多种不同语言(包括英语、西班牙语、俄语、印地语和泰卢固语)以及不同主题(如医学和编程)上测试了这种新的灵活切割器。

  • 更少的混乱:机器人不再不必要地切碎单词。例如,在医学文本中,它学会了将"hypertrophic"保持为一个连贯的整体单元,而不是将其分解为垃圾碎片。
  • 更快、更智能:由于机器人不必携带那么多破碎的微小砖块,它处理信息的速度更快,使用的计算机内存也更少。
  • 更好的性能:在翻译和理解句子等任务中,使用灵活切割器的机器人表现优于使用旧式僵硬方法的机器人。它甚至能更好地处理它从未见过的语言(如乌尔都语),而不会将其分解成令人困惑的微小碎片。

核心结论

可以将 FLEXITOKENS 想象成将机器人从使用预切的塑料玩具砖块套装,升级为使用智能 3D 打印机,该打印机可以根据当时正在建造的内容,打印出完美尺寸和形状的砖块。

通过让机器人根据上下文决定如何分解单词(而不是强制执行固定规则),该论文表明,语言模型可以变得更加高效,更好地处理新语言,并在理解医学等复杂主题时,不会因“过度切碎”的文本而感到困惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →