← 最新论文
💬 NLP

What Tokens are Learned when Tokenization is Optimized Jointly with Language Modeling?

本文证明了将分词与语言建模进行联合优化从根本上改变了标记结构,揭示了像无分词器方法(如 SSLM)这类方法所学习到的标记在形态上是对齐且在上下文层面是高效的,从而降低了困惑度并在多种语言中实现了具有竞争力的下游性能,这与优先考虑字节级效率的 H-Net 不同。

原作者: Saketh Reddy Vemula, Parameswari Krishnamurthy

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Saketh Reddy Vemula, Parameswari Krishnamurthy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能的世界里,计算机阅读文本的方式与人类并不相同。它们无法将一个句子视为流动的意义之流;它们看到的是一系列离散的单元。为了理解语言,这些系统必须首先将单词分解成更小的部分,这个过程被称为分词(tokenization)。想象一位图书管理员,他必须不是按整本书,而是按章节甚至段落来组织图书馆,具体取决于书是如何编写的。如果管理员在错误的地方切断了书籍,故事就会变得难以理解。几十年来,研究人员一直使用固定规则来决定在哪里进行这些切割,通常依赖于某些字母组合出现的频率等简单统计数据。这些规则运行得还算可以,但它们是静态的;一旦设定,即使计算机正在学习一种新语言或复杂的方言,它们也永远不会改变。这提出了一个根本性的问题:如果我们不再使用这些固定规则,而是让计算机在学习语言的同时,学习如何切割单词,会发生什么呢?

来自海得拉巴拉玛达理工学院(IIIT Hyderabad)的一个研究小组试图通过构建能够边学习语言边学习分词的语言模型来回答这个问题。他们测试了这些“无分词器”系统,涵盖了从英语、瑞典语到泰米莉语、印地语和希伯来语的十八种不同语言。选择这些语言是为了代表单词构建方式的多样性,从简单的短词到通过增加每个部分来改变意义的长而复杂的音节链。研究人员将他们的新型学习系统与传统的固定方法进行了对比。他们想看看计算机能自主发明出什么样的词块,这些词块是否具有语言学意义,以及它们是否能帮助计算机更好地理解语言。

结果显示,当允许计算机学习自己的拆分方式时,根据所使用的架构不同,它会发展出两种截然不同的策略。一种被称为“子词分割语言模型”(subword segmental language model)的方法,学会了以一种与语言自然构建块紧密匹配的方式来切割单词。在像印地语这样通过在词根上添加特定后缀来构成单词的语言中,该系统迅速识别出了词根和后缀,并将它们清晰地分离。在希伯来语中——一种意义被编织进单词内部结构而非仅仅添加在末尾的语言——该系统学会了识别这些内部模式。这种方法产生的词元(tokens)具有语言学意义,很好地契合了人类对语言语法和结构的理解。

相比之下,另一种被称为 H-Nets 的方法则采取了更为务实的路线。该系统并没有试图寻找语言的构建块,而是完全专注于效率。它学会了创建非常长的文本块,有时甚至跨越整个短语,以最大限度地减少计算机处理数据所需的步骤。这些块往往与单词实际的语法或意义几乎没有关系。例如,在具有复杂脚本的语言中,该系统产生的词元明显比其他任何方法产生的都要长,它优先考虑处理速度而非单词结构的清晰度。虽然这提高了系统的计算效率,但导致其词汇表看起来与人类或传统算法拆分单词的标准方式完全不同。

研究还表明,这些系统学习的方式取决于它们正在处理的语言类型。在那些通过连接许多小部分来构建单词的语言中,学习过程更加动态且具有波动性。系统会尝试不同的切割方式,有时找到了完美的切分点,然后又远离它,最后才在效率与意义之间达成平衡,找到一个解决方案。在较简单的语言中,系统很快就找到了稳定的切分方式并坚持使用。这表明语言本身的复杂程度塑造了计算机对其进行分词的方式。

当研究人员在现实世界的任务中测试这些新的分词方法时,例如识别句子的情感或寻找人名和地名,结果令人鼓舞。尽管计算机学习到了与标准模型完全不同的词汇,但它在这些任务上的表现同样出色,在某些情况下甚至更好。那个学会与语言自然结构保持一致的系统,始终能减少计算机在预测句子下一个词时的困惑。这表明,让计算机学习自己的分词策略,可以让它发现固定规则可能会错过的有意义的模式。

最终,这项研究证明了对于计算机来说,拆分单词并没有单一的“最佳”方式。最优方法取决于系统想要实现的目标。如果目标是理解语言的深层结构,那么让模型学习自己的分割方式,会产生反映人类语言直觉的词元。如果目标是原始的处理速度,模型可能会发明完全不同的、更长的块,从而牺牲语言的清晰度来换取效率。通过展示这些联合学习方法可以在没有人工设计规则的情况下产生有效的、有意义的词汇,这项研究为开发更具适应性且具备语言意识的人工智能系统打开了大门,使其能够处理人类语言的全部多样性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →