Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES
本研究表明,字节对编码(BPE)与 Unigram-LM 在处理化学 SMILES 时会产生本质不同且近乎不相交的子词词表,这揭示了分词算法的选择是一个关键的模型决策,而非中性的默认选项。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:我们如何教计算机阅读化学式?
想象一下,你正在试图教计算机理解化学语言。化学家使用一种叫做 SMILES 的代码来编写分子(类似于 CC(=O)Oc1ccccc1 这样的字母和符号组合)。
在计算机学习任何知识之前,它需要一个分词器(tokenizer)。你可以把分词器想象成一个翻译官,它负责将长句子拆解成更小的、易于处理的块(单词或子词),以便计算机能够理解。
多年来,化学领域一直盲目地沿用一种来自自然语言处理(例如计算机如何阅读英语)的方法,叫做 BPE(字节对编码)。这篇论文的研究人员提出了一个简单的问题:“这种切割化学公式的方式真的是最好的吗?还是有更好的方法?”
他们将标准的 BPI 方法与另一种称为 Unigram-LM 的方法进行了对比。
实验:两把不同的剪刀
想象你有一条由不同颜色珠子组成的复杂长项链(即化学公式)。你需要将这条项链剪成小段进行研究。你手头有两把不同的剪刀:
- 贪婪剪刀 (BPE): 这些剪刀会在整个珠子堆中寻找出现频率最高的两个相邻珠子。它们将这两个珠子粘在一起,变成一个“超级珠子”,然后重复这个过程。它们非常激进且贪婪,试图通过频繁出现的模式来制造出大的块。
- 概率剪刀 (Unigram-LM): 这些剪刀从一大堆微小的珠子开始,并询问:“如果我移除这个特定的珠子,会对整体图像造成多大的影响?”它们会仔细修剪掉那些非必要的碎片,保持一种更细粒度、更详细的视角。
令人惊讶的发现:它们并不一致
研究人员原本预期,由于化学公式是非常严格的(原子必须以特定的方式连接),这两把剪刀最终会在几乎相同的地方进行切割。他们认为“化学规则”会迫使这两种方法趋于一致。
但他们错了。
即使使用了完全相同的化学数据、完全相同的初始规则以及完全相同的词汇量,这两种方法产生的“单词”也完全不同。
- 重叠度极低: 如果你取出 BPE 创建的“超级珠子”列表,并将其与 Unigram-LM 创建的列表进行对比,你会发现它们几乎没有任何共同之处。在最坏的情况下,它们的重叠部分不到 16%。在最好的情况下(观察最重要的、高频的部分时),它们的重叠度甚至低于 5%。
- “切割”深度: 这两种方法在“在哪里”进行切割(分子的骨架)方面达成了一致,但在“切多深”的问题上产生了分歧。
- BPE 倾向于进行粗粒度的切割。它会将整个原子环连同其结构作为一个大的 Token(标记)粘在一起。
- Unigram-LM 则进行细粒度的切割。它会将环拆解成更小的、接近原子层级的碎片。
- 结果: 为了描述同一个分子,Unigram-LM 使用的 Token(碎片)数量比 BPE 多出 29% 到 41%。
视觉类比:地图 vs. 街景
想象你正在看一张城市地图。
- BPE 就像是一张将整个社区划分为单一区块的地图。它会说:“这整个区域是‘市中心’。”它很高效,使用的词汇较少。
- Unigram-LM 则像是街景视图,列出了每一栋建筑和每一个街角。它会说:“这里有一家面包店,那里有一个公园,这里有一栋房子。”它使用了更多的词汇,但提供了更详细的分解。
论文发现,这两张地图是不可互换的。如果你在两者之间切换,计算机看到的则是数据的完全不同的结构。
用通俗语言解释的核心发现
- 这是一个设计选择,而非默认选项: 该领域之所以默认使用 BPE,是因为它是自然语言模型所使用的。这篇论文证明了在化学领域,你不能直接复制粘贴这个选择。你必须主动决定使用哪把“剪刀”,因为它们产生的结果截然不同。
- 差异是稳定的: 这种分歧并非偶然发生。无论是在不同类型的化学物质(常见药物、稀有天然产物和多样化分子)中,还是在改变处理复杂原子的规则时,这种分歧都存在。
- 规模无法解决问题: 通常,如果你给计算机更多的数据或更大的词汇量,情况可能会趋于平缓。研究人员通过将词汇量扩大 8 倍进行了测试。结果是,两种方法仍然没有达成一致。它们依然保持着显著的区别。
- “嵌套”效应: 尽管它们使用的“单词”不同,但它们并不冲突。Unigram-LM 的切割几乎总是位于 BPE 切割的“内部”。这就像 BPE 说“切开整个披萨”,而 Unigram-LM 说“切开披萨,然后再切开每一片”。它们是兼容的,只是处于不同的细节层次。
这对读者意味着什么
论文的结论是:你选择的算法是一个重大的建模决策。
- 如果你选择 BPE,你会得到较短的序列(更少的 Token),这对计算机来说处理成本更低,但你会失去关于分子结构的某些细粒度细节。
- 如果你选择 Unigram-LM,你会得到一个更详细、更细粒度的分子视图,但这也意味着计算机需要处理更多的 Token。
作者并没有测试哪种方法能让计算机在预测化学反应或药物特性方面变得更聪明。他们仅仅证明了这两种方法创造了不同的语言。因此,化学界不能再假设它们是相同的;必须谨慎地选择自己的“剪刀”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。