← 最新论文
📄 chemistry

Evaluating the Impact of Tokenization Schemes on the Performance of Chemical Language Models

本研究首次对三种模型规模下的九种 SMILES 分词策略进行了系统性评估,结果表明,虽然基于规则的分词器在生成有效性方面表现出色,但基于语料库和混合式方法在下游属性预测方面表现更优,并最终推荐将混合策略用于构建具有泛化能力的化学语言模型。

原作者: Naafey Aamer, Arooj Zaib, Faiza Hassan, Tayyaba Asif, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Naafey Aamer, Arooj Zaib, Faiza Hassan, Tayyaba Asif, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代实验室中,化学语言的表达方式正日益不再仅仅局限于试管和烧杯,而是越来越多地以文本行的形式呈现。长期以来,科学家们一直使用一种被称为 SMILES 的速记法,将复杂的分子表示为简单的字符串,就像用一句话来描述一个故事一样。这种格式使得最初为阅读人类语言而设计的强大计算机程序能够分析化学结构。这些被称为化学语言模型的程序可以预测一种新药可能如何表现,甚至可以从无到有地发明全新的分子。然而,为了让计算机理解化学字符串,它必须首先将该字符串分解成更小的、易于处理的部分,这个过程被称为“分词”(tokenization)。正如读者将句子拆分为单词以理解其含义一样,计算机将化学字符串拆分为“标记”(tokens)以掌握分子的结构。研究人员面临的关键问题是:如何最好地进行这种拆解:是应该让计算机遵循关于什么是化学组成部分的严格、预设规则,还是应该让它通过阅读数百万个示例来自行学习寻找模式?

凯泽斯劳特恩-兰道大学(University of Kaiserslautern-Landau)与德国人工智能研究中心(German Research Centre for Artificial Intelligence)的一个研究小组开展了一项全面研究,旨在回答这个问题。他们考察了该领域的发展史,查阅了二百多篇研究论文,以识别科学家们教计算机阅读化学字符串的不同方式。通过这项广泛的调查,他们选择了九种截然不同的方法,并将它们分为三组:依赖固定化学规则的方法、完全从数据中学习的方法,以及结合了这两种方法的方法。为了公平地测试这些方法,研究人员构建了一系列大小不一的计算机模型,从小型到超大型不等,并使用包含近两百万个化学字符串的庞大数据集对它们进行了训练。随后,他们让这些模型接受了两种不同类型的测试。首先,他们检查了模型在隐藏部分字符串后重建原始化学字符串的能力,以此衡量计算机对化学基本语法的掌握程度。其次,他们在现实世界的任务上测试了这些模型,要求它们预测分子的特定属性,例如药物在水中的溶解度,或其穿过血脑屏障的可能性。

结果揭示了在生成新分子能力与预测其属性能力之间存在着一种清晰且令人惊讶的权衡。使用基于规则的分词器(即严格遵循化学定义的工具)进行训练的模型在重建方面表现最佳。它们能够高精度地拼凑出隐藏的化学字符串部分,最重要的是,确保生成的分子在化学上有效且在物理上可行。这使得它们成为执行“发明新化合物”这一目标的优选方案,因为它们很少产生不可能或荒谬的结果。然而,当研究人员转向预测分子属性的任务时,情况发生了变化。使用数据驱动或混合方法(即允许计算机从数据本身学习灵活模式)的模型,在表现上始终优于僵化的基于规则的模型。这些灵活的模型学会了识别化学字符串中微妙的关系,而这些关系是严格规则所忽略的,从而能更准确地预测分子在现实世界中的行为。

该研究还探讨了单纯通过扩大计算机模型规模是否能解决问题。他们测试了拥有 700 万、5000 万和 1.5 亿个参数的模型,以观察增加计算能力是否可以克服分词选择不当的问题。他们发现,虽然较大的模型通常表现更好,但当模型规模从 5000 万增长到 1.5 亿参数时,收益显著递减。这表明,化学数据的拆解方式往往比计算机模型的纯粹规模更为重要。一个选得好的分词策略所带来的效果,往往优于仅仅增加计算容量。最终,研究人员得出结论:不存在适用于所有情况的单一最佳方法。如果目标是设计新分子,基于规则的方法是最安全且最有效的路径。但如果目标是预测分子的作用,那么结合了化学知识与数据驱动灵活性的混合方法则提供了最强大的解决方案。这项工作为科学家们提供了一份清晰的指南,表明如何教计算机阅读化学,这一点与计算机本身本身同样至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →