← 最新论文
💬 NLP

Domain-Adapted Molecular Language Models for Efficient Search of Make-on-Demand Libraries

本研究表明,尽管原生分子语言模型在不同化学领域表现出性能不一致,但通过针对目标虚拟库进行显式微调,能显著提高其样本效率和在分子发现中的效用,且优于其原生版本及传统的指纹基准模型。

原作者: Henrik Wille, Luis-Finley Schütz, Felix Strieth-Kalthoff

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Henrik Wille, Luis-Finley Schütz, Felix Strieth-Kalthoff

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在发现新药、太阳能材料或工业催化剂的竞赛中,科学家们经常面临着规模巨大的难题。可能存在的分子数量如此之巨,以至于逐一检查是不可能的。相反,研究人员依赖于“虚拟库”,即大规模的、预先计算好的分子集合,如果需要,这些分子可以在实验室中合成。为了在这些库中进行导航,他们使用计算机模型作为向导,预测哪些分子可能具有有用的特性,而无需构建并测试每一个分子。多年来,这项工作的标准工具是一种被称为“指纹”的方法,它将复杂的分子简化为代表其形状和组成部分的简单数字字符串。然而,最近出现了一代新的人工智能模型,它们经过数百万种化学结构的训练。这些“语言模型”将化学公式视为句子,学习理解化学的语法,其方式似乎比旧有的指纹更强大且更灵活。

科学界的一个重大问题是,这些新型、复杂的 AI 模型是否真的比可靠的、老式的指纹更擅长“大海捞针”。德国伍珀塔尔大学的一个研究小组着手直接测试这一点。他们不仅观察了这些模型在通用化学知识方面的理解能力,还测试了它们在特定、现实场景中寻找最佳分子的能力。他们检查了六个不同的虚拟库,范围从候选药物集合到旨在用于有机激光器和化学催化剂的分子集。在每种情况下,他们都模拟了一个发现过程:计算机模型挑选一批分子,“测试”它们,从结果中学习,然后挑选下一批,重复这个循环,以观察它寻找顶尖表现者所需的速度。

研究人员发现,新的语言模型并不一定会自动获胜。事实上,当这些先进模型在未经调整的情况下直接投入使用时,其表现并不稳定。在某些库中,它们表现得相当出色;但在另一些库中,它们难以区分有前景的分子和表现不佳的分子。令人惊讶的是,传统的指纹方法在他们测试的所有不同类型的化学领域中,仍然是最一致且最稳健的表现者。它是一个极少失败的可靠基准,而新模型有时会跌跤,特别是当库中的分子与模型最初训练时的类药性化学物质差异很大时。这项研究表明,一个模型的通用智能并不保证它能成为特定任务的优秀向导。

然而,故事并未以旧方法获胜而结束。研究人员发现,可以通过一种称为“领域自适应”的过程来教导这些模型脱颖而出。这类似于给一位通才专家进行关于新领域的速成班培训。通过利用目标库中现有的分子列表对预训练的语言模型进行微调(而无需任何昂贵的实验数据),这些模型学会了关注对该特定搜索至关重要的特定结构细节。一旦经过适配,这些模型就会成为顶尖的表现者,通常比传统的指纹更快、更高效地找到最佳分子。

教授这些模型最有效的方法是让它们在学习的同时,将重建旧式指纹作为一个辅助任务。这迫使 AI 将其广泛的、通用的化学理解能力与对库中独特模式的敏锐、特定的关注结合起来。研究证实,虽然原始的、预训练的模型并不总是准备好立即用于每一次发现行动,但它们具有巨大的潜力。通过简单地将它们调整到其工作的特定环境中,科学家们可以创造出强大的定制工具,使寻找新材料和新药的过程更加高效。这种方法表明,分子发现的未来不在于在旧方法和新方法之间做出选择,而在于将新模型作为一种灵活的基础,使其能够针对任何科学挑战的需求进行快速定制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →