← 最新论文
🤖 machine learning

Bi-semantic Chemical Embedder for Joint Representation Learning of SMILES and Natural Language

该论文介绍了 CheMatE,这是一种基于 ModernBERT 构建的双语义嵌入模型,它利用了一个两阶段训练过程,包括在海量 SMILES 注释的科学语料库上进行持续掩码语言建模,以及随后的对比学习,以共同表示分子结构和自然语言,从而在化学性质预测和通用语言理解任务中均实现了稳健的性能。

原作者: David Ming Segura, Jeremy Goumaz, Joshua W. Sin, Bojana Ranković, Philippe Schwaller

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: David Ming Segura, Jeremy Goumaz, Joshua W. Sin, Bojana Ranković, Philippe Schwaller

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,化学的世界就像一座巨大而繁忙的图书馆。在这座图书馆里,有两种截然不同的方式来描述同一个东西:一个分子。在其中一个书架上,你看到了“科学家的速记”,一种被称为 SMILES 的紧凑代码,看起来像是一串奇怪的字母和数字(例如 C1=CC=CC=C1)。它对计算机很高效,但对人类来说读起来就像是一个神秘的密码。在另一个书架上,你看到了“讲述者的描述”,即用长段的自然语言解释一个分子的行为、它在哪里被发现,或者它如何反应。长期以来,试图理解化学的计算机程序必须在两者之间做出选择。它们可以擅长阅读这种秘密代码,但对理解自然语言的“故事”一窍不通;或者反之亦然。它们往往为了成为“化学代码”的专家,而不得不忘记如何说“人类语言”。这篇论文提出了一个简单但棘手的问题:我们能否构建一个单一的大脑,使其同时精通这两种语言——既能理解秘密代码,又能理解科学故事,且不会因此“丧失理智”?

由 David Ming Segura 和 Philippe Schwaller 领导的研究人员表示,答案是肯定的。他们构建了一个名为 CheMatE(具有马特罗什卡嵌入的化学嵌入器)的新型 AI 模型,它扮演着超级双语翻译官的角色。他们没有强迫 AI 在成为化学家或语言学家之间做出选择,而是教会了它将化学代码和科学故事视为同一枚硬币的两面。

以下是他们是如何做到的,以及为什么这行得通。

问题:“专家”陷阱

把之前的 AI 模型想象成一个只为数学考试而学习的学生。他们可能在微积分上拿到满分,但如果你让他们写一首诗,他们可能会忘记如何使用形容词。在化学 AI 的世界里,那些在 SMILES 字符串(代码)上训练过重的模型,变得非常擅长识别代码中的模式,以至于它们“忘记”了如何理解周围的自然语言句子。它们变成了无法与图书馆其他部分进行交流的专家。

解决方案:一个“双语”图书馆

团队决定不再将代码和故事视为独立的事物。相反,他们创建了一种将两者交织在一起的训练方法。

1. 注入流水线:为文本“加料”
想象你有一叠 1440 万篇科学文章和教育文本。这些就是“故事”。研究人员构建了一个机器人流水线,它阅读这些故事,找到每一个化学物质的提及(如“葡萄糖”或“阿司匹林”),并将该化学物质的 SMILES 代码秘密地插入到它旁边。

  • 结果: 一个句子如“Glucose is a simple sugar”(葡萄糖是一种简单的糖)变成了“Glucose is a simple sugar 0=С[С@H](0)...”。
  • 规模: 他们对超过 1400 万份文档进行了此操作,创建了一个拥有 219 亿个“词元”(tokens)的海量训练集。这意味着 AI 在反复观看的同时,能看到代码与故事同步发生。

2. “智能批处理”技巧:拼凑拼图
在一个如此庞大的图书馆中训练 AI,就像试图将大小迥异的拼图块塞进一个盒子里。有些文档很短,有些则非常庞大(长达 8,192 个词元)。如果你只是随机投放,一些计算机处理器(GPU)就会在等待慢速任务完成的过程中处于闲置状态,从而浪费时间和金钱。

  • 解决方法: 团队发明了一种“成本感知采样器”(Cost-Aware Batch Sampler)。把它想象成一位聪明的图书管理员,他不仅计算一堆书的数量,还会计算每本书有多重、多笨拙。他们安排这些堆叠,使得每个计算机处理器承担的工作量相等,无论文档的长短如何。这使他们的训练效率提高了 30%,并使他们能够处理那些长而复杂的文档而不会导致崩溃。

3. 两阶段训练:先学会阅读,再学会连接
AI 不仅仅是读了一遍混合后的文本,它还经历了两个截然不同的阶段,就像学生先学习词汇,然后学习如何写论文一样。

  • 第一阶段(词汇量): 模型使用了名为“掩码语言建模”(Masked Language Modeling)的技术。想象你在读一段话,其中一些单词被黑盒子盖住了。AI 必须猜出缺失的单词。但在这里,缺失的词可以是一个普通的单词,也可以是一段 SMILES 代码。这迫使 AI 学习代码与文本属于同一个语境。
  • 第二阶段(连接): 一旦 AI 掌握了词汇,他们就教它理解关系。他们创造了一个游戏,要求 AI 将特定的化学代码与正确的段落进行匹配,同时忽略关于完全不同化学物质的段落。他们使用了一种带有“马特罗什卡”(以俄罗斯套娃命名)元素的“多负采样排序损失”(Multiple Negative Ranking Loss)方法。这意味着 AI 学习在不同的细节层级上理解化学物质,从宏观视角到底层微观细节,确保即使在缩放视图时也不会丢失重要信息。

结果:两全其美

当他们测试 CheMatE 时,结果令人印象深刻。他们将其与 11 种其他模型进行了对比,其中包括仅精通代码的模型和其他仅精通文本的模型。

  • 得分: CheMatE 是唯一一个在两项任务中同时排名顶尖组的模型。它的“双语义得分”(Bi-semantic Score)达到了 86.7%,这意味着它在他们运行的 48 项测试中,在近 88% 的测试中都表现出色。
  • 对比: 擅长阅读 SMILES 代码的模型(如 MoLFormer 或 ChemBERTa)在理解自然语言方面表现糟糕。擅长语言的模型在处理代码方面还可以,但并非顶尖。CheMate 打破了这种权衡。它证明了你不需要为了获得一种技能而牺牲另一种技能。

为什么这很重要

这不仅仅是为了在测试中获得更高的分数。通过证明单一模型既能理解化学公式的严谨结构,又能理解科学写作的流动语境,CheMatE 为更智能的药物研发和材料科学工具打开了大门。它表明,在未来,我们不需要专门的工具来分别阅读化学图表和研究论文;一个统一的大脑就能完成这一切,通过理解科学背后的完整故事,帮助科学家更快地发现新药或新材料。

作者们谨慎地指出,虽然这是一个巨大的进步,但系统并非完美无缺。它依赖于现有的工具来在文本中寻找化学物质,而这些工具有时可能会错过一些复杂或全新的化合物。然而,其核心理念——即混合代码与故事可以创造出更聪明、更通用的 AI——已经得到了成功的验证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →