JURY: A Comprehensive Training-Free to Fully-Supervised Framework for Evaluating Chemical Language Models
该论文介绍了 JURY,这是一个利用从无需训练到全监督方法的四种不同探测手段来严格评估化学语言模型的综合框架,揭示了它们的真实化学编码能力往往被强大的预测头所掩盖,并且比此前认为的更接近于传统的分子指纹。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在发现新药的竞赛中,科学家们面临着一个减缓每一次突破的瓶颈:在一种新的化学化合物成为药物之前,它必须通过一系列严格的安全检查。研究人员需要知道人体是否会吸收它、它如何在血液中传输、肝脏是否会分解它,以及它是否可能具有毒性。这些被称为吸收、分布、代谢、排泄和毒性的检查,在实验室中进行起来既昂贵又缓慢。为了加快速度,科学家们转向了计算机,利用人工智能,仅通过观察分子的结构来预测这些特性。多年来,最成功的工具是基于数百万个以文本字符串形式书写的化学公式进行训练的“语言模型”。这些模型学习将一个复杂的分子压缩成一个单一的、固定的数字列表,即捕捉其化学本质的数字指纹。衡量这些模型好坏的标准方法一直是给它们附加一个简单的预测工具,在少量实验数据上训练该工具,然后看它预测结果的准确性。如果预测得好,该模型就会获得高分。
然而,一项新的研究表明,这种标准方法掩盖了一个关键的事实。研究人员发现,预测工具本身往往承担了过多的工作,从而掩盖了底层模型实际学到了什么。一个强大的工具即使在读取的数字指纹微弱或无用时,也能通过它所得到的答案学到很多东西。为了解决这个问题,来自德国的一个研究团队开发了一种测试这些模型的新方法,称为 JURY。他们没有依赖单一的训练工具,而是使用了四种不同的方法来读取模型的数字指纹。其中两种方法不需要任何训练,只是观察分子在数字空间中的距离有多近。另外两种方法使用了简单的训练,范围从基础的直线计算到小型、灵活的网络。通过将这四种方法应用于十种不同的化学模型以及七十三项不同的安全测试,该团队发现这些模型之间的相似程度比任何人想象的都要高。没有哪个模型在所有方面都是最好的。事实上,在许多情况下,一种数十年前手工制作的描述分子的方法表现得与最先进的现代人工智能一样出色。
最令人惊讶的发现是,这些模型的差异不在于它们掌握了多少化学知识,而在于它们如何组织这些知识。有些模型将它们的数字指纹排列得非常有序,使得具有相似属性的分子自然地聚集在一起,从而无需任何额外训练即可轻松找到。而另一些模型则将同样的化学知识隐藏起来,只有在训练了用于重新排列数据的预测器后,这些知识才变得可见。这就像是在看一个图书馆:一位管理员已经按流派对书籍进行了分类,而另一位则将书随机堆叠,但如果你问对问题,他能准确找到特定的书。研究表明,擅长第一种方法的模型可能会在第二种方法上失败,反之亦然。这意味着单一的分数无法告诉你一个模型是否优秀;你必须观察它在不同测试方法下的表现轮廓,才能了解其优势所在。
研究人员测试了十种不同的化学语言模型,其中包括几种使用三种不同 Transformer 家族的模型,以及一种被称为扩展连接性指纹(extended-connectivity fingerprint)的传统手工方法。他们将四种测试方法应用于涵盖从药物吸收情况到其可能具有多大毒性的七十三项任务。当他们查看结果时,发现模型的排名取决于使用哪种测试方法而发生了彻底的变化。一个在需要无需训练的方法测试中排名第一的模型,在涉及训练预测器的测试中往往会跌至榜单末尾。相反,一个在没有训练时表现挣扎的模型,一旦加入了简单的预测器,就会跃升至榜首。这种不一致性证明了这些模型并非简单地“更好”或“更差”,而是以根本不同的方式存储了它们的化学知识。
一个名为 MoLFormer-XL 的模型展示了它已将其数字空间组织得如此清晰,以至于具有相似行为的分子已经聚集在一起。当研究人员仅仅观察数字空间中的最近邻,而不训练任何额外工具时,它的表现异常出色。相比之下,另一个模型 MolEncoder 在研究人员观察原始空间排列时表现很差。然而,一旦在它的数据上训练了一个简单的预测器,MolEncoder 就跃升到了排名的顶端。这表明 MolEncoder 拥有同样的化学知识,但它被隐藏在一种需要经过训练的工具才能解锁的格式中。研究还发现,在没有任何训练的情况下,传统的、手工制作的指纹方法在预测化学物质在体内的行为方面,往往优于最先进的模型。这表明对于某些任务,组织化学数据的旧方法仍然非常有效。
该团队得出结论,该领域一直依赖单一数字来判断复杂系统,这就像仅凭一首歌来评判一名音乐家。一个模型可能擅长某一类型的预测,但在另一类型上表现糟糕,这取决于其内部数据的结构。新的框架 JURY 用一个详细的轮廓取代了那个单一的分数,该轮廓展示了模型在不同监督水平下的表现。这使得科学家能够选择合适的工具。如果研究人员需要快速筛选化学库,而不想花时间训练新的工具,他们应该选择在未经训练的测试中表现良好的模型。如果他们拥有大量数据并希望为高风险任务训练特定的预测器,他们可能会选择仅在训练后才表现出色的模型。通过理解一个模型的知识位于何处以及它是如何组织的,科学家可以做出更好的决策,从而超越简单的排名,深入理解这些人工智能究竟学到了什么。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。