A Large Scale Investigation of Scaling Limits in Chemical Language Models
这项针对 30,000 多个实验的大规模研究表明,虽然扩展化学语言模型的规模可以改善预训练损失和化学语法理解,但这些增益并不能转化为目标导向分子设计的比例提升,凸显了尽管引入了最先进的 NovoMolGen 套件,表示学习与下游效用之间仍存在关键性的脱节。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代科学的广阔版图中,人们日益倾向于相信,只要简单地扩大计算机模型的规模并为其喂入更多数据,它就必然会变得更加聪明。这种被称为“缩放”(scaling)的概念改变了我们对语言的理解,使得机器能够通过学习海量的人类写作资料,来撰写文章、翻译文本并进行对话。科学家们最近将同样的逻辑应用于化学领域,创造了“化学语言模型”。这些人工智能系统经过训练,能够阅读和编写代表分子的字符序列,就像计算机学习阅读句子一样。人们曾寄希望于通过让这些化学模型变得更大、并在更多分子上进行训练,使它们能够自然而然地从零开始设计新药,从而发现能够治愈疾病或治疗病症的新型化合物。
然而,最近的一项大规模调查挑战了这一直观的假设。研究人员试图测试:支配语言学习的规则是否也适用于复杂的化学设计世界。他们构建了一系列从极小到极大的模型家族,并在数十亿个分子上进行训练,以观察其性能如何变化。这项由包括印度理工学院马德拉斯分校(IIT Madras)和米拉——魁北克人工智能研究所(Mila – Quebec AI Institute)在内的机构的研究人员开展的研究揭示了一个令人惊讶的脱节现象。虽然随着规模的扩大,模型在理解化学基础语法方面确实变得更好了,但这种进步并没有转化为在设计特定、有用药物方面的更好表现。事实上,研究人员发现,当面对寻找新药这一艰巨任务时,一个相对较小的模型表现得与一个巨大的模型一样出色,这表明仅仅通过增大计算机的规模并不是解锁药物发现奥秘的关键。
研究人员首先训练了超过三万个不同版本的这些化学模型。他们将模型的规模从五十万个参数变化到十亿个参数,向其输入不同类型的分子数据,并使用多种表示化学结构的方法对其进行测试。其中一个关键发现是,随着模型规模的扩大和数据的增加,它们预测化学字符串下一部分的准确性也随之提高。这类似于一个正在学习语言的孩子最终变得更擅长猜测句子中的下一个词。这些模型变得非常擅长理解化学句法,知道哪些原子组合能形成有效的分子,而哪些不能。这种对化学结构的内在理解即使在最大的模型中也在持续提升,这表明计算机成功地记住了化学的“词汇”和“语法”。
然而,当研究人员将这些模型用于实际的药物设计目标时,情况发生了剧烈变化。他们要求模型生成能与特定疾病靶点结合或满足一系列理想化学特性的新分子,这是一个涉及复杂试错循环的过程。在这里,规模带来的优势消失了。一旦模型的规模达到约五百万个参数,它们在设计这类目标导向型分子方面的性能便进入了平台期,或者说趋于平缓。将模型规模增加到十亿个参数(即扩大了两百倍)后,它们在设计高质量药物方面的质量几乎没有得到进一步提升。一个拥有五百万个参数的模型在寻找药物发现新候选药物方面的表现,与一个拥有十亿个参数的庞大模型不相上下。
这一结果表明,目前训练这些模型的方法——即侧重于预测化学字符串中的下一个字符——虽然教会了计算机化学规则,但并未教会它如何理解分子与生物系统相互作用的深层含义。这些模型学会了流利地使用化学语言,但并未学会如何利用这种语言去解决具体问题。研究人员发现,虽然大型模型可以生成有效的分子,但它们在寻找用于医学的特定、高质量分子方面并没有显著进步。该研究表明,瓶颈不在于模型的大小或数据的多少,而在于模型的训练方式以及它们被要求优化的目标。
这一发现对于人工智能在科学领域的未来具有重要意义。它表明,药物发现的前行之路可能不在于构建越来越大的计算机模型,而在于开发更聪明的方法来训练我们现有的模型。研究人员提出,与其仅仅教计算机预测下一个化学符号,我们更需要教它们理解分子的功能特性,例如它们如何与蛋白质相互作用,或者它们在人体内的行为表现。通过关注这些更深层的化学含义而非仅仅是表层的模式,科学家们或许能够创造出更高效、更有效的工具,用于设计下一代救命药物。这项工作提醒我们,在复杂的化学世界中,并非越大越好,真正的智能不仅需要对模式进行庞大的记忆,更需要深度的理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。