MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models
本文介绍了 MolEmb,这是一个轻量级框架,旨在将多模态大语言模型适配为通用的、具备上下文感知能力的分子嵌入模型,通过分子轮廓与文本描述的双向对比对齐,证明了其在属性预测和跨模态检索方面的可行性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算化学静谧的实验室里,科学家们长期以来一直依赖一种特定的数字指纹来理解微观的分子世界。这些被称为“嵌入”(embeddings)的指纹是捕捉化学结构本质的数学摘要,使计算机能够预测物质的行为,例如它是否会溶于水,或者是否可能具有毒性。多年来,创建这些指纹需要专门为单一用途设计的工具:通过获取分子的图像或读取其化学代码,输出一个固定的数值。这种方法对于特定任务效果良好,但缺乏灵活性。它无法根据科学家的提问来轻松转变关注点。如果研究人员想知道一个分子跨越血脑屏障的能力,该工具给出的答案与询问其溶解于油的能力时是一样的,因为该工具并不理解问题,只理解分子的形状。
随着该领域向更复杂的药物研发和材料设计迈进,这一局限性已成为瓶颈。科学家们需要一种能够与这些数字指纹进行对话的方式,要求它们根据查询的语境来突出不同的特征。问题在于,那些已经能够阅读文本和观察图像的强大且灵活的人工智能系统,是否可以被重新利用来创建这些具有适应性的化学指纹。研究人员在思考,是否可以不再为每一个化学问题构建一个新的、狭隘的工具,而是通过一个单一的、通用的系统,学习如何根据描述其分子所使用的语言来呈现分子。
来自香港中文大学(深圳)和上海人工智能实验室的研究团队致力于通过他们称之为 MolEmb 的新框架来回答这个问题。他们从一种被称为“多模态大语言模型”的人工智能类型入手。这类系统正是那些能够观察照片、阅读句子并理解两者之间关系的系统。研究人员意识到,这些模型天生就适合处理分子的不同描述方式:作为二维图形、作为代表其化学结构的文本字符序列,或者作为关于要研究何种属性的一组指令。
该团队构建了一个轻量化系统,旨在教导这些大模型充当分子嵌入专家。他们并不是试图让模型生成新的分子或从头撰写化学论文,而是专注于训练模型,使其将分子的视觉和文本描述与特定的文本指令对齐。想象一下,分子是一个可以通过不同透镜观察的复杂物体。研究人员向模型展示一个分子的图像及其化学代码,然后将其与诸如“分析毒性”或“分析溶解度”之类的文本指令配对。目标是让模型针对该分子产生一个独特的数字指纹,且该指纹会根据指令发生轻微偏移。当指令涉及毒性时,指纹会强调与安全性相关的分子部分;当指令变为溶解度时,指纹会转向突出与溶解于水相关的部分。
为了测试这种方法是否有效,研究人员进行了一系列严谨的实验。首先,他们检查了该新系统预测化学性质的能力是否能达到目前正在使用的专门工具的水平。他们发现,即使没有任何针对特定化学任务的专门训练,该系统预测溶解度和毒性等性质的准确度也能媲美现有的最佳方法。这是一个重要的发现,因为它表明通用模型已经通过理解分子的图像、文本代码及其描述性语言之间的关系,学习到了足够的化学结构知识,从而具备实用价值。
接下来,团队测试了这些指纹是否可用于通过文本搜索分子。在传统系统中,你无法通过输入像“帮我找一个对肝细胞有毒的分子”这样的句子来搜索分子数据库并期望得到相关的结果,因为化学数据和文本数据处于两个独立的领域。研究人员展示了他们的新系统创造了一个共享空间,使得分子和文本描述可以直接进行比较。当他们要求系统寻找匹配特定描述的分子时,系统表现出了极高的准确度,这证明了该模型确实学会了将化学的视觉和文本方面连接到统一的表示中。
然而,最关键的测试是观察该系统是否能真正根据语境改变其判断。研究人员创建了一个名为 MolCAR 的诊断基准,以观察模型是否能区分同一个分子的不同有效描述。他们向模型展示单个分子,并要求它针对特定任务(如毒性)找到正确的描述,同时忽略其他针对不同任务(如水合作用)的有效描述。在加入最后一层特定训练之前,模型在做出这种区分方面表现挣扎。它将分子视为具有一个固定的身份,无论提出的问题是什么。然而,在研究人员使用专门设计的、将分子与不同任务导向的描述相配对的数据集对模型进行训练后,系统学会了转移焦点。它开始根据问题是关于毒性还是溶解度,为同一个分子生成不同的指纹。
结果表明,多模态大语言模型不仅仅是生成化学想法或回答问题的工具;它们可以作为一种新型分子表示的基础。研究指出,创建上下文感知化学指纹的能力并非模型架构固有的缺陷,而是取决于其训练数据。当训练数据包含同一分子在不同科学视角下的多样化描述时,模型就会学会适应。这一发现指向了一个未来:一个单一的、通用的系统可以取代一系列狭隘的、专门化的工具,让科学家能够像在图书馆中搜索信息一样,灵活地查询化学数据。这项工作证明,通过将分子轮廓与自然语言指令对齐,这些强大的模型可以成为下一代药物研发和化学研究中多功能的底层基础设施。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。