Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules
Mol-JEPA 是一个可扩展的多模态框架,它通过在多样化的药物发现数据中采用模态掩码,以克服化学无效增强和模态崩溃等限制,从而通过潜空间预测生成鲁棒的表示,进而学习分子世界模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
寻找新药是一个缓慢、昂贵且往往令人沮丧的过程。科学家必须找到能够锁定体内特定靶点以阻止疾病的微小分子,但这些分子本身还必须在血液循环中存活下来,避免被肝脏破坏,并且不会毒害健康细胞。几十年来,研究人员一直试图教会计算机通过展示分子的图像来预测这些结果,这些图像通常以文本字符串或连接原子的图表形式呈现。然而,分子并非存在于真空之中;其行为完全取决于它如何与周围复杂的生命系统进行相互作用。一个只看分子形状的模型,就像一张只显示地形却忽略了天气、交通和当地法律的地图。它可以告诉你一条路通向何方,但无法告诉你一辆车是否真的能在上面行驶。
为了解决这个问题,研究团队开发了一种新型的人工智能,称为 Mol-JEPA。与其试图通过轻微改变分子的形状来猜测其未来——这种方法经常会导致荒谬的结果,因为化学性质的微小变化可能会引起行为的巨大变化——该系统通过从许多不同的角度同时观察分子来学习。想象一下,试图了解一个人不仅是通过他们的脸,还要通过倾听他们的声音、观察他们的动作、阅读他们的病历以及观察他们对不同食物的反应。Mol-JEPA 对化学物质也正是这样做。它收集了关于近五百万个分子的海量信息,包括它们的原子结构、它们如何与蛋白质结合、它们如何影响细胞以及它们的物理特性。随后,该系统进行了一场预测游戏:它隐藏这一信息的某一部分,并尝试根据其余部分来猜测它是什。通过反复填补这些缺失的部分,计算机学会了对分子在现实世界中如何表现的一种深度、统一的理解,而不仅仅是死记硬背它们的静态形状。
研究人员利用来自公共数据库和新计算的大量数据构建了这个模型。他们将标准的化学测量值与原子如何移动和相互作用的高级模拟,以及衡量药物如何影响活细胞的实验数据结合在一起。总计,他们创建了一个包含近五百万个独特化合物的数据集,每个化合物由多达十四种不同类型的信息进行描述。其中一些描述来自于已经学会识别化学模式的现有计算机模型,而另一些则是使用量子物理学从头计算得出的。团队随后训练他们的 AI 充当一个“世界模型”,即一个理解化学宇宙规则的系统。在训练期间,计算机会观察分子的结构及其细胞效应(例如),然后被要求预测其与特定蛋白质的结合强度,反之亦然。如果计算机预测错误,它就会调整其内部理解,直到预测正确为止。这个过程使模型能够在不需要被明确告知规则的情况下,学习分子形状与其生物学行为之间的隐藏联系。
当团队将这个新模型与其他领先的人工智能系统进行对比测试时,结果令人瞩目。该模型在广泛的困难任务中表现优于竞争对手,尤其是在数据稀缺的情况下。在药物研发的现实世界中,科学家经常必须根据极少量的实验数据做出决策,而这正是新模型的闪光点所在。它能够将其知识泛化到它从未见过的分子上,即使测试分子在化学性质上与它在训练期间学习过的分子截然不同,仍能保持高度的准确性。研究人员发现,模型的成功源于其利用所有不同类型信息的能力。当他们移除某些类型的数据(如分子的详细 3D 结构或其细胞效应)时,模型的性能仅表现出细微的变化,这表明所学习的表示形式具有一种冗余性,即信息被编码在多种模态之中。该系统不仅仅是在记忆数据,它学会了对不同化学属性之间的关系进行推理。
最重要的发现之一是,模型不需要在每一项任务上都达到完美才具有实用价值。相反,它学习到了一种灵活的分子表示,可以适应许多不同的问题。研究人员在几个具有挑战性的基准测试上测试了该模型,包括预测药物在体内的吸收程度或其可能产生的毒性。在几乎所有案例中,新模型都优于以往最好的方法。它在处理“分布外”(out-of-distribution)问题方面表现尤为出色,即预测一个在化学性质上与训练数据中任何物质都截然不同的新分子时所面临的困难。通过从广泛的生物学和物理学背景中学习,该模型建立了一种稳健的理解,使其能够对新颖化合物做出可靠的推测。这表明,药物研发的未来可能不在于构建更大的、仅仅是记忆更多数据的模型,而在于构建更聪明的模型,使其能够整合多样化的信息来源,以理解药物发挥作用的复杂现实。
研究还表明,并非所有类型的信息都同等重要,尽管该系统受益于拥有所有信息。研究人员发现,代表分子连接性和结构的图模态(graph modality)是对于下游性能而言最关键的信息,但化学指纹以及分子如何与细胞相互作用的数据也至关重要。有趣的是,即使在某些数据缺失或稀疏的情况下(这是科学研究中的常见问题),该模型仍能有效地学习。这种韧性表明,这种方法可以应用于其他数据不完整或难以获取的领域,如材料科学或生物学。团队指出,虽然该模型功能强大,但它并不是一个万能的解决方案;它仍然需要对其学习的数据进行仔细筛选,并且对于那些与它见过的任何事物都完全不同的分子,其预测结果的能力是有限的。然而,这种方法的成功标志着在创造能够真正理解化学世界的 AI 方面迈出了重要一步,超越了简单的模式匹配,转向一种能够反映生命本身复杂性的、更深层次的、基于语境的推理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。