UniLingo3DMol: a unified 3D molecular language model for de novo and fragment-based drug design
本文介绍了 UniLingo3DMol,这是一种统一的 3D 分子语言模型,它通过一种新颖的表示方法和多阶段训练策略,将从头药物设计与基于片段的药物设计相集成,实现了卓越的性能、更快的推理速度,并成功鉴定出具有体内药效的强效 CBL-B 抑制剂。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
寻找新药是一项艰巨的任务,常被比作在不断变形的草堆中寻找一根特定的针。几十年来,科学家们一直依赖两种主要策略来设计这些“针”。一种方法是观察已知有效的分子化学形状,对其进行微调,看是否能变得更好。另一种方法则是观察疾病靶点本身的三维形状(就像一把锁),并尝试设计一把能完美契合其凹槽的钥匙。虽然这两种方法都很有用,但传统上它们是分开处理的。人工智能已经开始协助这两者,但大多数计算机程序都是专业化的:它们要么擅长微调现有化学物质,要么擅长为特定“锁”设计新形状,但很少能同时兼顾两者。这种分离迫使研究人员在不同工具和思维模式之间切换,从而减慢了发现过程,也阻碍了计算机学习药物与疾病靶点相互作用的全貌。
现在,一个研究团队推出了一种名为 UniLingo3DMol 的新型人工智能系统,填补了这一空白。该系统不再针对设计的不同阶段使用独立的工具,而是使用一种统一的语言来描述三维分子。它可以从头开始生成全新的候选药物,也可以基于已知药物的特定部分构建新分子,同时始终兼顾目标疾病复杂的三维形状。研究人员在一百多个不同的生物靶点上测试了该系统,发现它生成的类药物分子比现有的计算机模型更契合、更精准地匹配其靶点。为了证明其在现实世界中的有效性,团队利用该系统设计了一种针对 CBL-B 蛋白(一种参与调节免疫系统的蛋白质)的新型抑制剂。所得化合物在实验室测试中表现出强效活性,并且在与现有的免疫疗法抗体结合使用时,成功使小鼠肿瘤缩小了 76%。
这项工作的核心创新在于计算机如何“看待”一个分子。传统方法通常将分子描述为平面的原子和化学键列表,这使得计算机很难理解当分子试图嵌入蛋白质时,其在三维空间中呈现出的样子。新系统采用了双序列方法。它将分子分解为有意义的块状结构,例如原子环或侧链,然后使用一套指针来描述这些块是如何连接在一起的。这使得计算机可以在不破坏分子结构的前提下重新排列这些块的顺序,就像在保持扑克牌花色不变的情况下洗牌一样。这种灵活性至关重要,因为它允许系统同时从两种截然不同的数据中学习:所有可能分子的广阔化学空间,以及已知与蛋白质结合的分子的高分辨率特定结构。
为了训练该系统,研究人员建立了一个包含数百万个蛋白质-配体复合物的海量数据库——RComplex。他们将这些数据组织成三个置信度等级,从最确定的结构(由 X 射线晶体学直接测定)到置信度较低的结构(由计算机对接预测)。训练过程分为三个阶段。首先,系统利用包含八百万个虚拟分子的库,学习基础化学规则以及原子如何在空间中排列。接着,它通过数据库中虽不确定但数量庞大的数据,学习这些分子如何与蛋白质口袋发生相互作用。最后,它仅利用最高质量的实验结构来精炼其理解。这种循序渐进的方法确保了系统在尝试掌握蛋白质结合这一复杂的“方言”之前,先学会了基础的化学语言。
研究人员使用一套包含 102 个蛋白质靶点的标准数据集,将该系统与另外六种领先的人工智能模型进行了评估对比。新系统脱颖而出,表现优于所有其他模型。它生成的分子中,具有“类药物”特征(即具备合适的尺寸、复杂度和化学性质)的比例更高。更重要的是,它产生的三维形状能更精准地嵌入蛋白质靶点。当研究人员检查生成的分子是否能重现已知活性药物的结合模式时,新系统的成功率超过了 70%,相比之下,其他模型的成功率不到 35%。此外,它的运行速度极快,大约 30 秒即可生成 500 个有效的分子,而其他模型完成同样任务则需要 13 分钟到 3 个多小时不等。
为了证明这不仅仅是计算机层面的练习,团队将系统应用于一个特定挑战:设计 CBL-B 的抑制剂。CBL-B 蛋白是癌症免疫疗法的一个诱人靶点,因为它充当了免疫系统的“刹车”;关闭它有助于人体更有效地对抗癌症。团队从一个与 CBL-B 蛋白结合的已知抑制剂出发,要求系统生成保留原药物两个特定部分、但改变其余部分以寻求更好适配度的分子。系统生成了数十万个候选方案,随后经过筛选,最终锁定了几种具有前景的先导化合物。其中一种被命名为 Cmpd. 7 的化合物被合成并进行了测试。它在实验室中表现出强效活性,且其晶体结构证实其结合蛋白质的方式正如计算机所预测的那样。
基于这一成功,研究人员再次利用该系统进一步优化该化合物。他们保留了 Cmpd. 7 中表现良好的部分,并要求系统重新设计剩余部分,以改善其与蛋白质的相互作用。这一轮生成产生了一个新的先导化合物——Cmpd. 20。在携带肿瘤的小鼠实验中,Cmpd. 20 单独使用时显示出一定的活性,但当它与标准的 PD-1 抗体联合使用时,导致肿瘤生长减少了 76%。该化合物在早期测试中还显示出良好的安全性,对某些常引起药物相互作用的肝酶抑制作用较低。从最初的计算机生成到最终的动物实验,整个过程凸显了统一的方法如何简化从数字构思到潜在药物的路径。
该研究同时也探讨了当前技术的局限性。尽管该系统非常高效,但它依赖于蛋白质的静态图像,而蛋白质在体内实际上是具有柔性的且会发生运动。研究人员指出,未来的版本可以纳入蛋白质的运动特性,从而使设计更加稳健。他们还建议,可以通过实时从外部数据库检索特定的化学片段来改进系统,使其无需从头开始重新训练即可适应新的科学发现。这些潜在的升级指向了一个未来,即人工智能将作为药物发现的持续合作伙伴,随着新数据的出现不断学习并完善其设计。
UniLingo3DMol 的成功表明,药物设计的未来可能不在于针对特定任务的专门工具,而在于能够处理整个流程的统一系统。通过教会人工智能一种既涵盖分子化学特性又涵盖靶点几何结构的语言,研究人员创造了一个能够比以往更高效地在复杂的药物发现领域中航行的工具。能够以秒级速度生成高质量的三维候选药物,并在生物体中进行验证,这标志着人工智能在人类健康应用领域迈出了重要一步。这项工作证明,当计算机模型旨在模仿人类专家看待药物设计的整体思维方式时,它们所产生的结果不仅在理论上成立,而且在实践中行之有效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。