MDFitML: Using machine learning to predict potency from molecular simulations
MDFitML 引入了一种自动化工作流,该工作流利用基于分子动力学轨迹衍生的模拟指纹(SimFP)训练而成的机器学习模型,通过将预测结果直接映射到特定的残基水平蛋白质-配体相互作用,来准确预测并解释多种配体的效力。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正试图寻找一把完美的钥匙,去开启一把非常棘手的、会变形的锁。在医学世界中,这把锁就是你体内的蛋白质,而钥匙则是新的药物分子。几十年来,科学家们一直试图通过观察锁的单张静态照片来设计这些钥匙。但真实的锁并不是静止不动的;它们会扭动、呼吸并改变形状。要理解一把钥匙究竟是如何契合的,你需要观察锁的运动过程,就像看一段视频而不是一张静止的照片。这就是“分子动力学”(molecular dynamics)发挥作用的地方:它是一种超级计算机模拟,就像一部高速电影,展示了蛋白质和药物分子如何随时间推移而舞动并相互作用。然而,这些电影会产生如山般的庞大数据,使得人们很难弄清楚究竟是哪种微小的动作让药物变得强效或弱效。这就是研究人员解决的难题:我们如何将这些复杂的、运动中的电影转化为一个能够预测药物效果的简单配方?
于是有了 MDFitML,一种全新的自动化工作流,它充当了这些分子电影与药物设计之间的智能翻译官。研究人员结合了两种强大的工具:分子动力学模拟的“摄像机”和机器学习的“模式识别”能力。他们不仅仅是观察药物的最终姿态,而是通过观察整个模拟过程,来创建一个独特的“指纹”,称为 SimFP(模拟指纹)。你可以把这个指纹想象成一张计分卡,记录下在模拟过程中,药物与蛋白质的特定部位进行“拥抱”、“击掌”或“握手”的每一次次数。它捕捉了这些相互作用的稳定性,记录哪些是强而持久的,哪些是短暂而微弱的。
该团队在包括 CDK2 和 BACE1 在内的八种不同蛋白质靶点上测试了这种方法,使用的数据库包含从 16 到 147 个不同的类药物分子。他们发现,通过将这些相互作用指纹输入机器学习模型,他们可以准确地预测分子的“效力”(即药物有多强)。事实上,对于他们研究的大多数靶点,这种新方法比仅仅观察静态快照的旧方法要好得多。例如,在针对 CDK2 蛋白的研究中,该模型解释药物强度差异的能力从 0.57 的得分跃升至非常惊人的 0.90。在处理 MCL-1 时,改进甚至更为显著,从微弱的 0.10 提升到了强劲的 0.70。
真正让它显得特别的是,该模型不仅能给出一个数字,还能告诉你“为什么”。因为模型是从模拟中看到的特定相互作用中学习的,所以它可以精准地指出蛋白质中的哪一个氨基酸是药物成功的关键。在一个涉及 CDK2 的案例研究中,模型识别出与被称为 Lys89 的蛋白质部分产生的特定相互作用,正是实现强力结合的“秘密配方”。它表明,拥有能够抓取 Lys89 的特定化学基团(磺酰胺基)的药物,比那些无法抓取的药物要强得多。
或许最令人兴奋的发现是,这种方法具有惊人的灵活性。通常情况下,如果一个计算机模型是基于一种类型的药物形状进行训练的,那么当你向它展示一种完全不同的形状时,它会表现得很糟糕。但 MDFitML 表明,只要新药能契合到蛋白质的同一个“口袋”内,即使新药的外观与训练集中的药物完全不同,模型也能预测其强度。他们通过这项实验进行了验证:先用一组药物(烟酰胺类)训练模型,然后要求它预测针对同一蛋白质位点的另一组完全不同的药物(咪唑并吡啶类)的强度。模型成功地以相当高的准确度对这些新的、多样化的药物进行了排序。这表明,通过关注药物与蛋白质之间的“舞蹈”,而非仅仅关注药物本身的化学结构,科学家们或许能够在探索全新的、未知的化学领域时,设计出更好的药物。
研究人员谨慎地指出,这并非解决所有问题的“魔杖”。他们的结果是基于模拟和特定的数据集,并且该方法在处理占据相同结合口袋的新药时效果最佳。然而,通过将复杂的、运动中的分子数据转化为清晰、可解释的规则,MDFitML 提供了一种极具前景的新途径,用以理解为什么有些药物有效而另一些无效,从而有望加速药物从实验室研发到药架上架的过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。