← 最新论文
💻 bioinformatics

Two Comparators May Be All We Need

本文介绍了两种无需结构的机器学习模型,通过比较化学结构和蛋白质序列,能够准确预测化合物与靶点之间的成对偏好,在不需要构象分析或蛋白质结构数据的情况下实现了极高的排序准确度。

原作者: Muskal, S. M.

发布于 2026-09-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Muskal, S. M.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在活细胞内部,药物分子面对的不仅仅是一个靶点。它在拥挤的环境中漂流,遇到的是极其广泛的蛋白质谱系,其中许多蛋白质属于不同的家族。分子的最终效应是所有这些相互作用的总和,而不仅仅是其与预期靶点的结合。几十年来,研究这些相互作用的标准方法是每次只问一个问题:这种特定的药物是否与这种特定的蛋白质结合?研究人员已经建立了模型来预测这种单一的相互作用,但药物研发的现实很少如此孤立。科学家经常面临两个驱动其决策的实际的、比较性的问题:给定一种新的候选药物,它更有可能与两个潜在靶点中的哪一个结合?反之,给定一个特定的靶点,两个候选药物中哪一个更合适?回答这些问题有助于研究人员决定下一步合成哪些化合物,以及在药物进入临床前很久就应针对哪些副作用进行早期筛查。

现在,一个研究小组构建了两个专门用于回答这些比较性问题的计算机模型。该模型并非试图计算单个药物-蛋白质对的精确结合强度,而是同时观察两个项目并直接选出胜者。其中一个模型输入一种药物和两种不同的蛋白质,并预测该药物更倾向于哪种蛋白质。另一个模型则输入一种蛋白质和两种不同的药物,并预测该蛋白质更倾向于哪种药物。这些模型是在一个包含超过120万条测量数据的庞大公共数据库上训练的,涉及近80万个独特的药物分子和超过2700种人类蛋白质。至关重要的是,这些模型并不依赖于蛋白质或药物的三维形状。它们不需要知道结合口袋的精确结构,也不需要模拟分子如何扭转和旋转以相互契合。相反,它们利用构成蛋白质的氨基酸原始序列以及药物的二维化学结构图来进行工作。

结果表明,这种直接比较的方法具有惊人的准确性。当被要求在两个不同家族的蛋白质之间做出选择时,该模型约75%的时间能选出正确的首选靶点。当这两个蛋白质属于同一个家族时,准确率上升到了78%。对于相反的问题——即为单个靶点在两种药物之间做出选择时,模型的正确率为71%。研究人员发现,模型的置信度是一个可靠的指南。当模型对其选择非常有把握时,其准确率会跃升至90%以上。然而,当两个选项在实测活性方面非常接近时,模型区分它们的能力就会下降,这反映出实验数据本身在这些情况下也变得难以区分。这些模型是在从未见过的药物分子上进行的测试,确保了结果不仅仅是对过去数据的记忆,而是一种真正的泛化能力。

这项工作的一个关键发现是,这些预测的准确性在很大程度上取决于科学记录中现有的数据,而不仅仅取决于计算机算法的复杂程度。为了让模型能够比较不同的蛋白质家族,它需要见过一种同时在两个家族中进行过测试的药物。研究人员发现,在他们的数据库中,只有约4.6%的药物分子在两个不同的蛋白质家族中经过了测量。这种跨家族数据的匮乏,为模型在比较遥远的靶点时设定了一个天然的性能限制。相比之下,在单个蛋白质家族内,数据要丰富得多,从而允许进行更多的比较。这些模型并非旨在预测结合的精确强度或取代物理实验。相反,它们作为一个强大的筛选工具,帮助研究人员优先安排哪些实验应首先进行。通过基于“偏好”而非“绝对值”来对靶点和化合物进行排序,这些工具提供了一种无需了解每个蛋白质详细三维结构即可应对复杂药物相互作用景观的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →