在活细胞内部,药物分子面对的不仅仅是一个靶点。它在拥挤的环境中漂流,遇到的是极其广泛的蛋白质谱系,其中许多蛋白质属于不同的家族。分子的最终效应是所有这些相互作用的总和,而不仅仅是其与预期靶点的结合。几十年来,研究这些相互作用的标准方法是每次只问一个问题:这种特定的药物是否与这种特定的蛋白质结合?研究人员已经建立了模型来预测这种单一的相互作用,但药物研发的现实很少如此孤立。科学家经常面临两个驱动其决策的实际的、比较性的问题:给定一种新的候选药物,它更有可能与两个潜在靶点中的哪一个结合?反之,给定一个特定的靶点,两个候选药物中哪一个更合适?回答这些问题有助于研究人员决定下一步合成哪些化合物,以及在药物进入临床前很久就应针对哪些副作用进行早期筛查。
现在,一个研究小组构建了两个专门用于回答这些比较性问题的计算机模型。该模型并非试图计算单个药物-蛋白质对的精确结合强度,而是同时观察两个项目并直接选出胜者。其中一个模型输入一种药物和两种不同的蛋白质,并预测该药物更倾向于哪种蛋白质。另一个模型则输入一种蛋白质和两种不同的药物,并预测该蛋白质更倾向于哪种药物。这些模型是在一个包含超过120万条测量数据的庞大公共数据库上训练的,涉及近80万个独特的药物分子和超过2700种人类蛋白质。至关重要的是,这些模型并不依赖于蛋白质或药物的三维形状。它们不需要知道结合口袋的精确结构,也不需要模拟分子如何扭转和旋转以相互契合。相反,它们利用构成蛋白质的氨基酸原始序列以及药物的二维化学结构图来进行工作。
结果表明,这种直接比较的方法具有惊人的准确性。当被要求在两个不同家族的蛋白质之间做出选择时,该模型约75%的时间能选出正确的首选靶点。当这两个蛋白质属于同一个家族时,准确率上升到了78%。对于相反的问题——即为单个靶点在两种药物之间做出选择时,模型的正确率为71%。研究人员发现,模型的置信度是一个可靠的指南。当模型对其选择非常有把握时,其准确率会跃升至90%以上。然而,当两个选项在实测活性方面非常接近时,模型区分它们的能力就会下降,这反映出实验数据本身在这些情况下也变得难以区分。这些模型是在从未见过的药物分子上进行的测试,确保了结果不仅仅是对过去数据的记忆,而是一种真正的泛化能力。
这项工作的一个关键发现是,这些预测的准确性在很大程度上取决于科学记录中现有的数据,而不仅仅取决于计算机算法的复杂程度。为了让模型能够比较不同的蛋白质家族,它需要见过一种同时在两个家族中进行过测试的药物。研究人员发现,在他们的数据库中,只有约4.6%的药物分子在两个不同的蛋白质家族中经过了测量。这种跨家族数据的匮乏,为模型在比较遥远的靶点时设定了一个天然的性能限制。相比之下,在单个蛋白质家族内,数据要丰富得多,从而允许进行更多的比较。这些模型并非旨在预测结合的精确强度或取代物理实验。相反,它们作为一个强大的筛选工具,帮助研究人员优先安排哪些实验应首先进行。通过基于“偏好”而非“绝对值”来对靶点和化合物进行排序,这些工具提供了一种无需了解每个蛋白质详细三维结构即可应对复杂药物相互作用景观的方法。
技术摘要:两个比较器可能就是我们所需要的全部
问题陈述
在药物发现过程中,细胞内的化合物会同时与多个蛋白质家族中的一系列蛋白质发生相互作用,然而标准的筛选和建模通常一次只针对一个靶点。虽然小分子本质上具有多效性(promiscuous),且脱靶活性往往导致安全性失败,但大多数预测模型都是分别对一个蛋白质和一个化合物进行评分。因此,推导选择性或偏好性需要减去两个独立的亲和力预测值,这一过程难以应对公共效力数据的高度异质性(不同实验和实验室之间的数据差异可接近一个数量级),也无法直接回答驱动决策的关键比较性问题:“这两个靶点中,化合物更偏好哪一个?”以及“这两个化合物中,靶点更偏好哪一个?”
方法论
作者构建了两个互惠的、无结构的模型,完全基于 ChEMBL 37 的公开数据进行训练,该数据集涵盖了 34 个蛋白质家族中的 2,279 个人类蛋白质。这两个模型均未使用蛋白质结构、结合位点、对接构象或构象分析。
- 数据清洗: 数据集包含 1,263,626 条测量值(Ki, IC50, Kd, EC50, Kb),涉及 794,638 个化合物。数据被限制为具有 Level-2 ChEMBL 分类标签的人类单蛋白靶点。读数被转换为 pActivity(浓度的负对数),并剔除了重复值。
- 特征表示:
- 蛋白质: 表示为由 ESM2-t12-35M 蛋白质语言模型衍生的 480 维残基平均向量。
- 化合物: 表示为 1,024 值的半径-2 Morgan 计数指纹,外加 14 个全分子描述符(如分子量、原子计数)。
- 模型架构: 两个比较器均为随机森林(各 300 棵树),采用成对输入格式。
- 靶点比较器(Target Comparator): 输入为(序列 A,化合物,序列 B)。它预测化合物更偏好哪一个靶点。该模型处理两种场景:跨家族比较和同家族内比较。
- 化合物比较器(Compound Comparator): 输入为(化合物 A,序列,化合物 B)。它预测单个靶点更偏好哪一个化合物。
- 训练策略: 为确保严格的泛化能力,模型在化合物不相交的留出集(holdouts)上进行评估。对于化合物比较器,只有当两个化合物在训练期间均未出现时,该比较才会被纳入测试集;跨越拆分边界的比较会被丢弃。每次比较都通过交换位置和反转标签进行两次输入,以强制实现对称性。
- 输出: 模型返回一个概率(偏好强度),范围从 0.50(不确定)到 1.00(确定),而非预测的亲和力数值。
关键结果
模型在留出的比较集上进行了评估,其中在这些比较中,取决于具体的比较器,靶点或化合物在训练集中均未出现过。
- 靶点偏好(跨家族): 在 8,689 个不同家族靶点的留出比较中,模型正确识别出偏好靶点的准确率为 75%。对于高置信度预测(强度 ≥ 0.80),准确率上升至 94%。
- 靶点偏好(同家族内): 在 32,738 个同一家族靶点的比较中,准确率为 78%,对于高置信度调用,准确率升至 95%。激酶家族的难度最大(准确率为 73%),这可能是由于激酶之间高度的结构相似性所致。
- 化合物偏好: 在 65,725 个训练期间未见任何化合物的留出比较中,模型正确识别出偏好化合物的准确率为 71%。对于最高置信度的预测,该准确率达到了 96%。
- 差异幅度对结果的影响: 准确率与真实活性的差异幅度强相关。当两个测量值之间的差异超过两个数量级时,准确率在 90% 到 92% 之间。当差异在半个数量级以内时,准确率降至接近随机水平(0.57–0.64)。
- 覆盖范围局限性: 跨家族靶点比较的性能上限受限于可用数据的记录,而非模型架构。数据库中仅有 4.6% 的分类化合物在多个蛋白质家族中有测量记录。
意义与主张
本文认为,直接进行两两比较是一种比预测绝对亲和力值更实用且更稳健的方法,适用于优先级排序工作流。作者声称,这两个比较器为典型的药物发现级联反应提供了一套完整的排序工具:化合物比较器有助于决定下一步合成或购买什么,而靶点比较器则有助于决定针对哪些靶点进行反向筛选。
主要贡献包括:
- 广度: 将两两比较的应用范围从单一家族(如激酶或 GPCR)扩展到了 34 个多样化的蛋白质家族。
- 无结构预测: 证明了仅靠序列和二维化学描述符即可有效地对靶点和化合物进行排序,无需结构数据。
- 严格评估: 通过化合物不相交的拆分建立了严格的基准,确保模型能够泛化到未见的化学结构。
- 操作实用性: 模型输出的偏好概率与准确率相关,允许用户筛选高置信度的决策。作者指出,虽然模型在所代表的化学和靶点空间内能很好地对化合物和靶点进行排序,但它们并不估算效力,也无法直接预测毒性或安全性结果。
这项工作被呈现为一个基础性的步骤(“家族基础模型”),用户可以通过添加自己的专有数据对其进行扩展,因为随机森林架构允许在不重新训练整个模型的情况下拼接新的树。模型和代码均以开源许可发布,以促进社区采用和扩展。
每周获取最佳 bioinformatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。