Chemi-Proteome Language Attention Network Empowers Fragment-Based Ligand Interactome and Binding Sites Discovery with Evidence
该论文介绍了一种名为 C-PLANK 的深度学习框架,该框架基于细胞化学蛋白质组学数据进行训练,在预测片段-蛋白质相互作用方面优于现有模型,并通过将物理化学嵌入与系统级生物合理性指标相结合,成功鉴定出一种新型 SIRT3 激动剂。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
寻找新药往往感觉就像是在寻找一把能契合特定锁具的钥匙,但这场寻找发生在充满成千上万把其他钥匙和锁具的拥挤房间里。长期以来,科学家一直依赖计算机程序来预测哪些化学“钥匙”可能会契合蛋白质“锁具”,希望能以此加速疾病治疗方案的发现。这些程序通常基于简单的实验室测试数据进行训练,在这些测试中,化学物质与试管中分离的蛋白质发生相互作用。虽然这些数据很有用,但它们忽略了一个关键细节:在人体内,蛋白质并非孤立存在。它们是复杂生命网络的一部分,在这个网络中,蛋白质会与其他许多分子发生相互作用,且其行为会随着细胞环境的变化而改变。由于目前的计算机模型与这种生命语境脱节,它们往往难以预测药物在细胞内的实际表现,从而导致在开发过程后期出现失败。
为了弥补这一差距,一个研究团队开发了一种名为 C-PLANK 的新型人工智能框架。与以往从静态、孤立的实验中学习的模型不同,该系统直接利用从活细胞中生成的数据进行训练。研究人员使用了一种称为化学蛋白质组学(chemoproteomics)的技术,该技术涉及将微小的化学碎片引入细胞,以观察它们会粘附在哪些蛋白质上。这些碎片是分子的微小、简单的部分,可以与蛋白质结合,但由于这种结合通常是微弱且转瞬即逝的,捕捉这些相互作用需要一种特殊的方法。团队使用了能够永久标记其接触到的蛋白质的探针,使科学家能够绘制出这些小分子如何在细胞内庞大的蛋白质网络中进行相互作用的精确图谱。通过将这些丰富的细胞级数据输入到这个人工智能中,研究人员创建了一个不仅能理解化学物质与蛋白质是否可能发生相互作用,还能理解这种相互作用如何融入更广泛的细胞景观的模型。
该新系统的核心能力在于它能够同时观察宏观全局与微观细节。它在分析细胞整体环境的同时,还能缩放并观察蛋白质的具体部位以及化学物质的哪些原子正在发生接触。这种双重视角使模型能够为每种相互作用生成一种“指纹”,不仅显示连接的可能性,还显示系统对该预测的置信度。研究人员利用来自八项不同研究的大量数据对该框架进行了测试,这些数据涉及数百种化学物质和数千种蛋白质。他们发现,C-PLANK 一致优于现有的最先进模型,尤其是在被要求预测其从未见过的蛋白质的相互作用时。这种对新靶点的泛化能力对于药物研发至关重要,因为研发的目标通常是寻找针对尚未被充分理解的蛋白质的疗法。
除了预测相互作用之外,该系统还提供了一种在人工智能领域中罕见的透明度。它可以指出化学结构的哪些部分以及蛋白质上的哪些特定氨基酸是负责结合的。研究人员通过将模型的预测与蛋白质的物理结构及已知的结合位点进行对比验证了这一点,发现人工智能生成的“指纹”与真实的生物学现实高度吻合。这表明该模型学习的是真正的生物学规则,而非仅仅是记忆数据中的模式。为了证明其实际价值,团队使用 C-PLANK 在一个大型化学碎片库中进行筛选,以寻找一种激活特定蛋白质 SIRT3 的新方法,该蛋白质在代谢和衰老中发挥作用。该模型识别出了一个被其他方法忽略的有前景的候选物。
在做出这一预测后,研究人员合成了该化学物质并在实验室中进行了测试。该化合物成功地在活细胞内与目标蛋白质结合,并且重要的是,它增加了该蛋白质的活性,起到了激动剂的作用。随后,通过化学优化过程,这个初步的“命中”分子被进一步精炼,产生了一个更强效的版本。最终分子在低浓度下表现出强劲的活性,并通过生物物理方法证实其能直接与目标蛋白质结合。这一成功案例表明,通过利用反映真实细胞复杂性的数据来训练人工智能,科学家们可以超越简单的预测,开始对生物系统的动态状态进行建模。这项工作为未来可能作为人类生物学“数字孪生”的工具奠定了基础,帮助研究人员以更高的信心和精度,在从化学构思到临床药物的复杂旅程中航行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。