TDEP: Predicting Target Perturbation Response from Drug-Induced Transcriptomes
TDEP 是一个利用蛋白质语言模型嵌入和图注意力网络来从药物诱导的谱图中准确预测全转录组靶点扰动响应的深度神经网络,其准确性可与基于结构的方法相媲美,同时为靶点优先级排序和药物重定位提供详细的基因层面机制见解。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
寻找适配生物锁的正确钥匙是现代药物研发的核心挑战。科学家们早已知晓,药物是通过附着在体内特定的蛋白质上起作用的,就像钥匙契合锁头一样。如果钥匙契合,它就能转动锁头,从而停止疾病或开启愈合过程。几十年来,研究人员一直尝试通过两种主要策略来预测这些匹配。一种方法观察分子的物理形状,试图看它们是否像拼图碎片一样契合。另一种方法则观察化学层面的后续影响,即观察在引入药物后,细胞内部的指令是如何变化的。虽然基于形状的方法擅长猜测是否会发生匹配,但它们往往无法解释接下来会发生什么。而化学方法虽然能展示后果,却难以精准定位究竟是哪种蛋白质引起了变化,常常迷失在细胞复杂反应的噪声之中。
韩国梨花女子大学的一个研究团队开发了一种弥补这一差距的新方法。他们创建了一个名为 TDEP 的系统,全称为“靶点扰动差异表达谱”(Target-perturbed Differential Expression Profile)。TDEP 不仅仅是预测药物是否会粘附在蛋白质上,它还能预测该蛋白质会在整个细胞指令手册(即转录组)中产生的特定连锁反应。想象一下,细胞是一个巨大的图书馆,其中的每一本书都是一个基因。当药物作用于目标蛋白质时,它不仅仅是让一本书失声,而是改变了其他成千上万本书的阅读顺序。TDEP 学习如何解读图书馆对药物的反应,然后反向推导,精确预测最初引起这种扰动的蛋白质究竟是哪一个。这使得科学家们不仅能找到匹配项,还能理解随之而来的生物学故事。
研究人员通过教计算机识别海量生物数据中的模式来构建该系统。他们从一个名为“连通图谱”(Connectivity Map)的公共数据库中,收集了大量的药物诱导基因活性变化数据。该数据库包含了超过一百万个关于不同细胞对各种化学物质反应的快照。团队将这些化学快照与药物预期作用的目标蛋白质的遗传序列配对。他们使用了一种能够理解蛋白质序列的类人工智能技术(类似于语言模型理解句子),来表示目标蛋白质。随后,他们训练该系统将特定的蛋白质与它产生的独特的基因变化模式联系起来。该系统并不仅仅回答“是”或“否”的相互作用问题,而是生成一张详细的地图,展示如果阻断该特定蛋白质,细胞的基因将会如何上升或下降。
当团队将新系统与现有方法进行对比测试时,结果令人瞩目。他们将 TDEP 与依赖分子形状的旧模型,以及依赖人工沉默基因实验的遗传数据模型进行了比较。在针对系统从未见过的药物进行的测试中,TDEP 在正确识别相互作用方面的 AUC(曲线下面积)达到了 0.87。这一表现与目前被视为金标准的最佳形状模型相当,并且显著优于那些难以达到 0.6 AUC 的旧遗传方法。研究人员发现,该系统非常擅长从给定的数据中学习,避免了仅仅死记硬背答案的常见陷阱。它学会了识别连接蛋白质与其细胞后果之间的底层生物学逻辑。
其中最重要的发现之一是该系统如何处理不同类型的未知情况。研究人员在两种场景下测试了该模型:一种是药物是新的但蛋白质是已知的,另一种是蛋白质是全新的。他们发现系统使用两种不同的工具来解决这些问题。当蛋白质已知时,系统依靠其学到的详细基因变化图谱来预测结果;当蛋白质是新蛋白质时,系统则依靠对该蛋白质遗传序列的深度理解来进行合理的推测。这种双重方法使系统具有鲁棒性,无论遇到的是新药还是新靶点,都能表现良好。此外,该系统还展示了其跨不同类型细胞进行知识迁移的能力。一个在一种癌症细胞上训练的模型,在应用于另一种癌症细胞时仍能做出准确预测,这表明这些蛋白质如何影响基因的基本规则在不同的生物背景下是共享的。
团队还仔细检查了该系统是在真正学习生物学逻辑,还是仅仅在寻找捷径。他们检查了系统预测的在阻断目标时会发生变化的特定基因,并将其与来自其他实验的真实世界数据进行了对比。他们发现两者之间存在高度一致性。例如,当系统预测阻断特定心脏相关蛋白质的效果时,它标记出的最可能发生变化的基因,与在独立实验中移除该蛋白质后实际发生变化的基因相吻合。这表明该系统捕捉到的是真实的生物信号,而非仅仅是统计噪声。研究人员指出,虽然预测并非完美且效应值有时较小,但能够生成关于药物作用的基因水平解释,是向前迈出的重要一步。它提供了一种生成关于药物如何起作用的假设的方法,而这些假设随后可以在实验室中进行验证。
尽管取得了这些成功,研究人员也谨慎地指出了这项工作的局限性。该系统目前依赖于特定癌症细胞系和已在公共数据库中进行过分析的药物数据。它尚无法预测从未在实验室中测试过的全新化学结构的效应。此外,该系统预测药物是否会与靶点相互作用,但并不测量它们的结合强度。研究人员还承认,他们使用的生物数据来自于特定的技术,如果应用于不同的测量平台,结果可能会有所不同。然而,核心成就依然在于:他们证明了高精度地预测通过特定蛋白质靶向所产生的详细转录后果是可能的。
这项工作为我们接近药物研发的方式提供了新的视角。通过超越简单的“是/否”预测,TDEP 为观察作用机制提供了一个窗口。它允许科学家通过观察预测的特定基因变化模式,来预见药物潜在的副作用或治疗益处。研究人员认为,这种方法可以帮助确定哪些药物靶点值得追求,产生关于现有药物如何发挥作用的新想法,甚至有助于发现旧药的新用途。随着生物数据库的不断扩大以及人工智能模型的日益精进,这种将蛋白质靶点与其完整细胞后果联系起来的方法,可能会成为理解和治疗疾病过程中的标准工具。这项研究作为一个概念验证,证明了将遗传序列与细胞反应数据相结合,可以产生单一方法无法实现的洞察力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。