← 最新论文
📄 molecular biology

Structure-free, site-resolved contrastive learningextends small-molecule discovery beyond the reachof structure-based modeling

本文介绍了 Ptarmigan-1,这是一种无结构、位点解析的对比学习模型,通过直接嵌入蛋白质序列和二维化学结构,而无需构建显式的三维构象,实现了跨多种蛋白质靶点(包括隐性位点和无序位点)的快速且准确的虚拟筛选。

原作者: Fondrie, W. E., Canzani, D., Tatka, L., Paez, J. S., Prymolenna, A., Gutierrez, A., Robbins, J., McEllin, B., Hubbard, E., Siebenthall, K., Pino, L. K., Federation, A. J.

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Fondrie, W. E., Canzani, D., Tatka, L., Paez, J. S., Prymolenna, A., Gutierrez, A., Robbins, J., McEllin, B., Hubbard, E., Siebenthall, K., Pino, L. K., Federation, A. J.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探:如何通过找到完美的钥匙(药物分子)来阻断一个特定的罪犯(致病蛋白)所留下的锁孔。几十年来,科学家们一直试图通过构建罪犯之手的 3D 模型(蛋白质的形状),然后尝试数百万把钥匙,看哪一把能契合这个锁。这就像是在显微镜下观察每一根干草,试图在干草堆中寻找一根针。如果那只手保持着稳定、清晰的形状,这种方法效果很好,但许多罪犯非常混乱、多变,或者把手藏在黑暗中。这些“不可成药”的目标之所以难以攻克,是因为我们无法看到一个清晰的锁孔来适配钥匙。世界药物研发领域的一个大问题一直是:我们能否在不需要看到锁的情况下,找到正确的钥匙?

Ptarmigan-1 应运而生,它是由 Talus Bioscience 的研究人员开发的一种新型数字侦探。它并不试图构建蛋白质或药物的 3D 模型,而是学习通过它们的“指纹”——即它们的遗传序列和化学式——来识别它们。这就像是一个音乐应用,仅仅因为一首歌的声音与你喜爱的歌曲相似,就能预知你会喜欢它,而无需看到乐队或音乐会现场。Ptarmigan-1 将蛋白质序列的“音乐”和药物化学的“音乐”都转化为一种共享的、无形的语言。在这种语言中,适配某种蛋白质的药物会紧挨着它,就像拥挤房间里的朋友一样。论文表明,这种方法可以在不到一天的时间内,扫描人体内每种蛋白质对应的数十亿种药物,并找到传统 3D 模型会错过的匹配项,尤其是那些曾让科学家困惑多年的混乱且多变的靶点。

旧方法 vs 新方法

长期以来,寻找新药就像是通过先建立锁的模型,来为特定的锁寻找特定的钥匙。科学家们会使用计算机创建蛋白质“口袋”(锁)的 3D 图像,然后模拟药物分子(钥匙)如何扭转和旋转以进入其中。这被称为分子对接(molecular docking)。最近,超级智能的 AI 模型开始预测整个蛋白质-药物复合物的形态,几乎就像是将一张纸折叠成一只纸鹤。当蛋白质是一个固体、定义明确的形状时,这些方法表现出色。但许多重要的蛋白质(如涉及癌症或免疫反应的蛋白质)就像果冻或流沙一样。它们没有固定的形状,因此你无法为它们构建模型的锁。如果你试图强行将 3D 模型套用在它们身上,计算机只会猜测一个并不存在的形状,从而导致错误的线索。

作者认为,这种对构建 3D 姿态的痴迷实际上阻碍了药物研发。这种方式缓慢、昂贵,并且对最需要帮助的靶点视而不见。他们提出,我们其实不需要看到 3D 形状就能知道一种药物是否有效;我们只需要知道药物的“氛围(vibe)”是否与蛋白质的“氛围”相匹配。

Ptarmigan-1 的工作原理:伟大的媒人

Ptarmigan-1 是一个“对比学习(contrastive learning)”模型,这是一种高级说法,意指它是一位精通配对的媒人。它不构建 3D 模型,而是获取两样东西:构成蛋白质的字母序列(像是一句长句)和药物的化学代码(像是一个食谱)。它利用两个强大的 AI 大脑——一个经过蛋白质训练,另一个经过化学物质训练——将两者都翻译成一个共享的、无形的空间。

想象一个巨大的、隐形的舞池。舞池的一侧是数千种蛋白质,另一侧是数十亿种潜在药物。Ptarmigan-1 不关心它们的身体形状;它关心的是它们的律动。如果一种药物与某种蛋白质是良配,模型就会在舞池中将它们拉近,直到它们几乎触碰在一起。如果它们不匹配,模型就会将它们推开。其神奇之处在于,它无需构建它们握手的 3D 图像即可完成此操作。它只是通过“指纹”的对齐,就知道它们属于彼此。

由于它不需要为每一对组合构建 3D 模型,因此它的速度极快。论文报告称,Ptarmigan-1 对一种药物进行评分仅需 10 毫秒。相比之下,领先的 3D 模型(Boltz-2)完成同样的工作需要 54 秒。这意味着它实现了 5,000 倍的加速。这种速度让团队能够在不到一天的时间内,针对全人类蛋白质组(共 20,431 种人类蛋白质)筛选 34 亿种化合物。这就像是在冲一杯咖啡的时间里,检查了体育场里的每一个人是否能打开巨型保险库里的每一把钥匙。

在混乱的干草堆中寻找针头

Ptarmigan-1 的真正考验在于,它能否为那些 3D 模型失败的“混乱”靶点寻找药物。研究人员测试了三种类型的挑战:

  1. 结构良好型靶点: 对于具有清晰、稳定形状的蛋白质(如标准教科书中的蛋白质),Ptarmian-1 的表现与最好的 3D 模型一样出色。它能找到正确的药物,证明它不需要 3D 模型也能保持准确。
  2. 隐蔽性与共价靶点: 一些蛋白质拥有只有在药物到达时才会开启的隐藏口袋,或者拥有药物可以进行化学“粘合”的特定位点。传统模型经常错过这些,因为它们无法预测隐藏的形状。然而,Ptarmigan-1 成功识别了这些匹配。例如,即使在不知道蛋白质形状的情况下,它也找到了能粘附在特定半胱氨酸氨基酸(一个“胶粘点”)上的药物。
  3. 无序靶点: 这是最大的胜利。一些蛋白质是本质无序的——它们就像永远无法定型的意大利面。论文显示,对于这些靶点,3D 模型基本上选择了放弃,表现得并不比随机猜测好多少。然而,Ptarmigan-1 仍然找到了强力的匹配。它能将药物定位到这些混乱蛋白质的正确部分,这表明即使没有可见的“锁”,这种“氛围”匹配依然有效。

现实世界的测试:STAT6 之谜

为了证明这不仅仅是计算机技巧,团队在现实世界的谜题上测试了 Ptarmigan-1:一组针对 STAT6 蛋白(参与免疫反应)的新药。这些药物最近在专利中披露,但并未包含在模型的训练数据中。这些药物的设计目标是契合 STAT6 蛋白上一个浅且复杂的口袋。

当研究人员运行测试时,Ptarmigan-1 正确地将这些药物识别为最佳匹配,并且至关重要的是,它精确地指出了药物结合在蛋白质上的正确位置(SH2 结构域)。相比之下,3D 模型(Boltz-2)未能找到正确的位点,而是猜测了一个完全错误、不正确的蛋白质位置。这表明 Ptarmigan-1 能够为它从未见过的“锁”找到正确的“钥匙”,即使这个锁很浅且形状奇特。

未来:一种全新的搜索方式

作者认为,这改变了我们对药物研发的思考方式。我们不再需要为每一个新蛋白质和每一个新药物构建新的 3D 模型(这非常耗时),我们只需要查找它们在这个共享无形空间中的“距离”。一旦建立了这个空间,寻找匹配就像进行谷歌搜索一样简单。

论文总结道,虽然 3D 模型在理解药物如何契合的微观细节方面仍然有用,但它们在初步搜索阶段并非必需。通过将搜索与 3D 结构解耦,Ptarmigan-1 为寻找那 87% 因缺乏清晰形状而被视为“不可成药”的人类蛋白质打开了大门。它表明,药物研发的未来不在于构建更好的 3D 模型,而在于学习一种更好的语言,来描述蛋白质与药物是如何相互交流的。

简而言之,Ptarmigan-1 证明了你不需要看到锁才能找到钥匙;你只需要知道正确的节奏,让它们翩翩起舞。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →