AlphaFold Database expands to proteome-scale quaternary structures
本文描述了 AlphaFold 蛋白质结构数据库的扩展,通过纳入涵盖 4,777 个生物体的 181 万个高置信度、蛋白质组规模的同源与异源二聚体复合物预测,揭示了新的结构拓扑结构和保守的古老组装体,这些内容显著扩展了现有的实验覆盖范围,以促进功能发现。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,人体(以及所有其他生物)是一座繁忙而喧嚣的巨大城市。在这座城市里,蛋白质就是其中的工人。长期以来,科学家一直认为这些工人是独立的个体,各自孤立地完成工作。我们甚至建立了一个巨大的数字图书馆,称为 AlphaFold 数据库,其中包含了数百万个这些“单人员工”的蓝图,向我们展示了它们在三维空间中的精确模样。但问题在于:在真实的城市中,蛋白质很少单独工作。它们是社交型生物,不断组队、握手,并组成复杂的机器来完成任务。这些团队被称为“复合物”。直到现在,我们的图书馆还缺少这些团队的蓝图。我们知道工人们是谁,但我们不知道他们是如何握手或建造机器的。这很重要,因为如果你想修理一台损坏的机器或了解一座城市是如何运转的,你需要看到工人们在一起的样子,而不仅仅是站立在一起的个体。
现在,由欧洲分子生物学实验室、首尔大学、NVIDIA 和 Google DeepMind 的科学家们发起的一项大规模协作,终于为这个缺失的图书馆部分打开了大门。他们不仅是在进行猜测,而是利用超级计算机预测了超过 3100 万个潜在蛋白质团队的三维形状。从这一座预测的高山中,他们过滤掉了那些不稳定的猜测,保留了 181 万个高置信度的蛋白质配对模型。你可以把它想象成将图书馆从一个单人肖像集升级为一个庞大的集体照画廊。他们发现,虽然有些团队看起来与我们之前在显微镜下观察到的非常相似,但许多其他团队却是全新的,揭示了当我们只观察单个蛋白质时完全无法看到的结构。这项新资源现在已向所有人免费开放,为观察生命分子机器是如何实际组装提供了全新的视角。
重大飞跃:从独奏到团队运动
多年来,AlphaFold 蛋白质结构数据库(AFDB)就像是一个个体演员的照片集。它以惊人的准确度提供了单个蛋白质的三维形状,彻底改变了我们对生物学的理解。但生物学很少是独奏。蛋白质通常通过抓取其他蛋白质来发挥功能,形成配对或更大的群体,以执行诸如发送信号、构建细胞壁或复制 DNA 等任务。问题在于,虽然我们有了演员的照片,但我们却没有得到他们二重唱的照片。
这篇新论文描述了该数据库的一次大规模扩张。团队预测了来自 4,777 种不同生物体的 3100 万个候选蛋白质对(称为二聚体)的结构,涵盖了从常见的实验室细菌到对全球健康至关重要的生物。他们并没有把所有东西都混在一起;他们使用了一套严格的过滤流程来寻找最可靠的预测。在通过质量检查后,他们确定了 181 万个高置信度结构。这些是“金标准”模型,即计算机非常有把握地认为这两个蛋白质确实是以预测的方式相互握手的。
为什么观察配对会改变一切
这项发现最令人兴奋的部分是,将蛋白质视为一个团队往往会彻底改变整个故事。有时,一个蛋白质在单独预测时看起来像是一个杂乱、无法辨认的团块,但当你把它放在它的伙伴旁边时,它就会精准地卡入一个完美的、清晰的形状。
作者发现了几种发生这种情况的方式:
- “拼图碎片”效应: 一些蛋白质就像拼图碎片,只有当它们组合在一起时才有意义。例如,一种来自黏菌(一种微生物)的蛋白质在单独存在时看起来像是一个破碎、低置信度的混乱体。但当作为一对进行建模时,两半交换了彼此的结构部分以完成对方的形状,从而形成了一个完美的、高置信度的机器。
- “筑墙者”效应: 一些蛋白质就像需要堆叠成墙的砖块。一个参与细胞清理(自噬作用)的蛋白质在单独存在时看起来是一个摇摆不定、不确定的螺旋束。但当它与其孪生兄弟配对时,它们形成了一个坚固、连贯的结构,清晰地定义了细胞膜应该在哪里,而单体模型无法弄清楚这一点。
- “建筑师”效应: 即使单个蛋白质看起来很好,加入一个伙伴也可以修复其不同部分的排列方式。有一个蛋白质拥有一个置信度很高的形状,但其两个主要部分之间的距离是一个猜测。当作为一对进行建模时,伙伴起到了支架的作用,将这两个部分锁定在正确的位置。
简而言之,这篇论文表明,对于许多蛋白质来说,“真实”的形状只有在它们处于复合物中时才会存在。你不能通过孤立地观察各个部分来理解全貌。
数据告诉我们的信息
该团队不仅制作了漂亮的图像,还进行了数学计算,以观察这些预测的可靠性。他们为什么是“高置信度”团队设定了严格的规则。他们发现:
- 同源二聚体(相同的配对): 大约有 9.1% 的预测相同配对通过了高置信度测试。这非常多!这表明当两个相同的蛋白质组队时,计算机非常擅长弄清楚它们是如何契合的。
- 异源二聚体(不同的配对): 只有大约 1.0% 的预测不同配对通过了测试。这个比例较低,作者认为这是因为他们撒了一个大网来寻找潜在的伙伴,这意味着他们测试的许多配对在现实生活中可能并不实际发生相互作用。
- 古老的团队: 当他们按相似性对这些结构进行分组时,他们发现排名前 1% 的最常见结构占据了所有高置信度复合物的约 44%。更令人着迷的是,大约 8.3% 的这些常见结构存在于完全不同的生命分支中(如细菌、植物和动物)。这表明其中一些蛋白质团队是非常古老的,由于它们运作得非常好,已被进化保留了数十亿年。
超越已知世界
这次研究最大的收获之一是这个新世界中有多少是“新”的。当他们将这 181 万个高置信度模型与现有的实验确定结构库(PDB)进行比较时,他们发现 31.3% 的单个预测与他们在显微镜下见过的任何东西都不匹配。在群体(簇)层面,63.6% 的独特结构没有已知的实验匹配。
这意味着该数据库不仅是在填补空白,它还在发现全新的领域。虽然许多这些预测都锚定在已知事物之上(这让科学家对使用它们充满信心),但很大一部分则延伸到了未知的领域,为那些实验学家尚未发现的结构提供了假设。
总结
这篇论文是一个巨大的进步,它将 AlphaFold 数据库从一个单人肖像集转变为一个动态的分子团队协作画廊。通过提供 181 万个高置信度的蛋白质配对模型,作者们为生物学家提供了一个新工具,用于生成关于蛋白质如何相互作用、疾病可能如何破坏这些团队以及如何设计新药的假设。他们并不是声称已经解决了宇宙中所有的蛋白质相互作用,但他们提供了一个可扩展、可靠的框架,弥合了已知与我们需要发现的内容之间的鸿沟。图书馆现在已经开放,集体照正等着你去探索。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。