Towards reconstruction of the human interactome from positive and negative experimental evidence
本文提出了一种重建蛋白质-蛋白质相互作用(PPI)筛选实验搜索空间的方法,以推断可能的非相互作用蛋白质对,从而实现更好的误差率估计、模型校准以及改进机器学习训练,以实现对人类相互作用组更准确且更完整的映射。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在每一个活细胞内部,成千上万种蛋白质在漂浮并碰撞,不断地伸出手去试图抓住彼此。当两种蛋白质锁定在一起时,它们就形成了一个团队,可以构建结构、发送信号或分解废物。这些被称为蛋白质-蛋白质相互作用的伙伴关系,是生命的根本布线。如果没有它们,细胞将只是零件的混乱集合,而不是有组织的机器。几十年来,科学家们一直试图绘制这些连接,创建一个关于人体内谁在与谁对话的巨大网络图谱。这张地图有助于解释我们的身体在健康状态下如何运作,以及在疾病状态下如何崩溃。然而,目前的地图充满了漏洞和错误。我们已知有数百万个这样的连接,但我们也知道许多报告的链路是错误的,而许多真实的链路却缺失了。最大的问题在于,科学家们只记录了成功的会面。他们写下了哪些蛋白质握了手,但却很少记录哪些蛋白质站在彼此身边却彼此忽视。
这种沉默造成了一个盲点。如果你只知道谁见过面,你就无法判断一次会面是一次罕见的、特殊的事件,还是仅仅一次幸运的巧合。更糟糕的是,如果你尝试用计算机来预测新的会面,你必须教会它“不进行会面”看起来是什么样子的。通常,科学家通过假设任何尚未被观察到共同出现的蛋白质都是陌生人来教导计算机。但这是一种危险的猜测。仅仅因为两种蛋白质从未在一起接受过测试,并不意味着它们不发生相互作用;可能只是因为从未有人把它们放在同一个房间里。为了解决这个问题,一个研究小组致力于重建这些实验缺失的历史。他们想要找到那些蛋白质被测试过但未能连接的隐形记录。
研究人员从一个庞大的现有数据集中开始,整合了已发表的5,500多项不同实验的结果。这些实验使用了两种主要方法来测试连接:一种是在试管中混合蛋白质,另一种是在酵母细胞内培养蛋白质。在这些实验中,科学家通常测试一个“诱饵”蛋白质对许多“猎物”蛋白质的效果,以观察哪些会粘在一起。标准做法是仅报告成功的粘连。然而,该团队意识到,成功的粘连列表实际上包含了一个关于失败的隐藏线索。如果一种特定的猎物蛋白质被发现能粘附到一个试管中的诱饵上,这证明了该猎物在那个特定的实验中是存在且在工作的。因此,如果同一个猎物在同一个试管中存在,但没有粘附到另一个诱饵上,那么它一定是一个真实的“不粘连”。通过利用成功的连接来描绘出实验发生的整个空间,该团队可以推断出哪些蛋白质被测试过但未能连接。
利用这一逻辑,研究人员将大约50万个报告的相互作用转化为了一个包含近1.82亿次独立测试的更大数据集。从中,他们识别出了9,700万对经过测试的蛋白质对。至关重要的是,他们现在可以区分出那些被测试过并发现相互作用的蛋白质对,以及那些被测试过但发现并不相互作用的蛋白质对。他们专注于最可靠的数据:即那些被测试过多次的蛋白质对。他们识别出了超过1,800万对至少被测试了三次且从未显示出任何连接迹象的蛋白质对。这些不是猜测;它们是经过实验证实的“非连接”。该团队还发现了超过6,000对被反复测试且始终没有显示出连接的蛋白质对,这使他们对这些相互作用的真实性具有高度信心。
研究人员随后检查了这些新发现的“非连接”是否符合生物学逻辑。他们观察了相互作用的蛋白质是否共享共同特征,例如是否生活在细胞的同一部分或执行相似的工作,同时确认非相互作用的蛋白质对则不具备这些特征。结果完全符合预期。经证实的相互作用对比非相互作用对更有可能共享这些特征。这种验证证明了该方法是有效的:团队成功找回了之前丢失的一层负面证据。他们发现,未能连接的蛋白质在功能上确实与那些能够连接的蛋白质不同,这证实了重建的数据并非随机噪声,而是生物现实的真实反映。
有了这份新发现的、经过验证的“非连接”名单,团队测试了它如何改进科学家用于研究这些网络的方法。首先,他们利用这些数据来检查其他大规模实验的准确性。通过观察这些新的“负面”对出现在其他研究中的频率,他们可以计算出那些研究产生了多少假警报。他们发现,某些实验的错误率高达40%,这意味着它们报告的大量连接可能是错误的。这为校准和清理未来的实验提供了一种新方法。其次,他们在旨在预测相互作用的计算机模型上测试了这些数据。当他们使用这些真实的负面数据而非随机猜测来训练这些模型时,模型产生了不同且更具辨识度的预测。使用真实负面数据训练的模型比使用随机猜测训练的模型更不容易犯错,这表明,拥有关于“什么不会发生”的真实记录对于教会计算机“什么会发生”至关重要。
这项研究还揭示了关于蛋白质本身的有趣发现。有些蛋白质是著名的“粘人精”,会粘附到接触到的任何东西上,充当生物胶水;而另一些则是“自动激活器”,会在酵母实验中触发假警报。通过观察一个蛋白质被测试针对许多不同伙伴的频率,以及它未能连接的频率,团队可以识别出这些有问题的蛋白质。他们发现,那些知名的“麻烦制造者”确实是那些似乎会无差别连接的蛋白质,无论其伙伴是谁。这为在未来研究中标记和过滤掉这些嘈杂蛋白质提供了一种新方法,从而带来更干净、更准确的图谱。
最后,研究人员利用这些数据重新思考了人类相互作用网络的整体形态。长期以来,科学家们认为该网络遵循一种特定的数学模式,即少数蛋白质拥有数千个连接,而大多数只有极少数连接。然而,当团队修正了“某些蛋白质被测试得比其他蛋白质更频繁”这一事实后,这种模式消失了。相反,连接的分布看起来更像是一个钟形曲线,这表明此前地图中看到的极端“中心节点(hubs)”可能是一个实验开展方式导致的产物,而非生物学的真实特征。这一发现挑战了关于我们细胞网络是如何构建的长期假设。
这项工作并不声称已经完成了人类相互作用组(interactome)的地图。真实的网络依然广阔且在很大程度上仍未被探索。然而,通过找回失败实验的历史,该团队提供了拼图中缺失的关键一环。他们证明了,当通过适当手段重建时,证据的缺失实际上就是“不存在”的证据。这个包含数百万个确认的非连接的新资源现在已向其他科学家开放。它提供了一种方法,用于训练更好的计算机、校准更好的实验,并最终构建出一个更准确、更完整的关于人体如何在最基本层面上运作的图像。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。