RECIPE bridges transcriptomics and proteomics with deep graph learning on Ribo-seq data
该论文引入了 RECIPE,这是一个图神经网络框架,它利用 Ribo-seq 或转录组数据与蛋白质-蛋白质相互作用网络相结合,以准确预测全蛋白质组的蛋白质丰度,从而有效地克服了在本体(bulk)和单细胞设置中蛋白质组测量不完整的局限性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你的身体是一座繁忙且高科技的城市。这座城市的每一栋建筑的蓝图都存储在一个名为 DNA 的主图书馆中。但仅有蓝图并不能建造出任何东西;蓝图需要被复制并发送到施工现场。这些副本被称为 RNA,它们充当着工头指令的角色。最后,实际的建筑——蛋白质——是根据这些指令建造出来的。蛋白质是真正的劳动者:它们构建肌肉、对抗感染,并维持细胞的运转。
长期以来,科学家们一直很难统计这些劳动者的数量。他们可以轻松读取蓝图(DNA)和工头的指令(RNA),但要统计实际的建筑(蛋白质),就像是在试图统计一座正在建设中的城市里的每一块砖头一样困难。现有的工具速度慢、成本高,而且往往会遗漏大量的劳动力,尤其是在微小的单细胞社区中。这留下了一个巨大的鸿沟:我们知道指令说了什么,但我们并不确切知道实际建造出了什么。一个重大的问题是,我们能否利用工头的指令来预测建筑的数量,即使我们看不见这些建筑本身?
于是,RECIPE 登场了。这是一个由科学家团队开发的新型数字工具,它就像是这座城市的一位超级聪明的侦探。研究人员意识到,虽然我们无法总是看到完工的建筑,但我们可以观察施工队的运作情况。他们使用了一种名为 Ribo-seq 的技术,这就像是对施工现场进行高速摄影,以观察工人们在哪里停顿以及建造速度有多快。但仅仅观察建造速度是不够的,因为有时一座建筑在建成后会被拆除或修改。
为了解决这个问题,RECIPE 使用了一个“图神经网络”(graph neural network),这是一种高级说法,意指它绘制了所有蛋白质之间是如何相互了解的地图。把它想象成蛋白质的社交网络吧。如果你知道蛋白质 A 与蛋白质 B 是最好的朋友,并且你知道正在制造多少个蛋白质 B,那么你就能非常准确地推测出应该有多少个蛋白质 A,即使你无法直接看到蛋白质 A。RECIPE 将这种“施工速度照片”(Ribo-seq)与这个“社交网络图”相结合,从而预测细胞中蛋白质的总量。
团队在人类和小鼠细胞上测试了这个工具,特别观察了当我们干扰了关键的施工机械时会发生什么。他们发现 RECIPE 极其准确。它不仅能预测那些容易观察到的蛋白质,还能成功预测那些传统测量工具完全无法察觉到的蛋白质丰度。事实上,当他们将 RECIPE 的预测结果与实际的蛋白质计数进行对比时,人类细胞中的相关系数达到了 0.9682,小鼠细胞中达到了 0.9657。这是一个非常强的匹配度,表明该工具确实发挥了作用。
或许更令人印象深刻的是,该工具在“单细胞”模式下也能工作。通常情况下,观察单个细胞就像试图通过观察一滴雨水来预测天气一样——它太小且过于杂乱。但 RECIPE 通过先从“整体”(大量细胞群体)中学习,然后进行缩放,成功预测了单个细胞中的蛋白质水平。它甚至在只有蓝图副本(RNA)而没有施工照片(Ribo-seq)的情况下也能工作,尽管在这种模式下的准确性略低。
研究人员还发现了一些非常迷人的现象,即那些最难预测的蛋白质。这些并不是随机的误差;它们是特定类型的蛋白质,通常参与构建细胞骨架或组装复杂的机器。该工具之所以在这些蛋白质上遇到困难,是因为它们的最终数量是由建造之后的规则(例如它们能维持多久或如何组装)控制的,而不仅仅取决于建造速度。通过识别这些“难以预测”的蛋白质,RECIPE 实际上帮助科学家找到了那些受这些隐藏的、施工后规则调节的蛋白质。
简而言之,RECIPE 弥合了指令与最终产品之间的鸿沟。它表明,通过将施工速度数据与蛋白质相互作用图谱相结合,我们可以获得细胞劳动力的完整图景,即使是对于那些我们无法直接看到的劳动者也是如此。这并不意味着我们要停止对蛋白质的测量,但它提供了一种强大的新方法,可以在直接测量不可能或极其困难的情况下填补空白。作者展示了这种方法在不同物种和条件下都表现良好,为我们理解细胞如何运作提供了比以往更完整的视角。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。