← 最新论文
🧬 biology

The PRIDE Affinity-Proteomics Archive (PRIDE-AP): Making Affinity Proteomics Data FAIR

本文介绍了 PRIDE-AP,这是 PRIDE 基础设施内的一个全新的符合 FAIR 标准的开放数据存储库,它通过实现数据集的标准提交、验证和跨技术集成,解决了高通量亲和蛋白质组学缺乏专用存档的问题,从而加速生物标志物的发现。

原作者: Deepti J. Kundu, Asier Larrea-Sebal, Selvakumar Kamatchinathan, Chakradhar Bandla, Nithu Sara John, Nandana Madhusoodanan, Suresh C. Hewapathirana, Boma Brown-Harry, Jingwen Bai, Kathleen T. Nevola, K
发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Deepti J. Kundu, Asier Larrea-Sebal, Selvakumar Kamatchinathan, Chakradhar Bandla, Nithu Sara John, Nandana Madhusoodanan, Suresh C. Hewapathirana, Boma Brown-Harry, Jingwen Bai, Kathleen T. Nevola, Klev Diamanti, Parul Tewatia, Claudia Fredolini, William F. Beimers, Joshua J. Coon, Jack S. Gisby, James E. Peters, Yue Wu, Sara Ahadi, Magnus Palmblad, Michael P. Snyder, Juan Antonio Vizcaíno, Yasset Perez-Riverol

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,医学研究的世界就像一座巨大的图书馆。多年来,研究蛋白质(这些微小的构建模块告诉我们的细胞该做什么)的科学家们一直有两种收集信息的方式。

一种方式就像是为样本中的每一个蛋白质拍摄一张高分辨率的照片。这被称为质谱技术 (Mass Spectrometry, MS)。长期以来,这座图书馆都有一个专门且有序的部分来存放这些照片。科学家可以轻松地找到它们、检查质量并将其与其他数据进行对比。

另一种方式则像是使用一种专门的金属探测器来寻找特定的、预先选定的蛋白质。这被称为亲和蛋白质组学 (Affinity Proteomics, AP)(使用像 Olink 和 SomaScan 这样的工具)。虽然这种方法在发现疾病标志物方面变得极其流行,但它就像是一堆散落在地板上的零散纸张。这里没有专门的架子来存放它们。有些被锁在私人房间里,有些放在通用储物箱里,而且它们的标签规则也不统一。这使得其他科学家很难找到它们或信任这些数据。

于是,PRIDE 亲和蛋白质组学存档库 (PRIDE-AP) 应运而生。

你可以把 PRIDE-AP 想象成专门为这些“金属探测器”研究而新建的图书馆新翼楼。以下是它的运作方式,使用了简单的类比:

1. “地址标签”系统

以前,如果你发现了一个数据集,你可能不知道它是真实的,或者它是否会永远在线。现在,每一个提交到 PRIDE-AP 的数据集都会获得一个永久的地址标签(唯一的 ID 和 DOI)。这就像是给每本书贴上一个永不改变的条形码。即使图书馆搬迁或互联网环境发生变化,你始终可以通过这个条形码找到那本特定的书。

2. “标准化文件柜”

想象一下,如果你试图整理一份食谱,但有人用段落写配料,有人用列表,而第三个人用的是图画。这简直是一团乱。
PRIDE-AP 引入了一套严格的标准化归档系统(称为 SDRF-Proteomics)。现在,每位科学家都必须填写一份特定的表格,清晰地说明:

  • 使用了哪些样本?
  • 使用了哪台机器?
  • 数据是如何处理的?
    这确保了来自不同科学家的“食谱”看起来完全一致,从而易于相互比较。

3. “质量控制检查员”

当你购买一件产品时,你会希望它是安全可靠的。PRIDE-AP 充当了数据的质量控制检查员

  • 它使用一个特殊的计算机程序(名为 pyprideap 的免费程序)来自动检查数据。
  • 它会寻找“故障”,比如缺失的数字或不该出现的异常峰值。
  • 它会为每个数据集生成一份“成绩单”,显示测量结果的可靠程度。这有助于科学家在下载文件之前,就能知道是否可以信任这些结果。

4. “桥梁搭建者”

这是最独特的功能。想象一下,你有一张风景照片(质谱技术)和一份该风景中特定树木的清单(亲和蛋白质组学)。以前,它们位于两个不同的建筑里。PRIDE-AP 允许科学家将这两种类型的数据联系在一起(如果它们来自同一项研究)。它在“照片”和“清单”之间架起了一座桥梁。

  • 你可以查找特定的蛋白质(比如某种特定类型的树),并查看关于它的所有证据,无论它是通过高分辨率相机发现的,还是通过金属探测器发现的。
  • 它直接连接到 UniProt,这就像是蛋白质的“百科全书”。如果你在百科全书中查找某种蛋白质,它现在会指向这些新的数据集,反之亦然。

目前图书馆里有什么?

截至 2026 年 5 月,这个新翼楼已经开放并投入使用。它拥有 20 个公开数据集,涵盖了 14 种不同的人类疾病。这些数据集包含了超过 10,000 种独特蛋白质的证据。

这为什么重要?

论文解释说,通过将这些散落的纸张放入这个有序、高质量的存档库中,科学家终于可以:

  • 查找数据(它不会丢失在抽屉里)。
  • 获取数据(无需特殊权限,它是开放的)。
  • 互操作(因为它们使用相同的归档系统,因此可以混合和匹配不同研究的数据)。
  • 重用数据(用于新的发现,例如检查在一项研究中发现的蛋白质是否也出现在另一项研究中)。

简而言之,PRIDE-AP 将亲和蛋白质组学数据的“西部荒野”状态转变为一个井然有序、高质量且互联互通的图书馆,让科学家能够在更大规模上比较不同的蛋白质测量方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →