✨ 要点🔬 技术摘要
长期以来,科学研究一直依赖于测量生命微小构建块的能力,特别是那些在细胞内执行绝大多数任务的蛋白质。几十年来,研究人员使用一种名为质谱分析的单一且强大的方法来识别和计数这些蛋白质,但这项技术自此得到了扩展。新的平台现在使用抗体或合成 DNA 条段来测量血液及其他液体中的蛋白质,为观察相同的生物学图景提供了不同的方式。虽然这些不同的工具提供了宝贵的数据,但它们使用的语言却各不相同。分析来自一个平台结果的科学家通常无法轻易地使用相同的步骤来分析来自另一个平台的数据,这迫使他们在不同的、不兼容的软件程序之间进行切换。这种碎片化使得比较研究、重复实验或合并来自不同来源的发现以获得更清晰的健康与疾病视图变得十分困难。
为了解决这个问题,美国国家卫生研究院的一个研究小组开发了一种名为 ProtPipe2 的新工具。该软件充当了一个通用翻译器和统一的工作空间,涵盖了三种主要的蛋白质测量类型:质谱分析、基于抗体的检测以及基于适配体(aptamer)的检测。研究人员构建该系统的方式使其可以有两种运行模式:作为一套计算机程序员可以编写并运行的指令集,以及作为一个可视化的、交互式的网站,任何人都可以上传数据并点击进行分析。其核心成就在于,这两个版本都使用完全相同的底层逻辑。无论用户是在编写代码还是点击按钮,软件都会以一致的方式处理那些杂乱且技术性的步骤,例如清洗数据、检查错误以及填补缺失的数值,无论这些测量值最初是由哪种机器产生的。
团队在来自这三种平台的真实世界数据集上对 ProtPipe2 进行了测试,以确保其运行正确。在一项涉及干细胞质谱数据的测试中,该软件成功追踪了一个月内蛋白质水平的变化情况,识别出了与已知生物行为相匹配的模式。在另一项使用糖尿病患者抗体数据的测试中,该工具过滤掉了不可靠的测量值,并对比了健康个体与患者之间的蛋白质水平,凸显了两者之间存在差异的特定蛋白质。第三项测试使用了新生儿的适配体数据,其中软件纠正了由处理样本的实验室批次差异所引起的偏差,揭示了此前被技术噪声掩盖的生物信号。在每种情况下,该软件在应用统一且连贯的工作流时,都保留了每种数据类型的独特细节。
研究人员还测量了该工具在面对大量信息时的运行速度。他们模拟了包含多达 8,000 种不同蛋白质和 1,000 个样本的数据集,以观察软件在压力下的表现。该系统高效地处理了这些大型任务,在标准计算机上仅需几分钟即可完成复杂的计算。这种速度表明,该工具可以处理现代生物实验室产生的数据量增长,而无需昂贵的超级计算机。团队强调,该软件并不取代生成原始数据的初始步骤,也不会代替用户做出最终的科学决策。相反,它提供了一个可靠且透明的框架,让科学家能够专注于蛋白质所传达的关于身体的信息,而不是在分析的机械操作中苦苦挣扎。
通过将这三种截然不同的技术纳入同一个体系之下,ProtPipe2 消除了一个显著的协作障碍。研究人员现在可以获取来自质谱仪、抗体检测和适配体测试的数据,将它们通过相同的流程运行,并直接对比结果。这种能力使得跨研究验证发现以及建立对蛋白质在健康与疾病状态下如何表现的更完整理解变得更加容易。该工具已向公众免费开放,允许科学家检查代码、重复分析并基于其工作开展后续研究,从而确保从原始数据到科学发现的路径对每个人而言都是开放、清晰且可重复的。
ProtPipe2 技术摘要:多平台下游蛋白质组学分析工具
问题陈述 蛋白质组学研究日益依赖于多样化的测量技术,包括质谱 (MS)、基于抗体的 Olink 以及基于适配体的 SomaScan 平台。尽管这些技术在测量方法、输出格式和元数据结构方面存在差异,但它们具有共同的下游分析需求,如质量控制 (QC)、缺失值处理、归一化、批次校正和统计分析。目前,研究人员通常依赖于碎片化的工作流,将特定平台的导入脚本与单独的预处理及可视化工具结合使用。这种碎片化阻碍了分析选择的可追溯性,降低了可重复性,并使得跨不同平台的分析复用变得困难。现有的软件解决方案通常侧重于质谱,或需要预处理后的通用丰度矩阵,这导致研究人员在进行常规下游分析之前,必须针对 Olink NPX 或 SomaScan ADAT 文件执行额外的平台特定预处理。
方法论 ProtPipe2 是一个开源框架,以 R 包的形式实现,并配有一个由 Shiny 开发的交互式 Web 应用程序。其核心架构围绕 SummarizedExperiment 对象构建,该对象实现了所有支持平台的数据表示标准化。
数据摄取与标准化: 该工具提供了用于通用 MS 矩阵、Olink NPX 导出文件和 SomaScan ADAT 文件的专用导入函数。所有输入都会转换为一个包含 "intensities"(强度)测定值、特征注释 (rowData)、样本注释 (colData) 和处理历史 (metadata) 的 SummarizedExperiment 对象。这确保了数据可以在脚本化 R 工作流与图形化 Web 界面之间无缝移动,而无需进行格式转换。
平台特定预处理:
Olink: 导入长格式 NPX 文件,排除带有 QC 警告的样本,并将数据转换为“特征-样本”矩阵。至关重要的是,报告的 NPX 值(包括低于检测限 LOD 的值)被保留为报告值,默认情况下不会被转换为缺失值或进行插补。NPX 值的 log2 尺度得以保留。
SomaScan: 读取厂商处理后的 ADAT 文件,将研究样本与缓冲液/校准品行分离。它应用基于缓冲液的检测过滤,以识别用于评估目的的低于适配体特定缓冲液平均值的测量值,但报告的 RFU 值被保留,不进行掩盖或插补。不会重复进行厂商的归一化和校准步骤。
质谱 (MS): 支持通用矩阵导入,并提供可选的最小强度过滤,以将低丰度测量值分类为缺失值。
下游分析流水线: 该框架将分析组织为模块化的可选步骤:
质量控制 (QC): 计算检测率、样本相关性 (Spearman)、变异系数和缺失值率。
预处理: 包括基于检测率的蛋白质/样本过滤、转换 (log2(x+1))、归一化 (中位数/平均值) 和插补。插补方法包括左移正态分布(建议用于 MS)、K-最近邻 (K-nearest-neighbor)、随机森林以及均值/中位数替换。除非仍存在真正的缺失值,否则不对 Olink 或 SomaScan 进行插补;低于平台特定阈值(LOD 或缓冲液)的测量值仍作为报告值可用。
批次校正: 使用 limma::removeBatchEffect,但需要用户显式选择;它绝不会自动应用,以防止移除生物学变异。
统计分析: 使用带有经验贝叶斯调节的 limma 进行两组差异丰度分析。它支持分类组别比较和连续变量关联 (Spearman 相关性)。
通路分析: 将基因符号映射到 Entrez ID,并使用 clusterProfiler 进行基因本体 (Gene Ontology) 富集分析和基因集富集分析 (GSEA)。
可重复性: 每项操作都会将其名称、参数和细节追加到对象元数据中有序的日志中,该日志可以导出为 Markdown 报告。
核心贡献
统一的工作流: 在受评估的工具中,ProtPipe2 的独特之处在于它在一个框架内为 MS、Olink 和 SomaScan 数据提供了直接导入和通用的下游工作流。
双重界面: 它既提供用于脚本化、可重复分析的 R 包,也提供用于交互式探索的 Shiny Web 应用程序,两者使用完全相同的底层函数。
平台感知能力: 与通用工具不同,ProtPipe2 整合了平台特定的逻辑(如 Olink 的 LOD、SomaScan 的缓冲液值)和数据缩放(保留 Olink 的 log2),同时明确保留了低于这些阈值的报告值,而不是将其转换为缺失数据。
透明度: 系统显式记录了所有处理步骤和参数,便于审计和复用。
结果
案例研究: 作者通过三个不同的数据集演示了该工作流:
MS: 分析了一个通用丰度矩阵(9,119 个蛋白质,42 个样本)以生成 QC 图表、聚类和热图。
Olink: 处理炎症通路数据(142 个样本,92 个测定项目),根据 QC 标记和 LOD 进行过滤,随后进行比较糖尿病状态的差异表达分析。报告的 NPX 值(包括低于 LOD 的值)被保留,未进行插补。
SomaScan: 处理脐带血浆数据(7,596 个适配体,130 个样本),使用基于缓冲液的检测过滤和队列校正,同时保护生物学变量。报告的 RFU 值被保留,未进行掩盖或插补。
性能基准测试: 在 Apple M1 Pro 系统上的合成基准测试显示,运行时间随蛋白质数量适度增加,但随样本数量增加在聚类和 QC 操作上显著增加。最大的测试矩阵(8,000 个蛋白质 × 1,000 个样本)导致的聚类中位运行时间约为 80 秒,峰值内存使用量约为 2.84 GiB。Web 应用程序在最大数据集下的最大延迟为 17.7 秒。
对比: 表 1 强调了 ProtPipe2 在受评估工具(包括 Persece, amica, ProTIGY 和 MSstatsShiny)中的唯一性,即它支持所有三种输入格式(MS, Olink, SomaScan),同时提供基于 Web 的功能和无代码能力。
意义与主张 论文声称,ProtPipe2 通过将分散的平台特定需求统一到一个可重复的框架中,使下游蛋白质组学分析更容易执行、重复和审查。其主要贡献并非引入新的统计检验,而是将已建立的方法(如 limma, clusterProfiler)集成到一个支持图形化和脚本化交互的凝聚工作流中。作者强调,该工具旨在促进从交互式探索到可重复代码的过渡,同时让所有的分析决策都处于用户的控制之下。他们明确指出,案例研究旨在演示软件行为,并不声称对源出版物进行了独立的生物学验证。该工具作为 R 包和 Web 应用程序免费提供,旨在降低复杂蛋白质组学分析的门槛,同时保持严格的数据溯源标准。
每周获取最佳 bioinformatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。