在现代生物学领域,科学家们经常需要对构成活细胞的数千种蛋白质进行微观层面的清点。为了实现这一目标,他们使用一种强大的机器,这些机器就像高速摄像机一样,在分子飞过真空时捕捉它们的影像。这些被称为质谱仪的机器极其精确,不仅能捕捉每个分子的重量,还能捕捉它们在一种特殊气体中的运动方式。这种运动有助于科学家区分外观相似的分子,从而创建出样本的丰富三维图谱。然而,这种精细程度也带来了沉重的代价:生成的数据文件极其庞大。单次实验就能产生数个吉字节(GB)的信息,填满了硬盘,使得分享或存储这些发现变得缓慢且昂贵。事实证明,其中大部分数据仅仅是背景噪声——即那些并不代表真实生物分子、而仅仅是机器运行产生的伪影的微弱信号。
斯克里普斯研究所(The Scripps Research Institute)的研究人员开发了一种名为 dnoise 的新工具来解决这个问题。dnoise 并不是在数据收集后尝试进行压缩,而是像一个智能过滤器,在数据甚至被保存之前,就直接从原始文件中剔除不必要的点。该工具是专门为一种在蛋白质研究中广泛使用的名为 timsTOF 的机器设计的。科学家构建 dnoise 时,让它能够观察数据并识别出真实蛋白质信号与随机噪声之间的区别。真实的蛋白质在数据图中呈现为连续的、条纹状的线条,从一次测量到下一次测量时移动平滑。相比之下,噪声则表现为散落的、孤立的点,或者是强峰周围的微弱光晕。通过识别这些模式,dnoise 可以删除散乱的点,同时保留重要的条纹。
团队在包含人类、酵母和细菌蛋白质的复杂混合物上测试了这一工具,并在不同条件下运行实验以观察其性能。他们发现,该工具可以在不丢失任何科学价值的情况下,移除绝大部分的数据点。在某些情况下,数据文件的体积减少了一半以上,但蛋白质分析的最终结果却保持完全一致。当研究人员使用标准的鉴定软件处理清洗后的文件时,发现检测到的蛋白质和多肽数量与使用原始庞大文件时完全相同。他们测量结果的准确性(涉及比较不同样本中每种蛋白质的含量)也得到了保留。这意味着科学家现在可以使用更少的空间来存储和分享数据,而不必担心丢弃了重要信息。
研究人员还探索了该工具是否可以通过清理第二组数据(即涉及将分子破碎以进行鉴定的数据)来进行更激进的操作。虽然这进一步减小了文件大小,但也带来了一个小代价:在最终计数中漏掉了一些蛋白质。由于大多数研究的目标是尽可能多地发现蛋白质,因此团队建议使用仅清洗初始调查数据的温和设置。这种默认模式提供了最佳的平衡,既显著缩小了文件体积,又保证了科学结果的完全可靠。该工具的速度也非常快,在标准计算机上处理一次完整的实验不到一分钟,这意味着它可以在实验结束之后、数据甚至尚未传输到服务器之前即可立即使用。
这项工作解决了科学研究中一个日益严重的瓶颈问题。随着机器变得越来越灵敏,实验规模也越来越大,产生的数据量正以超过实验室存储和管理能力的速度增长。通过去除类似于无线电信号中的静电噪声,dnoise 让研究人员能够保留清晰、有用的信息,同时丢弃其余部分。该工具是开源的,这意味着其他科学家可以免费使用并对其进行改进。研究证实,目前正在收集和存储的数据中有相当大的一部分对于最终分析而言是不需要的。通过采用这种智能过滤技术,科学界可以减轻数据存储和传输的负担,使发现新生物学见解的过程对每个人都变得更快、更高效。
技术摘要:dnoise – 用于 Bruker timsTOF 的快速原生数据降维工具
问题陈述
Bruker timsTOF 仪器生成的原生 .d 文件包含极其稠密的帧,每帧包含跨越保留时间(retention time)、质荷比(m/z)和离子迁移率(ion mobility)维度的数十万个数字化点。在高通量蛋白质组学中,这种数据量在存储、传输和归档方面产生了显著的运营成本。其中很大一部分点并不对预期的分析有贡献:
- 采集约束: 在数据依赖型采集(ddaPASEF)和数据独立型采集(diaPASEF)中,特定的 m/z–迁移率平面区域被指定用于碎片化。这些区域之外的点(例如单电荷离子或预期不存在多电荷肽段的区域)虽然被记录,但从未被选中进行碎片化。
- 结构噪声: 记录的点包括稀疏、弥散的簇以及围绕强峰的弱信号“光晕”(halo)(这可能是由于微通道板饱和引起的),这些点缺乏真实肽类离子的相干迁移率结构。
现有的解决方案通常在转换为 mzML 等格式后运行,或者依赖于保留了无信息点的通用压缩方法。目前尚无开源工具能够直接移除这些点并写入一个缩减后的、与原生格式兼容的 Bruker .d 目录。
方法论
作者提出了 dnoise,这是一个旨在直接处理原生 Bruker .d 文件的开源 Rust 工具。该工具基于整数索引(迁移率扫描索引、飞行时间索引和强度)而非物理单位进行操作,仅使用校准数据来转换采集门限(acquisition gates)。其过滤流水线由应用于逐帧处理的三个主要阶段组成:
- 采集感知门限(Acquisition-Aware Gates): 该工具会移除
analysis.tdf 文件中定义的碎片化区域之外的点。对于 ddaPASEF,这是前体离子选择多边形;对于 diaPASEF,则是隔离窗口表。可选的填充(padding)机制可保护边缘特征。
- 离子-迁移率条纹过滤器(Ion-Mobility Streak Filter): 该过滤器通过检测连续迁移率扫描中相干的条纹(streaks)来识别真实的离子。它通过对相邻 TOF 窗口内的强度求和来形成迁移率剖面。被占用的扫描被分组为“运行”(runs)(通过桥接微小间隙),只有当满足最小长度阈值(
min_feature_length)时,该“运行”才会被保留。这一决策是基于迁移率占用情况而非绝对强度。
- 光晕过滤器(Halo Filter): 应用于条纹过滤器筛选后的幸存者,该过滤器会移除局部框内(不包括该点自身的 TOF 列)强度低于最大强度一定比例(默认 0.15)的点。这旨在消除强峰周围的弱光晕,同时保留离子的条纹。
可选模式:
- MS/MS 去噪: 将条纹和光晕过滤器应用于碎片光谱。这提供了更大的降维效果,但也存在丢失鉴定的风险。
- 质心化(Centroiding): 一个可选的最终阶段,通过将 MS1 点组坍缩为强度加权质心(使用分水岭算法或箱体算法)来实现极端的降维,以牺牲迁移率分辨率为代价换取更小的文件体积。
关键结果
研究人员使用一台 timsTOF Ultra 2 仪器,针对 5 分钟和 15 分钟梯度下的三种物种(人类、酵母、大肠杆菌)基准测试集(共 72 个运行)对该工具进行了评估。
- 数据降维:
- 默认 MS1 模式: 将原生帧二进制文件的大小减少了 35% 至 53%。具体而言,ddaPASEF 的降幅为 49.5–53.4%,而 diaPASEF 为 34.7–39.6%。
- 可选 MS/MS 模式: 实现了更大的降维效果(diaPASEF 为 69.7–74.3%;ddaPASEF 为 70.7–74.0%),但导致了几个百分点的肽段和蛋白质组鉴定丢失。
- 质心化: 可将 MS1 点数降低至原始数据的 2% 左右,尽管在定量覆盖度方面存在轻微权衡。
- 分析保留度:
- 鉴定: 在 ddaPASEF 中,由于 MS/MS 光谱未受影响,PSM、肽段和蛋白质组计数保持不变。在 diaPASEF 中,前体和蛋白质组计数仅发生轻微变化(0.2–2.2%)。
- 定量: 无标签定量(LFQ)的准确度和精密度在所有模式下均得到了保留。作者指出,对于 ddaPASEF,受控物种比例向预期值方向略微移动。
- 保真度: 在比较原始数据与去噪数据时,特征级强度紧密遵循等值线。
- 性能:
- 处理过程非常迅速,在标准工作站(Intel Core i7-12700H)上,所有 72 个运行在 69 秒或更短时间内即可完成。
- 内存使用量保持在可控范围内,峰值工作集低于 4.6 GB。
意义与主张
论文声称 dnoise 成功证明了在不实质性改变标准蛋白质组学工作流程结果的前提下,可以在传输或归档前移除大量原生 timsTOF 帧数据中的大部分内容。
- 原生兼容性: 与输出中间表示形式的其他方法不同,dnoise 写入一个新的、标准的 Bruker
.d 目录,确保了与现有下游软件(如 Sage、DIA-NN)的兼容性,无需任何修改。
- 结构化 vs 强度过滤: 作者认为,他们的条纹法比简单的强度阈值更优越。通过保留虽弱但具有迁移率相干性的信号,条纹过滤器保留了可搜索的信号,而强度过滤器则会丢弃这些信号,特别是对于低丰度肽段。
- 运营效率: 该工具实现了采集后的即时处理,使实验室能够在数据复制或公开提交之前降低存储和传输成本。
作者保持了审慎的态度,承认基准测试是受控的(单一仪器、特定样本载量),且默认参数可能需要针对稀疏或单细胞数据进行放宽。他们强调,如果未来的分析可能需要测试假设之外的信号,应保留原始文件,因为 dnoise 执行的是有损点移除而非无损压缩。
每周获取最佳 bioinformatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。