癌症研究在很大程度上依赖于一种简单而强大的工具:癌症细胞系。这些是在实验室培养皿中培养的癌症细胞群,它们被维持生命状态长达数十年,被科学家用于研究肿瘤的行为并测试新药。由于它们易于培养和分享,因此成为了临床前研究的支柱。然而,一个顽固的问题长期困扰着该领域:在培养皿中生长的细胞的研究结果往往无法转化为针对实际患者的成功治疗。培养皿中的细胞缺乏人体复杂的环境,并且随着时间的推移,它们在遗传和化学性质上可能会逐渐偏离最初提取时的肿瘤。为了弥补这一差距,研究人员需要一种方法,能够将这些实验室培养的细胞的分子组成与真实患者肿瘤的分子组成进行直接比较。虽然科学家们已经成功实现了对这两组数据的遗传指令(即 RNA)的比较,但对于蛋白质——即药物通常作用的实际工作分子——进行类似的比较仍然难以实现。这主要是因为蛋白质数据极其杂乱,由于测量仪器能力的限制,经常会出现大面积的信息缺失。
研究团队现在开发了一种名为 ProtInt 的新方法来解决这个特定的难题。他们将这种方法应用于海量数据,结合了来自 771 种不同癌症细胞系的蛋白质测量数据,以及来自 13 种不同组织类型的 550 个初治患者肿瘤的数据。其目标是创建一个统一的图谱,让这两个截然不同的群体能够并排呈现,不再是两个孤立的岛屿,而是同一个景观的一部分。研究人员发现,用于清理数据或对齐遗传信息的标准方法无法处理蛋白质数据中特有的空白和缺失值。当他们试图强行使用这些旧方法时,细胞系和肿瘤仍然保持着顽固的分离状态。ProtInt 则不同,它使用了一个复杂的学习系统,该系统理解蛋白质是如何被测量的,以及数据为何会缺失。它学会了以一种现实的方式填补空白,同时调整数据,以便使细胞系和肿瘤可以直接进行比较。
结果显示,ProtInt 成功地合并了这两个数据集。在新的统一视图中,实验室培养细胞与患者肿瘤之间的这种人为分离消失了。它们不再是两个截然不同的簇,而是开始根据其来源的组织类型(如肺、乳腺或血液)进行分组。这种对齐并非对每种组织类型都完美无缺;例如,来自中枢神经系统和平滑肌的细胞系仍然难以与对应的肿瘤相匹配,这可能是因为这些特定细胞在培养皿中生长时发生了显著变化。然而,对于许多其他组织来说,该方法效果显著。当研究人员仔细观察对齐过程中发生了什么变化时,他们看到了一个清晰的生物学故事。随着细胞系被调整得更像真实的肿瘤,它们的蛋白质谱呈现出可预测的变化。它们表现出与免疫系统、细胞间通信以及与周围组织结构相互作用相关的蛋白质增加;与此同时,涉及基础细胞机制(如复制遗传指令和产生能量)的蛋白质则减少了。这种转变反映了现实情况:真实的肿瘤存在于复杂的身体环境中,而实验室细胞通常是孤立的,且纯粹专注于快速生长。
研究还测试了不同的数学策略是否能达到同样的结果。研究人员将他们的法与依赖不同学习技术(例如试图强制数据循环回原始状态的方法)的其他方法进行了比较。他们发现,这些替代方案的表现并不理想;它们要么无法有效地混合数据,要么引入了过多的误差。ProtInt 之所以表现优异,是因为它专门考虑了蛋白质实验中缺失数据的行为模式,即不将空白视为随机噪声,而是将其视为与蛋白质丰度相关的模式。这使得系统能够高精度地重建缺失值,确保最终的比较是基于一个完整的图景。研究人员指出,虽然该方法适用于他们使用的这类特定蛋白质数据,但尚未准备好用于其他使用不同标记方式的常见实验室技术。
最终,这项工作为理解复杂生物学数据提供了一个新的框架。通过成功整合细胞系和肿瘤的蛋白质组,ProtInt 提供了一种识别哪些实验室细胞系与特定患者癌症最匹配的方法。这可以帮助科学家为他们的实验选择最相关的模型,从而可能减少临床试验失败的数量。该方法并不声称已经解决了整个癌症治疗问题,也不保证在这些对齐后的细胞上测试的每种药物都能在患者身上奏效。相反,它提供了一个更清晰、更准确的视角,用以观察实验室与临床之间的差异。研究人员已向科学界开放了他们的代码,邀请他人使用这一工具来探索此前相互脱节的细胞系与肿瘤生物学世界。
技术摘要:ProtInt —— 细胞系与肿瘤蛋白质组数据的整合
问题陈述
癌症细胞系在临床前研究中不可或缺,然而这些模型的发现往往难以转化为临床成功,原因在于体外培养物与患者肿瘤之间存在生物学差异。虽然目前已存在用于对齐转录组数据(细胞系与肿瘤)的整合方法,但针对蛋白质组数据的类似方法仍然匮乏。蛋白质组整合的一个主要障碍是缺失值的普遍存在,这些缺失值源于随机缺失(MAR)和非随机缺失(MNAR)机制。标准的批次校正方法(如 ComBat、Harmony)旨在消除生物学相似数据集之间的技术变异,却无法解决区分细胞系与肿瘤之间深刻的生物学及技术差异。此外,现有的转录组整合工具(如 Celligner、MOBER)并未显式地对标签无关(label-free)蛋白质组学中特有的强度依赖性缺失模式进行建模,通常将缺失值重建为零,而非合理的低丰度估计值。
方法论:ProtInt 框架
作者引入了 ProtInt,这是一个旨在通过同时进行数据整合与填补(imputation)来整合来自细胞系和患者肿瘤的标签无关蛋白质组数据的深度学习框架。ProtInt 结合了三个核心组件:
- 条件变分自编码器 (cVAE): 该模型将对数转换后的蛋白质强度 (x) 和数据源协变量 (c,指示细胞系或肿瘤)编码进潜嵌入空间 (z)。解码器负责重建蛋白质表达分布。与标准填补不同,ProtInt 遵循 PIMMS 方法,仅重建观测到的强度,从而避免向非缺失数据引入噪声。
- 概率丢弃模型: 为了应对 MNAR 模式,ProtInt 引入了一个源自 msBayesImpute 的概率丢弃函数 (Φ)。该函数将蛋白质缺失的概率建模为其强度的函数。模型通过最小化二元交叉熵损失 (Ldropout),使解码器估计的缺失情况与观测到的缺失模式保持一致,从而能够生成合理的缺失值估计,而非简单地默认为零。
- 对抗训练: 为了在去除数据源偏差(区分细胞系与肿瘤)的同时保留生物学变异(组织来源),ProtInt 采用了对抗神经网络。判别器试图从潜嵌入中预测数据源,而编码器则通过最大化该预测误差进行训练,从而学习到一个数据源不变量的潜空间。
作者评估了其他架构,包括受单细胞转录组整合启发的循环一致性(cycle consistency),并发现对抗训练在整合蛋白质组数据方面优于循环一致性,尤其是在较高的权重参数下,且不会损害生物学信号的保存。
核心贡献
- 首个蛋白质组整合深度学习框架: Prot 而言,ProtInt 是第一个专门开发用于整合不同生物学背景下(细胞系 vs. 肿瘤)蛋白质组数据的模型,同时显式地对 MNAR 缺失进行了建模。
- 同步填补与整合: 通过将填补过程集成到对抗训练循环中,ProtInt 避免了先进行序列填补再进行整合所带来的误差传播问题。
- 基准测试: 本研究通过在一个泛癌蛋白质组数据集上,将 ProtInt 与传统的批次校正方法(ComBat、limma、Harmony)以及转录组整合方法(Celligner、MOBER)进行了全面的基准对比。
结果
作者应用 ProtInt 整合了涵盖 13 种组织类型的 771 个癌症细胞系和 550 个初治肿瘤样本的标签无关蛋白质组谱图。
- 整合性能: ProtInt 成功消除了联合嵌入空间中细胞系与肿瘤之间的分离,这是批次校正或基于转录组的方法无法实现的。定量指标(graph iLISI)证实,ProtInt 实现了最高水平的数据集整合。虽然与原始数据相比,生物学信号的保存(graph cLISI)略有下降,但这归因于数据集的成功混合,而非组织特异性聚类的丢失。
- 填补质量: 模型生成了合理的缺失值估计,通常填补出的强度低于检测到的强度,这符合生物学预期,即低丰度蛋白质更容易未被检测到。
- 生物学见解:
- 组织特异性对齐: 整合后,来自造血/淋巴、大肠、乳腺和神经外胚层组织的细胞系,与其对应的肿瘤在蛋白质组学上的相似性高于来自中枢神经系统(CNS)或平滑肌组织的细胞系。
- 蛋白质组偏移: 对细胞系在“肿瘤投影”前后的差异分析显示了反复出现的改变。与免疫反应、细胞间通信和细胞外基质相互作用相关的蛋白质丰度增加,反映了获取微环境特征的过程。相反,涉及转录、转录后加工和线粒体基因表达的蛋白质丰度降低,这可能反映了肿瘤相对于快速分裂的细胞系而言,其增殖速率降低及代谢状态改变。
- 分类: 当根据 ProtInt 嵌入空间中最接近的细胞系邻居对肿瘤样本进行分类时,38% 的样本被正确分配到了其组织来源,且在特定组织类型(如肺、乳腺)中观察到更高的准确率。
意义与声明
本文将 ProtInt 定位为一个促进跨不同生物学环境进行蛋白质组数据集联合分析的框架。作者声称,ProtInt 使识别最接近患者肿瘤的细胞系成为可能,这对于选择具有临床相关性的临床前研究模型至关重要。
作者也审慎地指出,尽管 ProtInt 改善了蛋白质组的对齐,但由于当前数据集中缺乏匹配的药物反应数据,目前尚无法明确证明对齐后的细胞系是否表现出与相邻肿瘤相似的药物敏感性。他们建议将此作为未来的验证方向。此外,作者承认了目前的局限性,指出 ProtInt 是为标签无关数据设计的,对于可能改变强度与缺失性关系的标签法(如 TMT)数据,可能需要进行调整。作者强调,ProtInt 为未来的扩展(如整合单细胞蛋白质组学数据或建模跨不同数据模态的缺失模式)奠定了基础。
每周获取最佳 bioinformatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。