想象一下,你是一名试图在一个繁忙、拥挤的城市中破解谜团的侦探。这座城市是一块活着的组织,其中的每一栋建筑(细胞)都在大声喊出它们最喜欢的歌单(基因)。在过去,科学家只能听到整座城市混合在一起的巨大录音,却无法追踪哪栋建筑在唱哪首歌。但现在,我们拥有了一种超级强大的新技术,叫做空间转录组学(spatial transcriptomics)。这就像是给每栋建筑都配了一个麦克风,不仅能记录它的歌声,还能给它贴上精确的街道地址标签。这让我们能够看清这座城市的社区是如何组织的,以及不同的区域是如何相互交流的。
然而,这里有一个陷阱。这些麦克风非常娇贵。有时一栋建筑听起来声音更大,仅仅是因为它的麦克风电池容量更大(文库大小/library size),或者是因为风正从街道那一侧猛烈地吹过来(空间伪影/spatial artifacts),又或者是因为整个街区今天心情不好(切片效应/slide effects)。如果你不修复这些技术故障,你可能会误以为一栋建筑在唱一首新歌,而实际上它只是因为麦克风坏了而在大声叫喊。科学家们面临的大问题是:我们如何在不意外删除那些真实的、有趣的歌曲的前提下,清理掉这些噪音?通常,科学家会先尝试清理噪音,然后再去聆听音乐,但本文认为,将这两步分开处理就像是在开车时试图修理汽车——你可能会错过真正的故障,或者让路途变得颠簸。
于是,GPSNorm登场了。这是一个由研究人员 Art Taychameekiatchai、Xiaowei Zhan、Guanghua Xiao 和 Peifeng Ruan 开发的新工具。你可以把 GPSNorm 想象成不仅仅是一个简单的过滤器,而是一个聪明的、全能的侦探,它在聆听音乐的同时,也在同步修复麦克风。GPSNorm 并不把“清洗后”的数据视为一个固定的、完美的既定事实,它承认:“我非常确定这是真实的歌声,但我也在记录我对噪音的不确定程度。”
论文指出,通过使用一种被称为**贝叶斯层次模型(Bayesian hierarchical model)**的高级统计方法(这就像是一个分享线索的超级组织严密的侦探团队),GPSNorm 可以比旧方法更好地分离“技术噪音”与“生物信号”。在测试中,他们模拟了混乱的城市数据,发现 GPSNorm 能够准确地绘制出噪音来自何处,同时依然能清晰地听到真实的歌声。当他们将此应用于真实世界的数据时——例如观察人类大脑、COVID-19 导致的肺部损伤以及肾脏组织——他们发现 GPSNorm 比其他方法更能发现重要的生物学模式。例如,在大脑数据中,即使原始数据很混乱,它也能清晰地展示哪些区域富含特定的细胞类型。在肺部研究中,由于样本量非常少,GPSNorm 是唯一能够自信地识别出与严重损伤相关的基因的方法,而其他方法则因过于不确定而无法给出任何结论。
研究人员还展示了这种“感知不确定性(uncertainty-aware)”的方法至关重要。当噪音和真实信号看起来很相似时(比如一首恰好发生在多风街区的响亮歌曲),旧的方法往往会产生混淆并给出错误的答案。GPS0RM 通过记录自身的不确定性,避开了这些陷阱。它表明,将归一化(normalization)视为一场带有计分卡(概率)的猜谜游戏,比假装这个猜测是一个完美的事实要好。虽然该方法在计算上非常繁重,但团队展示了他们可以通过对社区进行分组来提高运行速度,且不会损失太多准确性。最终,论文表明 GPSNorm 让空间转录组学变得更加可靠,帮助科学家们更加信任他们绘制的生物城市地图。
GPSNorm 技术摘要:用于空间转录组学的高斯过程空间归一化
问题陈述
空间转录组学(ST)技术(如 10x Genomics Visium 和 NanoString GeoMx)能够在保留组织结构的同时实现全基因组水平的基因表达测量。然而,ST 数据深受技术变异性的影响,包括文库大小差异、切片级批次效应以及空间伪影(如染色变化或组织厚度)。与批量测序(bulk RNA-seq)或单细胞 RNA 测序不同,ST 中的这些技术成分通常具有空间结构性,这使得它们很难与具有生物学意义的空间信号区分开来。
目前的归一化方法通常将归一化视为一个顺序的前处理步骤:计数通过全局或具有空间信息的缩放因子进行调整,随后在这些调整后的固定值上进行下游分析(如差异表达分析)。这种两阶段工作流忽略了归一化过程中引入的不确定性。当技术成分和生物成分在空间上部分可分离时,将归一化值视为固定值会导致下游统计分析中的效应量估计出现偏差,并导致推断过于保守(anti-conservative)。
方法论:GPSNorm 框架
作者提出了 GPSNorm(高斯过程空间归一化),这是一个贝叶斯层次模型框架,旨在统一模型中同时估计技术变异、空间结构和生物信号。
1. 层次模型规范:
- 数据模型: 基因 g 在空间单元 i 的观测转录计数 ygi 使用带有对数连接函数的负二项分布进行建模。
- 线性预测器: 对数均值被分解为:
- 偏移量(Offset): 已知的文库大小/测序深度(Li)。
- 生物效应: 基因特异性基线(αg)以及感兴趣协变量(如疾病状态)的回归系数(βg)。
- 技术效应: 切片级效应(γs)和切片特异性空间效应(fi,s)。
- 控制基因: 模型利用负对照基因(NEG)和管家基因(HK)。对于负对照基因,其基因特异性生物参数被约束为零,从而允许这些特征在没有生物信号干扰的情况下,锚定共享技术变异和离散度的估计。
2. 空间建模:
- 每个切片内的空间依赖性使用**内在条件自回归(ICAR)**先验进行建模。这作为平滑高斯过程的一种稀疏离散近似(通过随机偏微分方程链接)。
- 空间场由**高斯马尔可夫随机场(GMRF)**表示,该场由源自空间单元邻域结构的图拉普拉斯矩阵定义。与稠密高斯过程协方差矩阵相比,这确保了计算的可扩展性。
3. 推断:
- 该模型属于潜在高斯模型(LGMs)类别。
- 使用**集成嵌套拉普拉斯近似(INLA)**进行高效的近似贝叶斯推断。INLA 通过利用 ICAR 先验的稀疏精度矩阵结构并对超参数进行确定性积分,避免了马尔可夫链蒙特卡洛(MCMC)的高昂计算成本。
- 不确定性传播: 与两阶段方法不同,GPSNorm 在估计差异表达参数(β)时,会对潜在归一化成分(u)的不确定性进行积分。当归一化与生物信号发生混淆时,这会产生更宽、更校准的置信区间。
4. 归一化输出:
该框架提供了两种将后验估计投影回计数规模的方法:
- 后验中位数投影(Posterior-Median Projection): 使用线性预测器的生物成分计算负二项分布的中位数。
- 百分位数调整计数(Percentile-Adjusted Counts, PAC): 转换观测计数以保留秩(rank)和离散度,同时调整均值结构以消除技术效应。
核心贡献
- 联合建模: GPSNorm 将归一化从一个预处理步骤重新定义为一个在层次贝叶斯框架内的联合估计问题,明确地将归一化不确定性传播到下游推断中。
- 空间技术建模: 它引入了切片特异性的 ICAR 先验,以捕捉经常与生物梯度相混淆的平滑、具有空间结构的技术伪影。
- 可扩展性: 通过利用 INLA 和 GMRF 的稀疏结构,该方法能够对大型空间图进行高效推断,而不会产生与稠密高斯过程求逆相关的立方复杂度。
- 控制集成: 该框架正式整合了负对照基因和管家基因,以锚定技术变异的估计,减少了技术成分与生物成分之间的混淆。
结果
作者通过基于经验数据分布的模拟研究以及在三个真实世界数据集上的应用评估了 GPSNorm。
1. 模拟研究:
- 技术恢复: 即使在强生物学混淆(差异表达与空间信号之间存在 70% 重叠)的情况下,GPSNorm 也能准确恢复模拟的空间技术场(相关性 > 0.92)。
- 差异表达(DE)性能: 与现有方法(如 scran, Giotto, SpaNorm, sct)相比,GPSNorm 表现出:
- 在对数倍数变化(log-fold change)估计方面偏差极小。
- 降低了均方根误差(RMSE)。
- 提高了差异表达基因的排序性能(AUC),尤其是在具有高技术复杂性的场景下。
- 不确定性校准: 在真实的 DE 效应为零的简化模拟中,联合估计在强空间混淆下仍能保持名义 95% 置信区间覆盖率,而两阶段方法产生的区间则过于乐观(覆盖率趋于 0%)。
2. 真实数据应用:
- 10x Visium 人类 DLPFC 数据集: GPSNorm 成功恢复了预期中寡突胶质细胞标记物 MOBP 在白质区域的富集模式,这一模式在原始数据中被文库大小的异质性所掩盖,并在非空间方法中被部分遗漏。它还为这些空间模式提供了后验不确定性估计。
- NanoString GeoMx COVID-19 肺损伤数据: 在一个小型样本研究(46 个 AOI)中,GPSNorm 识别出了与严重损伤相关的生物相关趋化因子(CCL18, CXCL10, CCL2)以及与轻度损伤相关的 SCGB1A1。其他方法未能识别出显著基因,这可能是由于无法在小队列中传播归一化不确定性。
- GeoMx 空间器官肾脏图谱: GPSNorm 在保留用于肾小球和近端小管解剖区域的预期转录对比方面,表现优于其他方法,维持了对精选标记基因的高优先级识别。
3. 计算扩展性:
作者证明,在模型拟合前将感兴趣区域(AOI)聚类为簇,可以显著缩短运行时间(高达 5 倍加速),同时保留高信号基因的排序和效应量大小。
意义与主张
论文声称,将归一化视为潜在统计推断问题而非确定性的预处理步骤,可以显著提高空间转录组学分析的鲁棒性和可解释性。
- 鲁棒性: 通过对技术效应和生物效应进行联合建模,GPSNorm 降低了在归一化过程中吸收生物学意义变异的风险,并防止了在下游差异表达分析中低估不确定性。
- 可解释性: 该框架允许研究人员量化空间表达表面的不确定性以及归一化调整,从而为实验变异提供更完整的图景。
- 适用性: 该方法特别适用于技术空间结构与生物空间结构相互交织,或者样本量较小(如针对性的空间平台如 GeoMx)的情景,因为其层次结构允许在基因和空间单元之间共享信息。
作者指出了局限性,包括对于极大数据集的计算成本(通过 AOI 聚类得到缓解)以及对技术效应采用平滑空间先验的假设。他们建议未来的工作可以扩展该框架,以联合建模空间变异基因检测并整合单细胞参考数据。
每周获取最佳 bioinformatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。