✨ 要点🔬 技术摘要
遗传变异是人类多样性的来源,即我们 DNA 中塑造了从眼睛颜色到疾病易感性等一切特征的细微差异。几十年来,科学家一直依赖短读长测序来寻找这些差异,这种方法将基因组分解成微小的片段,读取它们,并试图像拼图一样重新组合出完整的图像。然而,这种方法往往会丢失这些碎片如何组合在一起的上下文信息,尤其是在观察 RNA(即携带从 DNA 构建蛋白质指令的分子)时。一种更新的技术——长读长测序,通过一次性读取整条 RNA 链解决了这个问题,完整地保留了基因表达的过程。但虽然这项技术提供了更清晰的视野,它也带来了新的挑战:用于寻找遗传差异的工具是为旧的、碎片化的数据而构建的。科学家们需要知道这些工具是否能够处理这些新的长链数据而不出错,以及哪些特定的方法最适合这项工作。
为了回答这个问题,苏黎世大学的研究人员进行了一项大规模测试,以观察不同的计算机程序在处理长读长 RNA 数据以寻找微小遗传变化方面的表现如何。他们将这个问题视为一项严格的质量控制检查,将五种不同的专业程序与一种用于旧数据的标准工具一起运行。他们向这些程序输入了来自三个著名的已知人类细胞系的、使用来自两大主要技术公司 Oxford Nanopoles 和 Pacific Biosciences 的各种方法测序的数据。目标不仅是看哪个程序发现的变化最多,而是要理解哪种测序方法、计算机程序和数据处理步骤的组合能产生最准确的结果。研究人员还测试了这些程序将遗传变化组合成“单倍型”(即在单条染色体上共同遗传的一组变异)的能力,这是理解特定遗传组合如何影响健康的关键步骤。
研究表明,获得准确结果最重要的因素不是计算机程序本身,而是来自测序仪的数据质量和类型。研究人员发现,用于准备 RNA 样本的特定化学方法对结果产生了巨大影响。使用 Pacific Biosciences 方法生成的数据表现始终优于 Oxford Nanopore 的数据,主要是因为 Pacific Biosciences 的数据包含的错误更少,并且能够提供更完整的遗传密码视图。在测试的计算机程序中,一个名为 Clair3-RNA 的程序脱颖而出,表现最为全面,它在所有不同类型的数据中都能可靠运行,并能高精度地发现单字母变化以及小的插入或缺失。另一个程序 DeepVariant 也表现得非常好,特别是在分析高质量的 Pacific Biosciences 数据时。然而,研究显示没有哪种工具是完美的,适用于所有情况;最佳选择在很大程度上取决于所使用的特定测序方法。
研究人员还调查了数据处理中的一个常见步骤——即将长 RNA 读取进行重塑,使其看起来更像旧工具所期望的短 DNA 读取——是否仍然必要。他们发现,对于专门为长读长 RNA 设计的新程序,这种重塑步骤通常是不必要的,甚至可能通过破坏重要信息而损害性能。事实上,保持数据原始的长读长格式可以让专门的程序工作得更好。研究还观察了这些工具区分真实遗传变化与 RNA 编辑(细胞在制造后通过化学方式改变 RNA 的自然过程)的能力。他们发现,有些程序擅长忽略这些自然改变,而另一些则会将其误认为遗传错误,但这个问题可以通过使用现有数据库来过滤已知的编辑位点来解决。
最后,团队测试了程序将遗传变化链接在一起形成单倍型的能力。他们发现不同的工具各有所长:有些擅长将大量的变化链接在一起,而有些则更为谨慎和准确,但链接的变化较少。一个名为 longcallR 的程序提供了一个独特的优势,它通过一步完成寻找遗传变化和将其链接在一起的工作,为需要同时获得这两项结果的研究人员提供了一个强有力的替代方案。研究人员利用癌症细胞系的数据证实了这些发现,表明从标准细胞系中获得的经验同样适用于更复杂的生物背景。最终,这项研究为科学家们提供了一份清晰的路线图,表明虽然软件的选择很重要,但测序数据的质量是成功的基石,而最佳方法取决于将正确的工具与特定类型的数据进行匹配。
技术摘要:长读段 RNA 测序数据中小型变异检测流水线的系统性基准测试
问题陈述 长读段 RNA 测序(lrRNA-seq)能够实现转录本解析的变异检测,将遗传变化与特定异构体联系起来,并促进对等位基因特异性事件和剪接的研究。然而,针对 lrRNA-seq 的小型变异(SNVs 和 indels)检测流水线的系统性且中立的评估仍然有限。现有工具在不同测序技术(Oxford Nanopore Technologies [ONT] 和 Pacific Biosciences [PacBio])、比对策略、变异检测器选择、基因组上下文以及下游单倍型相位化(haplotype phasing)方面的性能尚未得到充分理解。此外,对于专门为 lrRNA-seq 优化的变异检测器而言,比对文件转换(将剪接的 RNA 比对转换为连续的类 DNA 表示)是否仍然必要,目前尚不明确。
方法论 作者使用 Genome in a Bottle (GIAB) 数据集进行了系统性基准测试,该数据集包含三种细胞系(HG002、HG004、HG005),分别采用四种 ONT 文库制备方案(cDNA R9.4.1、cDNA R10.4.1、dRNA002、dRNA004)和两种 PacBio 方案(Iso-Seq 和 Mas-Seq/Kinnex)进行测序。研究还扩展到了最近的 LongBench 数据集(H211 和 H526 肺癌细胞系)。
基准测试工作流包括:
比对: 使用 minimap2 和 pbmm2(一种针对 PacBio 优化的包装器)进行序列比对。研究评估了比对转换(使用 SplitCigarReads 来模拟连续的 DNA 比对)与使用原始剪接比对对结果的影响。
变异检测: 评估了五种 lrRNA-seq 特有的检测器:Clair3-RNA 、DeepVariant (针对 PacBio 使用 MASSEQ 模型,针对 ONT 使用 ONT DNA 模型)、isoLASER 、longcallR 以及 longcallR-nn 。同时纳入了 GATK HaplotypeCaller 作为短读段基准。
单倍型相位化: 使用 WhatsHap 、LongPhase 、HapCUT2 、HiPhase 以及 isoLASER 和 longcallR 的原生相位化输出来评估相位化性能。
评估指标: 通过在高置信度区域内针对真实值(ground-truth)调用的精确度(precision)、召回率(recall)和 F1 分数进行量化,并根据测序深度、变异类型(SNV/indel)和基因组上下文(同聚物、串联重复序列、GC 含量)进行分层。相位化通过转换错误率(switch error rate)、相位覆盖度(phasing coverage)和相位块 N50 进行评估。
核心贡献与结果
测序特性是主要决定因素: 研究表明,测序特性(化学性质、错误率、吞吐量和可比对性)是变异检测性能的最强决定因素,其对 F1 分数和真阳性计数解释的方差大于变异检测器的选择。PacBio 数据集(尤其是 Mas-Seq)由于更高的测序准确度和更多的可调用碱基,表现持续优于 ONT 数据集。在 ONT 化学性质中,dRNA004 和 cDNA R10 表现最好,而 dRNA002 表现最差。
变异检测器性能:
Clair3-RNA 在针对两种 ONT 和 PacBio 化学性质的 SNV 和 indel 检测中,展现出了最广泛且最稳健的适用性。
DeepVariant 在 PacBio 数据上表现强劲,尤其是在 indel 检测方面,但在 ONT 数据上表现较差,原因是缺乏专门的 ONT RNA-seq 模型。
longcallR 在无需依赖预训练模型的情况下,在 ONT 数据的 SNV 检测方面具有竞争力,并提供直接的相位化输出。
isoLASER 显示出高精确度但较低的召回率,特别是在 ONT 数据上,且在变异检测方面较为保守。
longcallR-nn 在特定数据集上表现出竞争力的性能,但在 dRNA002 上表现挣扎。
比对策略:
比对器选择: minimap2 通常比 pbmm2 产生更高的 F1 分数,因为 pbmm2 往往会引入更多的假阳性,特别是在剪接区域,这可能是由于参数预设的差异以及缺乏剪接位点注释输入所致。
BAM 转换: 对于 lrRNA-seq 特有的检测器,比对转换(在外显子-内含子接点处拆分读取段)并不会提高性能,在某些情况下反而会降低准确度,因为它破坏了 RNA 特有的比对特征(如剪接感知 CIGAR 图案)和单倍型信息。仅当在 PacBio 数据集上使用 DeepVariant 进行 indel 检测时,转换才是受益的。
基因组上下文与 RNA 编辑:
性能在挑战性的基因组上下文中会发生退化,特别是在同聚物(尤其是 A/T)和极端 GC 区域。Indel 检测对同聚物长度的敏感度高于 SNV 检测。
RNA 编辑(A-to-I)导致了假阳性。集成 RNA 编辑数据库(例如通过 REDIportal 对 Clair3-RNA 进行位点标记)或使用迭代相位化(longcallR)的检测器能更好地区分真实的变异与编辑事件。
单倍型相位化: 没有一种单一的相位化方法能在所有指标上都达到最优。WhatsHap 倾向于相位覆盖度和连续性(更长的相位块),但以较高的转换错误率为代价;而 HapCUT2 则优先考虑准确性,但覆盖度略低。longcallR 为联合变异检测和相位化提供了强有力的替代方案。
泛化能力: 在 GIAB 数据集中观察到的性能趋势在 LongBench 癌症细胞系数据集中也是一致的,这进一步证实了测序特性和检测器相对性能层级的支配地位。
意义 本文为 lrRNA-seq 变异检测建立了基础性的基准测试,强调虽然工具选择很重要,但底层的测序技术和文库制备是成功的关键因素。它为构建流水线提供了具体的指导建议:
推荐将 Clair3-RNA 作为通用 lrRNA-seq 变异检测中最具通用性的工具。
DeepVariant 是处理 PacBio 数据(尤其是 indel)的强力选择。
对于 lrRNA-seq 特有的检测器,应避免使用比对转换 ,以保留长程信息,除非是在 PacBio 数据集上使用 DeepVariant。
WhatsHap 和 HapCUT2 在下游相位化中提供互补的权衡,而 longcallR 适用于集成的检测与相位化。
研究结论指出,未来的灵敏度提升可能需要针对性的富集策略,以克服表达依赖性的限制,并且需要进一步的工作来对转录本水平的变异分配和单细胞应用进行基准测试。
每周获取最佳 bioinformatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。