病毒是无情的变形者。当它们在宿主体内进行复制时,会在其遗传密码中产生微小的复制错误,从而创造出新的自身版本。这些变化中的大多数并无影响,但偶尔,一次突变会赋予病毒新的优势,例如更快的传播能力或躲避免疫系统的能力。这种不断的进化正是为什么去年的流感疫苗今年可能无法保护你的原因,也是为什么像新冠病毒(COVID-19)这样的疾病会出现新的变异株的原因。为了走在这些威胁的前面,科学家需要预测哪些变化很可能在下一步发生。传统上,研究人员试图通过研究蛋白质在实验室中的行为,或使用观察现有遗传序列庞大库的计算机模型来猜测这些未来的突变。然而,这些方法往往难以全面观察病毒在时间和人群中实际移动的全貌。
斯坦福大学和 Arc 研究所的一个研究小组开发了一种新方法,通过观察病毒的家族史来预测其未来。他们创建了一个名为 antiGen 的机器学习模型,该模型学习的是病毒的进化路径,而非仅仅是其当前的遗传密码。antiGen 不仅仅是记忆序列,它还研究病毒从一个版本演变为另一个版本所经历的具体步骤,就像历史学家研究导致重大历史变革的具体事件一样。通过分析病毒的“家族树”——一种描绘不同毒株如何相互关联以及何时发生分化的图表——该模型学习了决定哪些突变可能出现的规则。这种方法使系统能够预见从未出现过的变化,为在新的变异株传播之前准备疫苗和治疗方案提供了强大的工具。
研究人员首先在引起 COVID-19 大流行的 SARS-CoV-2 病毒上测试了这个系统。他们将疫情爆发第一年收集到的数百万个遗传序列输入模型,并要求它预测随后几年可能出现的突变。该模型的表现优于任何现有方法,能够预测病毒刺突蛋白(即病毒进入人体细胞的部分)下一个可能的变化。至关重要的是,它还成功预测了在训练数据中从未观察到的突变,这表明它已经学习了病毒进化的底层原理,而不仅仅是记忆过去的事件。为了确认这些预测在生物学上是真实的,团队在实验室中创建了预测的病毒变异株。他们发现,大多数由计算机生成的突变产生的病毒仍能感染细胞,这证明了该模型提出的是可行且具有功能的改变,而非随机错误。
antiGen 的成功并不局限于冠状病毒。团队将同样的模型应用于另外三种常见病毒:季节性流感、呼吸道合胞病毒(RSV)和登革热病毒。尽管针对这些病毒可用的遗传数据远少于 SARS-CoV-2,但该模型在预测其未来突变方面仍然优于传统方法。这表明该方法适用于广泛的病毒,无论现有的监测数据量多少。研究人员还发现,随着收集数据的增加,模型的准确性也会随之提高,这意味着随着我们持续追踪病毒进化,它会成为一个更强大的工具。在某些情况下,将该模型的预测与现有的统计方法相结合,可以创建一个更加稳健的预测系统,能够处理数据丰富和数据匮乏的各种场景。
虽然该模型在预测哪些突变可能发生方面具有高度准确性,但研究人员强调,它并不会创造危险的新病原体。它所预测的变化是属于自然进化过程中的微小、单步突变。这些预测旨在帮助公共卫生官员和疫苗开发者走在病毒的前面。通过了解哪些突变可能出现,科学家可以设计出不仅针对当前流行的病毒,而且能针对未来可能占据主导地位的版本疫苗。这种前瞻性的方法可以改变我们管理传染病的方式,将重点从应对疫情转向在疫情站稳脚跟之前进行预防。这项研究表明,通过倾听记录在病毒遗传密码中的历史,我们可以开始解读它的未来。
技术摘要:基于系统发育树的病毒进化预测
问题陈述
病毒突变预测对于流行病防范至关重要,能够助力预判新型变异株并设计前瞻性干预措施。虽然以系统发育树形式呈现的进化历史为理解过去毒株的出现提供了见解,但其在预测未来序列变化方面的效用在很大程度上仍未得到充分探索。现有的计算方法,如在多序列比对(MSA)上训练的蛋白质语言模型(PLMs)或深度突变扫描(DMS)实验,面临着局限性。DMS 独立于突变可及性来测量适应度且耗时较长,而 PLMs 在缺乏微调的情况下往往难以进行大流行变异预测,并可能受到训练数据中某些基因型过度代表的偏差影响。目前领先的方法(包括 EVE 和 EVEscape)在多项评估中表现不如基础统计预测器。
方法论:antiGen 模型
作者引入了 antiGen,这是一个机器学习模型,旨在通过直接从编码其进化历史的系统发育树(而非原始序列数据库)中学习,来预测病毒的进化未来。
- 数据生成与树构建: 作者开发了一个高性能流水线,用于构建包含数百万个叶节点的流行病规模系统发育树,该过程受到了 UShER 算法的启发。这一过程涉及获取一个带有推断祖先状态的“引导树”(guide tree),并迭代地将来自大型蛋白质 MSA 的序列以引入最少新突变的方式(简约置换法)附着到树上。
- 训练目标: 与在序列上训练的 PLMs 不同,antiGen 是基于从系统发育树中提取的“亲代-子代对”进行训练的。每个训练样本由一个推断的祖先基因型以及被推断为改变了该基因型的单氨基酸替换集合组成。模型学习在给定起始序列的条件下,关于基因组位置和涉及替换的新氨基酸状态的联合概率分布。
- 架构: antiGen 使用了一个小型、随机初始化的 Transformer 编码器(约 465k–565k 个参数)。它通过学习到的 Token 和绝对位置嵌入对氨基酸进行编码,通过两个 Transformer 层处理序列,并输出逐位置的逻辑值(logits)。与标准语言建模的一个关键设计差异在于,它在整个输出矩阵上应用 Softmax 函数,而非逐位置应用,从而保留了每个位置的突变倾向。
- 评估指标: 研究引入了两个主要指标:
- 下一突变召回率(Next-mutation recall): 衡量真实的未来突变落在预测突变的前 q 分位数中的比例。
- PSSM 精确度(PSSM precision): 评估预测未来全人群基因组监测数据(特定根序列的后代)中观察到的突变集的能力,通过计算前十分之一预测值超过位置特异性得分矩阵(PSSM)阈值的概率来进行评分。
- 混合方法: 作者探索了在 antiGen 目标下对现有 PLMs(EVE、Tranception、ESM-2)进行微调,以及一种结合了 antiGen 输出与 PSSM 基准并使用学习到的位置特异性权重的“门控”(gated)预测器。
关键结果
- SARS-CoV-2 表现: 在使用第一年大流行数据(323,950 条序列)进行训练并在随后年份(900 多万条序列)进行测试后,antiGen 在预测下一突变(包括从未在训练中见过的 de novo 突变)方面达到了最先进的性能。它在下一突变召回率和 PSSM 精确度方面均优于 DMS 实验和现有的 PLMs。对于预测在 BA.2 下游出现频率 ≥1 的任何突变,antiGen 略微超过了 PSSM;然而,对于预测出现频率 ≥100 的突变,PSSM 和 EVE 略微优于 antiGen。
- 实验验证: 作者使用伪病毒感染实验验证了 antiGen 的预测结果。大多数 antiGen 预测的 SARS-CoV-2 Spike 突变体(包括 de novo 变异株)保留了伪病毒感染能力,证实了所提突变的生物学功能合理性。
- 地方性流行病毒: 尽管可用测序数据显著减少,antiGen 在流感(H3N2)、呼吸道合胞病毒(RSV)和登革病毒的表面蛋白预测方面仍表现出领先的预测性能,在下一突变召回率和 PSSM 精确度方面均优于基准模型。
- 数据效率与混合模型: antiGen 的性能随监测数据的增加而提升。虽然 antiGen 单独使用在高度数据驱动的环境下表现出色,但结合了 PSSM 基准的门控模型在不同数据量下展现出了稳健的性能,特别是在 PSSM 提供补充信号的大流行早期(低数据)场景中。在针对特定任务(如预测 BA.2 变异株下游的 de novo 突变)时,在 antiGen 目标下微调 EVE 进一步提升了性能。
意义与主张
论文声称 antiGen 通过显式地从系统发育结构中学习,使训练目标与预测进化变化的任务保持一致,这代表了一项重大进展。作者认为,这种方法为包括预判抗体疗法逃逸突变或选择疫苗株在内的应用领域提供了宝贵的资源。
研究强调,虽然 antiGen 能够提供可靠的未来突变预测以及维持 in vitro 感染力的突变预测,但单点替换变异不太可能构成前所未有的生物安全风险,因为它们保留了可通过现有合成筛选检测到的高序列同源性。作者总结道,该模型性能随数据增加而提升的特性,凸显了广泛基因组监测对于公共卫生决策的重要性,并且该方法能更好地使相关部门具备预判未来可能对人类健康构成严重威胁的变异株的能力。
每周获取最佳 evolutionary biology 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。