Tree-aware conditional language modeling recovers mutational patterns of viral evolution
该论文介绍了 evoPLM-Tree,这是一种能够整合系统发育上下文以准确预测病毒突变模式和谱系特异性演化轨迹的树感知条件语言模型,并展示了其与实验功能约束的高度一致性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
病毒是变化的专家。它们通过不断重写自身的遗传指令,更换蛋白质的部分组件来逃避宿主的免疫系统,从而实现生存。这一过程并非随机的混乱,而是遵循着某种路径。今天有助于病毒生存的突变,到了明天可能会变得毫无用处甚至有害,这取决于该特定谱系中已经发生的其他变化。长期以来,科学家一直试图利用计算机模型来预测这些变化,这些模型通过阅读蛋白质的语言,将其视为句子,其中某些词汇比其他词汇更契合。然而,大多数此类模型只关注最终结果,而不关注过程。它们看到了目的地,却忽略了病毒到达那里的路径图,忽视了病毒的历史塑造了其下一步可以安全进行哪些变化这一事实。
一个研究小组开发了一种观察这一问题的新方法,这种方法迫使计算机关注家族树。他们创建了一个名为 evoPLM-Tree 的系统,它就像一个理解进化的语言模型。该模型并非仅仅猜测蛋白质序列可能是什么样子,而是以祖先病毒序列和特定的家族树作为起点。随后,它学习预测谱系中的下一步,利用病毒随时间变化的历程作为引导。研究人员使用 SARS-CoV-2 病毒的刺突蛋白(spike protein)测试了这种方法,这是该病毒进入人体细胞的部分。他们根据系统发育树(一种绘制不同病毒株之间进化关系的图表)中的位置,将 Omicron 变异株早期版本的序列与其祖先序列配对。
当团队要求模型生成后代序列时,其表现出的准确度是标准模型无法比拟的。通过向模型输入进化背景,研究人员发现,计算机更多地依赖于实际的输入信息,而不是仅仅基于通用模式进行猜测。模型创建的序列并非随机的变化;它们准确地重现了现实世界中蛋白质发生突变的特定位点。模型对于不同位置突变出现频率的预测与观测数据具有很强的相关性,显示出计算机预测与自然界实际发生情况之间的清晰联系。这对于整个刺突蛋白以及特定的受体结合域(即病毒附着在人体细胞上的部分)都是如此。
研究还观察了当病毒在时间上远离其起点时,这些预测的有效性如何。虽然随着进化距离的增加,模型在预测精确的单字母变化方面变得不再那么精准,但它在捕捉整个蛋白质变化的整体模式方面仍然表现得非常出色。为了验证这些模式是否具有真实的意义,研究人员将模型的预测结果与实验室实验进行了对比,这些实验测试了病毒可以在不发生功能损坏的情况下容忍哪些突变。模型分配高概率的突变,正是科学家们已经在实验室环境中证实能够存活的那些突变。模型成功识别出了允许病毒保持结合人体细胞能力的突变,尽管在训练期间从未向其展示过任何实验数据。
这项工作表明,赋予计算机模型一个清晰的病毒家族历史视角,可以让它学习该谱系进化的特定规则。通过明确地包含祖先路径,该模型可以恢复定义病毒如何随时间变化的独特突变模式。结果表明,这种方法提供了一个理解蛋白质进化的可靠框架,并能帮助科学家根据我们现有的基因组数据,优先确定哪些未来的突变最有可能出现。它提供了一种方式,不仅能看到病毒可能变成什么样,还能看到基于其祖先的实际历史,它极有可能如何演变成那样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。