ViroNEXT: A multilayer hybrid system for high-precision detection of known and divergent viruses in metagenomics
ViroNEXT 是一个全自动、开源的多层混合流水线,它结合了基于参考序列的方法与机器学习方法,旨在实现对宏基因组数据中已知及高度分化病毒的高精度检测,同时显著降低误报分类率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在人类健康的隐形世界中,病毒是常客,有些引起熟悉的疾病,有些则在发动攻击前保持隐匿。几十年来,医生一直依赖针对性检测来寻找这些入侵者,但这些检测要求预先知道你正在寻找的对象。如果一种病毒改变了形状或首次出现,标准检测往往会完全错过它。一种被称为宏基因组测序(metagenomic sequencing)的新方法提供了一条不同的路径。这种方法不是在寻找特定的嫌疑人,而是读取样本中的每一条遗传物质链,就像是在整理一座巨大的图书馆,试图在不知道书名的情况下找到其中一本书。虽然这项技术具有发现任何病毒的前景,但它一直受到两个主要问题的困扰:它经常将无害的遗传噪声误认为是危险的病毒,并且经常无法识别那些与科学家已知病毒相比发生了显著变化的病毒。
一支研究团队现在开发了一种名为 ViroNEXT 的新系统来解决这些问题。该系统充当了一个高度熟练的过滤器,结合了两种不同的处理遗传数据的方式。系统的第一部分运作起来就像一位传统的图书管理员,将每一段遗传密码与庞大的已知病毒数据库进行比对。如果发现匹配项,它会被标记出来。然而,系统并未止步于此。它会对每一个潜在的匹配项进行一系列严格的检查,观察遗传密码是如何排列的,以及样本中实际存在的病毒含量有多少。这种多层级的方法确保只有最可靠的发现才能进入下一步,从而有效地消除了困扰以往方法的虚假警报。
系统的第二部分是为未知而设计的。当第一部分无法在数据库中找到匹配项时,遗传密码会被传递给一个机器学习模型。该模型并不依赖于寻找与已知病毒的精确匹配。相反,它经过训练,能够识别出使一段遗传密码看起来像病毒的通用模式和结构特征,即使该序列从未被见过。通过将对照已知列表的精确性与机器学习的模式识别能力相结合,该系统既可以识别熟悉的病毒,也可以识别那些已经进化成奇异、差异化形式的病毒。
为了测试这个新系统的效能,研究人员创建了一系列具有挑战性的场景。他们构建了包含病毒并混合了人类和细菌遗传物质的合成样本,模拟了目标病毒隐藏在数十亿条其他链条中的真实世界情况。在这些测试中,他们引入了与已知版本差异在 0% 到 25% 之间的变异病毒。当变异程度增加时,虽然其他现有的工具开始失效或产生许多虚假警报,但 ViroNEXT 仍保持了高准确度。即使在病毒发生显著变化时,它也能成功识别,而其他系统则开始漏掉它们,或者报告并不存在的病毒。
研究人员还在真实世界的数据上测试了该系统,包括来自患有不明原因发热和感染患者的样本。在这些临床案例中,该系统再次证明了其价值,提供了清晰、可靠的结果。它识别出了导致疾病的病毒,而没有像其他工具那样,在报告中充斥着大量无关的错误猜测。在一次涉及 21 种不同病毒的复杂混合物测试中,该系统正确识别了几乎所有病毒,同时产生的虚假警报远少于其竞争对手。它甚至捕捉到了一个其他工具错过的样本中的隐藏污染物,这一发现后来得到了独立实验室测试的证实。
该系统的一个关键优势在于它能够处理那些与已知病毒差异巨大、以至于根本不在标准数据库中的病毒。在一次严格的测试中,研究人员从系统的参考库中删除了整个病毒家族,但机器学习组件仍然能够检测到它们。它根据其训练识别出了病毒模式,并以高准确度恢复了这些“新型”病毒的遗传序列。这表明该系统可以发现尚未被科学界编目的新兴威胁,这一能力对于应对大流行病至关重要。
研究人员已将此工具免费向公众开放,任何人都可以通过网页界面使用它,无需昂贵的计算机或专门的培训。通过将分离真实的病毒信号与背景噪声的复杂过程自动化,ViroNEXT 提供了一种改进我们检测和理解病毒感染的实用方法。它不仅能发现更多的病毒,而且能找对病毒,为科学家和医生提供关于影响人类健康的隐形世界更清晰的图景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。