High resolution Streptococcus pyogenes core genome MLST and LIN coding scheme for outbreak detection
本文介绍了一种由 PubMLST 托管的、用于化脓性链球菌(*Streptococcus pyogenes*)的新型、可扩展且全球可访问的核心基因组 MLST 和 LIN 编码方案,旨在加强对疫情暴发的检测,并促进追踪遗传变异方面的国际合作。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,细菌的世界就像一座巨大且混乱的图书馆,其中的每一本书都是一个化脓性链球菌(Streptococcus pyogenes)病原体。这些病原体是臭名昭著的麻烦制造者,会导致从简单的喉咙痛到危及生命的感染等各种症状,每年造成至少 50 万人死亡。长期以来,试图追踪疫情爆发的科学家们不得不使用一种基于病原体表面“M 蛋白”(称为 EMM 型)的非常陈旧且笨重的编目系统。这就像是在试图寻找图书馆中一本特定的书,而数千种不同标题的书竟然都拥有完全相同的封面艺术设计。它只能告诉你这种病原体的类型,却无法告诉你两个病原体是近亲还是远亲,这使得很难发现特定群体是否正在医院或学校中传播。
本文的作者决定建立一套全新的、极其详细的数字化编目系统来取代旧系统。他们不仅观察“封面”,还阅读了病原体 DNA 的全部文本。具体而言,他们创建了一个核心基因组 MLST(可以理解为由 1,198 个几乎存在于每个病原体中的特定遗传“单词”组成的独特条形码)和一个 LIN 代码系统(一种作为层级地址的“生命识别码”)。
以下是他们新系统的运作方式,使用了一个有趣的类比:想象每个病原体都有一张印有 1,198 个复选框的巨大身份证。新系统会检查两个病原体之间有多少个复选框是匹配的。
- 如果两个病原体的复选框几乎完全相同,它们就会获得一个非常具体的、简短的地址(低 LIN 代码数值),这意味着它们很可能属于同一次近期的疫情爆发。
- 如果它们共享的复选框较少,它们的地址就会变得更长且更具体,指向一个更大的家族群体。
- 该系统使用九个不同的“阈值”(就像地图上的缩放级别),范围从观察整个物种到捕捉仅有几个遗传单词的微小差异。
研究人员使用 7,307 个不同的病原体样本(其中 4,916 个来自英国,2,391 个来自公共数据库)测试了这一新系统。他们将这种新的“条形码”方法与旧的“SNP”方法(即计算 DNA 中每一个微小的字母变化)进行了对比。结果令人振奋:在识别疫情集群时,新方法与旧的高精度方法匹配度约为 99%。例如,当他们观察 10 种不同类型的这些病原体时,新系统在 10 次中的 8 次里都正确地将疫情成员归为一类,且没有出现任何错误,仅在另外两次中出现了极小的误差。
然而,论文也谨慎地指出了该系统并非做不到的事情。作者明确反对认为旧有的基于 SNP 的方法是获取高分辨率的唯一途径。虽然 SNP 方法表现出色,但作者指出,它们就像是通过打印出每一页并统计每一个错别字来比较两本书一样;这极其缓慢,需要巨大的计算能力,而且除非其他实验室使用完全相同的参考书,否则你无法轻松地分享结果。这个托管在名为 PubMLST 的公共网站上的新 LIN 代码系统旨在实现快速、可共享和可扩展,允许世界各地的实验室无需交换数个太字节(terabytes)的原始数据即可即时交流心得。
论文还强调,该系统很好地处理了“多谱系”问题。某些病原体类型(如 EMM77)就像是一个拥有许多不同分支的家族;旧系统有时会产生混淆,但新的 LIN 代码成功地分离了这些远亲分支,同时仍能将近亲归为一类。
简而言之,作者认为这个全新的、开放获取的工具包是向前迈出的重要一步。它使公共卫生团队能够以高精度实时追踪疫情,就像是从模糊的黑白地图升级到了高清 GPS,而且这个 GPS 适用于每个人、每个地方。他们并没有声称解决了细菌世界的每一个谜团,但他们展示了这是一个高效且可扩展的工具,用于发现这些病原体何时正在传播,并在它们造成更多伤害之前阻止它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。