Entropy-Driven Alignment-Free Phylogenetic Analysis via K-mer Encoding, DNA Physicochemical Properties, and Rough Set Feature Selection
本研究提出了一种无需比对的系统发育分析框架,该框架将 k-mer 统计信息、DNA 理化性质以及链对称性整合进一个特征向量中,并利用一种增强型粗糙集选择方法对其进行优化,从而实现高效且具解释性的全基因组进化推断。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
为了理解生命的演化史,科学家们经常观察记录在每个活细胞内部的分子指令:DNA序列。几十年来,比较不同物种间这些指令的标准方法是将它们并排排列,逐个字母地对齐,就像将两段长文本对齐以查看哪里匹配、哪里不同一样。这种被称为“多序列比对”的方法在序列较短且非常相似时效果很好。然而,随着技术的进步,研究人员现在可以读取整个基因组,其长度达数百万个字母。当比较这些庞大的序列,特别是针对那些已经打乱了遗传物质或进化迅速的生物时,传统的比对方法会变得缓慢、计算量巨大,有时甚至无法准确执行。这促使科学家寻求“无需比对”(alignment-free)的方法,这些方法试图在不强行将序列排列成僵硬线条的情况下寻找进化关系。这些较新的方法不再匹配每一个字母,而是通过观察DNA小片段的整体模式和频率来推断两个生物之间的亲缘关系。
在最近的一项研究中,一个来自中国的研究小组提出了一种新方法,旨在改进这些无需比对的技术,使其既更快速又更准确。他们意识到,虽然许多现有方法只是简单地统计某些短DNA模式出现的频率,但它们往往忽略了两个关键信息:DNA构建模块的具体化学性质以及这些模式出现的顺序。为了解决这个问题,研究人员开发了一个系统,将DNA序列转化为七种不同的“图谱”。每张图谱都强调了DNA的一种不同的物理特征,例如一个字母是属于强化学键还是弱化学键,或者它是否属于特定的化学家族。通过将原始DNA序列转换为这七种截然不同的二进制模式,他们可以统计每张图谱中类似“单词”的短片段的频率。这一过程创建了一个详细的多层基因组轮廓,既保留了DNA的化学本质,又保留了其组成部分的特定顺序。
然而,这种详细的轮廓产生了一个海量的数据集,包含数千种潜在的模式,其中许多模式对于确定进化史是冗余或无用的。为了从这些噪声中脱颖而出,该团队应用了一种被称为“粗糙集理论”(rough set theory)的数学策略。可以将这个过程想象成一个高效的过滤器,它在大量的线索中进行筛选,只找出那些真正有助于区分不同群体的线索。研究人员使用一组由11种汉坦病毒株(一种在东亚发现的病毒)组成的训练集测试了这个过滤系统。通过分析不同模式区分已知病毒类型的效果,该系统从最初的14,336种可能性中识别出了特定的3,005种模式。这些被选出的模式成为了用于分析这些病毒的核心“指纹”。
随后,团队将他们的方法应用于三组完全不同的病毒,以测试其是否能正确重建它们的家族树。首先,他们分析了33个冠状病毒基因组,包括导致SARS以及较近期的SARS-CoV-2的毒株。该方法成功地将这些病毒分为四个不同的分支,这与已知的科学分类相吻合,清晰地将SARS相关病毒与其他病毒区分开来,甚至能够区分原始的SARS病毒和较新的SARS-CoV-2。接着,他们检查了39株日本脑炎病毒。同样,该方法正确地将病毒分成了四个已知的遗传组,镜像了通过传统且慢得多的比对方法获得的结果。最后,他们分析了55株H7N9禽流感病毒。生成的进化树显示了两大谱系——一个来自北美,一个来自欧亚大陆,并正确地将处于相同地理区域和时期的病毒归为一类。
在这些测试过程中,这种新方法表现出了惊人的速度。虽然其他分析长DNA序列的图形化方法可能需要几分钟时间,但该方法处理研究中最长的序列(超过31,000个字母)仅用了4秒钟。研究人员指出,他们的方法不需要复杂且耗时的比对步骤,却仍能捕捉到构建准确家族树所需的本质生物信号。尽管该方法功能强大,但作者也承认,它不像其他一些工具那样能提供序列差异的可视化图像,且无法显式地模拟复杂的基因重组事件。尽管如此,这项研究表明,通过将化学性质与智能数据过滤相结合,科学家可以创造出一种既高效又可靠的工具,用于追踪病毒及其他生物跨越整个基因组的进化历史。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。