Leveraging Structural Variants to Unlock Hidden Genetic Diversity for Tomato Crop Improvement
本研究表明,通过重新利用来自不同番茄品系的具有成本效益的短读长测序数据,可以发现超过 71,000 个高置信度的结构变异,从而揭示它们是增强育种工作流并解析谱系关系的、此前被隐藏的关键遗传多样性驱动因素,且无需额外的长读长测序投入。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
西红柿是世界上最重要的蔬菜之一。几十年来,科学家们一直在研究其 DNA,以了解为什么有些植物能抵抗疾病,为什么有些植物能结出更大的果实,以及不同的品种之间是如何相互关联的。长期以来,研究人员一直关注遗传密码中最小的变化,即观察植物之间差异极其微小的单个字母。这些微小的差异被称为单核苷酸变异,对于培育更好的作物非常有用。然而,基因组还包含更大型的变化,例如缺失的 DNA 片段、额外的部分副本,或者移动到新位置的片段。这些较大的改变被称为结构变异。虽然已知它们是驱动植物外观和行为的强大因素,但寻找它们传统上一直很困难且昂贵,通常需要许多育种计划无法负担的专门、高成本技术。
北卡罗来纳州立大学的 Reza Shekasteband 的一项新研究表明,科学家现在可以利用现有的数据来发现这些隐藏的大规模遗传变化。研究人员利用了六年来使用标准、廉价的测序仪生成的庞大西红柿 DNA 序列集合。该团队并没有进行新的、昂贵的测试,而是对现有数据应用了一种特定的计算机方法来搜寻较大的结构变化。他们检查了六十种不同的西红柿品系,范围从生长在安第斯山脉的野生祖先到田间种植的现代商业品种。通过重新分析数据库中已有的短 DNA 读取片段(reads),该团队成功识别出超过 71,000 个高置信度的结构变异。这种方法证明了宝贵的遗传信息正静静地躺在旧的数据集中,等待着被解锁,而无需在新的测序上花费一分钱。
研究显示,这些大型遗传变化在西红柿基因组中的分布并不均匀。相反,它们聚集在特定区域,特别是在染色体末端附近以及已知控制抗病性的区域。当研究人员将野生西红柿与栽培西红柿进行比较时,发现野生植物携带的这类结构变化几乎是栽培品种的两倍。在野生基因组中,DNA 片段的缺失是最常见的变化类型,而在栽培西红柿中,DNA 的额外插入则更为频繁。这种差异凸显了驯化如何塑造了这种作物的遗传架构,既过滤掉了一些野生变异,又引入了新的结构特征。团队还发现,许多现代育种品系携带的独特结构变化在其他地方从未出现过,这成为了特定品种的遗传指纹。
最重要的发现之一是,这些大型结构变化讲述了与微小的单字母变化相同的进化故事,但清晰度更高。当研究人员根据结构变异构建进化树时,结果与根据微小变化构建的进化树几乎完全吻合。然而,结构数据在理清混乱关系方面表现得更好。例如,在旧的分析中,一种被归类为栽培葡萄的野生西红柿品种,在考虑了结构变化后,被正确地重新归入了其野生亲属之中。这表明,观察较大的 DNA 片段有助于育种者理解植物真实的演化历史,并就哪些品种进行杂交做出更明智的决策。
研究还为科学家处理此类数据提供了一个实践经验。团队发现,将 DNA 读取片段比对到参考基因组的方式会产生巨大影响。一种强制要求读取片段必须从头到尾完美匹配的标准方法未能发现任何结构变化。通过切换到一种允许部分匹配的更灵活的方法,团队得以检测到标志着结构变异的断裂和重叠。这种调整使他们能够比以往发现更多的变化。他们测试了不同的样本分组方式,并发现将多样化的品系进行批量分析可以产生最全面的结果,从而揭示了在单独观察样本时会被忽略的特定品系的独特变化。
尽管取得了成功,但该研究也承认这种方法存在局限性。虽然它非常擅长发现缺失和插入,但可能会错过非常复杂的重排或插入基因的精确结构(例如用于转基因植物的基因)。研究人员通过发现其方法错过了某些转基因品系中的插入位点(而其他技术可以观察到)证实了这一点。尽管如此,这项研究证明了一种挖掘存档数据的成本效益高且可扩展的策略。通过使用标准的短读长测序数据并优化计算机工具,育种计划现在可以获取一个隐藏的遗传多样性层级。这使他们能够追踪特定性状,完善对植物家族的理解,并在无需承担高昂新型高端测序技术成本的情况下,加速开发新的西红柿品种。这项工作将曾经被视为旧数据局限性的东西,转化为了未来作物改良的强大资源。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。