← 最新论文
💻 bioinformatics

seqsizzle: decoding complex barcode and adapter architectures in long-read sequencing data

本文介绍了 seqsizzle,这是一个用 Rust 编写的开源、跨平台命令行工具,通过实现模糊引物匹配、可定制的高亮显示以及内置的 k-mer 富集分析,为长读长测序数据的可视化、质量控制和故障排除提供便利。

原作者: Wang, C., Ritchie, M. E., Davidson, N. M.

发布于 2026-09-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Wang, C., Ritchie, M. E., Davidson, N. M.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图阅读一本书,但书页上的字体奇特且不断变化,而且每隔几个单词,边角处就隐藏着一个秘密代码。对于从事一种强大的新型基因组读取方式的研究人员来说,这就是他们的现实。多年来,研究人员一直依赖机器将 DNA 切割成微小的、易于处理的碎片来进行读取,但新一代技术可以一次性读取更长的 DNA 链。这些长链就像是书中的整个章节,而不仅仅是单个句子。它们让科学家能够看到基因的完整故事,包括它是如何被修饰的,或者在单个细胞中是如何表现的。然而,由于这些机器非常新,且 DNA 链非常长,它们产生的数据往往是混乱的。机器会犯一些小错误,而且遗传链上经常带有额外的序列字母——就像条形码和接头一样——用于告诉计算机如何对数据进行分类。当一条链长达数千个字母并包含多个此类标签时,仅凭肉眼几乎不可能找到它们,尤其是当机器在读取过程中出现了一些错误时。如果无法清晰地看到这些标签,科学家就无法正确地对数据进行分类,也无法理解所研究的遗传物质的结构。

为了解决这个问题,研究人员 Changqing Wang、Matthew E. Ritchie 和 Nadia M. Davidson 开发了一种名为 seqsizzle 的新工具。把这个工具想象成一个专门设计的放大镜,专门用于科学家用来管理数据的终端屏幕。seqsizzle 并不是试图强迫计算机去猜测标签是什么,而是让研究人员可以直接在屏幕上观察原始的遗传代码。它会高亮显示科学家正在寻找的特定序列,即使机器在读取这些序列时犯了一些小错误。该工具允许用户为不同的标签分配不同的颜色,从而轻松识别条形码从哪里开始、接头在哪里结束,并发现机器可能出错的地方。它还可以扫描数千条链以寻找最常见的重复模式,帮助科学家发现那些即便在预先不知道要找什么的情况下也能存在的标签。

研究人员使用一种以速度和可靠性著称的编程语言构建了这个工具,并使其能够在几乎任何计算机系统上运行,从个人笔记本电脑到研究中心使用的超级计算机。因为它直接在命令行中运行,不需要沉重的图形界面,所以可以在存放数据的远程服务器上使用,从而节省时间和计算资源。团队在两种主要的超长读长测序技术数据上测试了 seqsizzle。在一次测试中,他们使用它来分析来自一项复杂的单细胞实验的数据,其中的遗传链带有按特定顺序排列的多个条形码。该工具成功识别了隐藏的标签,用不同的颜色进行了高亮显示,并向研究人员展示了大约三分之一的链遵循预期的模式。在另一次测试中,他们使用它来观察已知具有重复遗传代码部分的特定细胞系的 RNA。该工具迅速确认了其中一半的链包含这种重复,证明它能够发现那些否则可能会被遗漏的结构异常。

seqsizzle 与其他软件的不同之处在于,它专注于人类视觉以及快速、交互式故障排除的需求。虽然其他程序在自动处理数百万条链方面表现出色,但它们通常会将原始细节隐藏在层层分析之后。如果科学家试图弄清楚为什么一个新的实验不起作用,他们需要看到那些混乱的、未经处理的数据来寻找错误。seqsizzle 通过提供一种滚动查看数据、切换颜色并调整工具匹配严格程度的方法,填补了这一空白。它不仅仅是处理数据;它还能帮助科学家理解实验本身的架构。通过使可视化这些复杂且易错的序列成为可能,该工具帮助研究人员排查协议中的问题,发现意外的伪影,并确保他们试图讲述的遗传故事被正确地读取。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →