← 最新论文
🧬 biology

HiDAC: A Hierarchical Dictionary-Aided Compression Framework for Genomic Sequences

本文提出了 HiDAC,一种层级字典辅助的压缩框架,该框架在实现具有竞争力的 DNA 压缩率的同时,能够直接在压缩后的标记化表示上实现显著更快的下游分析(例如子串频率查询),而无需进行完全解压缩。

原作者: Manthan Shah, Rahul Semwal, Imlimaong Aier, Prabhat Tripathi, Pritish Kumar Vardwaj

发布于 2026-09-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Manthan Shah, Rahul Semwal, Imlimaong Aier, Prabhat Tripathi, Pritish Kumar Vardwaj

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

生命的篇章是由仅有的四个字母——A、C、G 和 T 所编写的代码。这些字母代表化学碱基,通过连接成长的长链,构成了指导生物体内每一个细胞运作的 DNA。几十年来,科学家们一直能够读取这些长链,但现代测序技术产生的海量数据造成了一个巨大的物流难题。这些包含遗传指令的文件体积庞大,导致其难以存储、在网络中传输缓慢,且难以进行分析。虽然现有的标准计算机工具可以压缩文本文件,但它们并非针对 DNA 中发现的独特模式而设计,往往无法捕捉到定义基因组的深层重复结构。研究人员曾尝试过各种专门的方法来压缩此类数据,但其中许多方法仅针对存储而设计;若要对数据提出问题(例如寻找特定的遗传标记),必须先将整个文件解压,这一过程既浪费时间又消耗计算资源。

一个研究小组开发了一种名为 HiDAC 的新框架,旨在同时解决存储与分析的问题。该方法并非仅仅是缩小文件体积,而是通过在保存之前将遗传代码重写为一种更高效的语言。其过程始于扫描 DNA 序列以寻找频繁出现的模式,例如反复出现的短字母序列。随后,系统将这些频繁出现的模式替换为单个的唯一符号,并创建一个将新符号映射回原始字母的字典。这并非一次性的替换;系统会构建一个层级结构,即一个新的符号本身也可以成为更大模式的一部分,从而使该方法能够捕捉到简单工具所遗漏的复杂嵌套重复。一旦序列使用这些符号被重写,系统就会应用一种复杂的编码技术,将这些符号打包进尽可能小的空间内,就像通过折叠衣服并填满每一个缝隙来紧凑地整理行李箱一样。

这种方法的独特之处在于,重写后的压缩版本在无需完全解压的情况下仍可用于分析。由于新符号代表了原始序列的片段,计算机可以通过查找这些符号来搜索特定模式。如果某个符号绝不可能包含正在搜索的模式,系统就会直接跳过它,从而节省大量时间。研究人员在人类、细菌及其他生物的基因组上测试了这种方法,并将其与通用压缩工具及专门的基因组软件进行了对比。结果显示,HiDAC 比其他方法更有效地减小了文件体积,在某些情况下实现了约 76% 的缩减。更重要的是,当团队利用压缩数据搜索特定遗传序列时,其处理速度比搜索原始未压缩数据快了近三倍。

研究还表明,系统学习到的模式并非随机生成的。计算机创建的最常见的符号对应于在许多不同物种中已知的、作为 DNA 基本组成部分的极短重复字母组合。这表明该方法捕捉到的是真实的生物结构,而非仅仅是任意的数据特征。通过证明数据可以在保持压缩形式的同时仍具备可搜索性,这项工作为处理日益增长的遗传信息提供了一种新途径。它允许科学家在更小的空间内存储海量数据,同时保留直接对存储数据进行复杂查询的能力,从而在无需大规模、高能耗计算资源的情况下,潜在地加速遗传学和医学领域的发现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →