← 最新论文
💻 bioinformatics

cyto: ultra high-throughput processing of 10x-flex single cell sequencing

该论文介绍了 **cyto**,这是一款针对 10x Genomics Flex 单细胞测序的开源、超高吞吐量处理器,它通过利用直接 k-mer 查询和创新的二进制格式,在与标准输出保持 99.85% 一致性的同时,实现了比 CellRanger 快 16.5 倍的速度并显著降低了资源消耗,从而能够实现可扩展且具成本效益的十亿级细胞图谱构建。

原作者: Teyssier, N., Dobin, A.

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Teyssier, N., Dobin, A.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图整理一个包含数十亿本微小且独特的书籍的庞大图书馆。每本书都代表着生物体中的一个单细胞,书中记录着(遗传数据)指导该细胞功能的指令。在过去,科学家们使用一种叫做“CellRanger”的方法来阅读并整理这些书籍。然而,随着书籍数量增长到数十亿规模,这种方法变得像是要通过逐字逐句地阅读每一本书来整理整个图书馆。这需要耗费数小时,需要超级计算机,而且极其昂贵。

cyto 诞生了,这是一个旨在解决这一瓶颈的全新、超快速工具。它是如何工作的,我们可以通过一些日常类比来进行说明:

1. “模式识别”技巧(不再阅读全部内容)
传统工具试图将每一块数据与参考图谱进行比对,就像图书管理员试图通过逐一核对目录中的每一层书架来寻找一本书。cyto 则更加聪明。因为新的“10x Flex”库具有固定且可预测的布局(就像书籍总是以相同的颜色编码箱装运而来),cyto 不需要阅读整个故事。相反,它使用了一种“直接查找”系统。这就像超市里的条形码扫描器:它不需要阅读成分表;它只需扫描代码,就能瞬间知道该商品应该放在哪里。这跳过了传统比对过程中沉重且缓慢的工作。

2. “紧凑手提箱”(IBU 格式)
为了传输数据,cyto 使用了一种名为 IBU(索引-条形码-UMI)的新格式。想象一下你要搬运一屋子的家具。旧的方法是将每一件物品都用层层气泡膜和纸板包裹起来,占用一辆巨大的卡车。Cyto 的 IBU 格式就像一个高科技的真空密封手提箱。它将数据压缩成一个极小的、高效的二进制包,使得加载、运输和拆解变得更加快速。

3. “流水线”(BINSEQ 格式)
大多数计算机文件都是像单文件压缩包(gzip)那样进行压缩的,这意味着一次只能由一个人打开。如果你有一个巨大的文件,你必须等待那一个人完成后,下一个人才能开始。Cyto 使用了一种名为 BINSEQ 的格式,它就像一条大规模的流水线。它不再是让一个人拆开一个盒子,而是允许数百名工人同时打开盒子的不同部分。这打破了“单线程”的限制,让计算机能够同时利用所有的力量。

结果:闪电般的转型
论文在包含 320,000 个细胞(一个“多路复用”组)的海量数据集上测试了 cyto。

  • 速度: 当旧工具(CellRanger)完成这项工作需要 3.7 小时时,cyto 仅用了 13 分钟。这意味着 16.5 倍的加速
  • 效率: 它使用的内存不到原来的一半,并且减少了大量的“磁盘 I/O”(即计算机硬盘进行的繁重工作)。
  • 准确性: 尽管速度如此之快,cyto 并没有偷工减料。它在 99.85% 的情况下与旧工具的结果保持一致。当科学家观察最终的细胞分组(聚类)时,结果是完全相同的。

为什么这很重要
论文声称,cyto 之所以更快,不仅仅是因为它使用了更多的计算机;它从根本上更加高效,使用的 CPU 小时数减少了 31.7 倍。这意味着科学家现在可以在更小、更便宜的云端计算机上运行这些大规模实验,而不需要依赖昂贵的超级计算机。它将那些以前因太慢或成本太高而无法实现的课题,变成了常规任务,为“十亿级细胞图谱”和大规模遗传筛选铺平了道路。

简而言之,cyto 是一列高速列车,正在取代那台用于整理世界上最复杂生物数据的蒸汽机车。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →