← 最新论文
💻 bioinformatics

Atlas-scale single-cell analysis beyond in-memory paradigm with scAtlasPy

scAtlasPy 是一种新型的、基于磁盘驻留的计算框架,它克服了标准工作站的内存限制,能够以显著更低的内存占用和更高的处理速度,实现对大规模单细胞图谱(例如 1 亿个细胞)的全分辨率分析,其性能优于现有的最先进平台。

原作者: Xu, H., Ye, Y., Zhang, S., Xie, R., Li, J., Lin, J., Hu, Y., Gao, L.

发布于 2026-09-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Xu, H., Ye, Y., Zhang, S., Xie, R., Li, J., Lin, J., Hu, Y., Gao, L.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

人体是一个由数万亿个独立单元组成的广袤景观,每一个单元都有其独特的角色和历史。几十年来,科学家们一直试图通过研究单细胞来绘制这一地形图,建立详细的目录,以揭示不同组织如何运作以及疾病如何改变它们。这些被称为“图谱”的目录正变得日益全面,从最初的数千个细胞增长到数百万个,现在甚至达到了数亿个。然而,一个显著的障碍也随之出现:现代图谱所产生的数据量极其庞大。标准计算机依赖于将所有信息存储在即时工作内存中进行处理,这种方法对于较小的数据集效果良好,但在面对大规模生物集合时却会崩溃。当数据超过可用内存时,分析就会停滞,导致研究人员无法在不求助于昂贵的专用硬件或简化研究问题的情况下,看到细胞多样性的全貌。

一种被称为 scAtlasPy 的新方法通过从根本上改变计算机处理这些庞大数据集的方式,解决了这一瓶颈。该系统不再强迫将整个细胞信息集合载入计算机的工作内存,而是将数据保留在硬盘上,并仅在分析的每一步中检索所需的特定部分。这种转变使得研究人员仅需 42.9 GB 的内存,即可检查包含一亿个细胞的单细胞图谱。相比之下,目前最先进的平台即使配备了 512 GB 的内存,在处理超过 300 万个细胞时也会感到吃力。通过将图谱的大小与机器的内存容量解耦,该系统能够在标准的个人工作站上实现大规模数据集的全分辨率分析,使研究复杂的细胞差异成为可能,而不受硬件限制。

该系统运行速度极快且效率极高。在检索随机的小组细胞进行分析时,scAtlasPy 每秒可处理 137,745 个细胞。这一性能比以往旨在执行类似任务的方法快了十倍以上,同时减少了 82.6% 的内存使用。其架构设计具有灵活性,允许科学家将其适配于各种大规模分析任务。这种能力为在巨大的图谱中发现复杂的细胞多样性和功能模式打开了大门,而这些图谱此前因规模过大而无法进行完整分析。这项工作表明,生物发现的规模不再受限于计算机的内存限制,为探索曾经被认为不可能实现的生命微观细节提供了一条切实可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →