cyto: ultra high-throughput processing of 10x-flex single cell sequencing
该论文介绍了 **cyto**,这是一款针对 10x Genomics Flex 单细胞测序的开源、超高吞吐量处理器,它通过利用直接 k-mer 查询和创新的二进制格式,在与标准输出保持 99.85% 一致性的同时,实现了比 CellRanger 快 16.5 倍的速度并显著降低了资源消耗,从而能够实现可扩展且具成本效益的十亿级细胞图谱构建。
1018 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
该论文介绍了 **cyto**,这是一款针对 10x Genomics Flex 单细胞测序的开源、超高吞吐量处理器,它通过利用直接 k-mer 查询和创新的二进制格式,在与标准输出保持 99.85% 一致性的同时,实现了比 CellRanger 快 16.5 倍的速度并显著降低了资源消耗,从而能够实现可扩展且具成本效益的十亿级细胞图谱构建。
本文介绍了 `distortions` 软件库,这是一个交互式可视化工具,旨在测量并展示 UMAP 和 t-SNE 等非线性降维中的局部度量失真,从而帮助研究人员识别伪影、调整超参数,并为分析高维基因组学数据选择合适的方法。
本文介绍了 dna-parser,这是一个用 Rust 编写的高性能 Python 库,它通过利用并行处理并提供对 Python 生态系统的广泛兼容性,能够高效地将 DNA 和 RNA 序列编码为机器学习所需的数值特征。
RAGulate 是一个结合了混合文献检索与大语言模型的检索增强生成框架,用于在特定生物学背景下准确评估并解释转录因子与靶标之间的相互作用,从而减少幻觉并为生物学家加速实验优先级排序。
通过开发变分贝叶斯层次模型 eTRex 并将其应用于 4,819 个 ATAC-seq 数据集,本研究构建了一个全面的、具有上下文特异性的泛癌功能转录调节因子图谱,该图谱揭示了共同的及癌症特异性的致癌调节程序,并通过独立的基因组筛选进行了验证,且可通过交互式网络门户进行访问。
HERMES 是一个快速的基于结构的神经网络模型,它通过利用局部 3D 原子环境和摊销微调策略来克服基于规模的偏差,从而预测突变对蛋白质稳定性和结合亲和力的影响,进而实现准确且高效的疫苗设计。
本研究将全基因组分析与三维蛋白质结构建模相结合,旨在展示如何通过对毒力因子(特别是肠道黏附素-受体复合物)的遗传变异进行功能表征,从而改进对多种非O157型志贺毒素产生大肠埃希菌的风险评估与诊断。
该论文介绍了 VAIruScope,这是一个基于深度学习的流水线,通过识别光学显微镜图像中的细胞病变效应,能够实现对多种细胞模型以及具有临床相关性的 RNA、DNA 和逆转录病毒感染细胞的自动化、无标记识别与定量分析,准确率高达 96%。