scprocess: a pipeline for processing, integrating and visualising atlas-scale single cell data
本文介绍了 scprocess,这是一个专为 10x Genomics 技术生成的百万级单细胞数据而设计的 Snakemake 自动化流程,旨在通过统一的命令行接口解决大规模数据集在管理、效率及可重复性方面的挑战,实现从原始测序文件到标准化分析结果的端到端处理。
1018 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文介绍了 scprocess,这是一个专为 10x Genomics 技术生成的百万级单细胞数据而设计的 Snakemake 自动化流程,旨在通过统一的命令行接口解决大规模数据集在管理、效率及可重复性方面的挑战,实现从原始测序文件到标准化分析结果的端到端处理。
该研究通过开发基于表达量的注释策略,构建了标准化的人类小 Vault RNA(svtRNAs)注释资源,实现了对其在多种细胞系中的系统性检测与定量,并揭示了其作为人类小 RNA 景观中丰富且具潜在调控功能的重要组分。
本文介绍了"Descriptron-GBIF Annotator",这是一款基于浏览器的零安装众包工具,利用 AI 辅助和受控词汇表对来自 GBIF 的生物多样性图像进行形态学标注,旨在通过公民科学模式加速结构化形态数据的生成,并与专业工作平台形成互补反馈循环以应对生物多样性危机。
本文介绍了 Cycle-Extractor(CE),这是一种利用混合整数线性规划从短读长或长读长测序数据中快速、准确地重构 ecDNA 环状结构的新工具,其速度比现有工具 CoRAL 快 40 倍,且在模拟数据和真实癌细胞系(如 PC3 细胞)中展现出更高的重构精度与完整性。
本文介绍了 SuperSurv,这是一个统一的 R 语言框架,旨在通过提供标准化的接口、基于逆概率加权的堆叠集成策略以及可解释性工具,解决现有生存分析工具缺乏统一平台以整合、比较和集成异构模型的问题。
本文介绍了 DNA-MGC+,这是一种专为合成 DNA 数据存储设计的通用编解码器,它通过在不同测序平台(Illumina 和 Nanopore)及严苛错误条件下(如高达 24% 的 IDS 错误率)展现出优于现有方案的可靠性、资源效率及纠错能力,实现了更低的测序深度需求和读取成本。
本文介绍了 BioPipelines,一个开源 Python 框架,旨在通过整合 30 多种计算工具并提供模块化、可交互且无需修改即可从原型过渡到生产规模的流程,帮助化学生物学家克服软件环境和技术障碍,从而专注于蛋白质与配体设计中的科学问题。
该研究通过 RISC 富集和小 RNA 测序技术证实,口服摄入的 dsRNA 在马铃薯甲虫(Leptinotarsa decemlineata)中不仅被加工为功能性 siRNA,还能成功转运至中枢神经系统并进入 RNA 干扰沉默机制。
本文提出了 SpliceSelectNet(SSNet),一种基于分层 Transformer 的深度学习模型,它通过整合局部与全局注意力机制,能够高效处理长达 100 kb 的 DNA 序列,在实现剪接位点预测和异常剪接检测的顶尖性能的同时,提供了对长距离调控机制具有生物学可解释性的框架。
Fleming 是一个整合了判别式与生成式人工智能模型的智能体,通过结合分子优化、ADMET 预测及文献检索功能,在结核分枝杆菌抑制剂发现中展现出高命中率,能够高效探索新化学空间并筛选出同时满足多重理想标准的先导化合物。