Error Correction Algorithms for Efficient Gene ExpressionQuantification in Single Cell Transcriptomics
本文提出了一种名为 O_SCPLOWARCANEC_SCPLOW 的新算法及命令行工具,通过结合基于 Fourway 方法的 k-mer 发现技术来优化条形码纠错、读段映射和 UMI 解析,从而在单细胞转录组数据中实现比现有工具更快速且结果相当的高效基因表达定量。
1018 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文提出了一种名为 O_SCPLOWARCANEC_SCPLOW 的新算法及命令行工具,通过结合基于 Fourway 方法的 k-mer 发现技术来优化条形码纠错、读段映射和 UMI 解析,从而在单细胞转录组数据中实现比现有工具更快速且结果相当的高效基因表达定量。
该论文提出了一种名为 ProtBFF 的编码器无关框架,通过交叉嵌入注意力机制将可解释的生物物理先验知识注入蛋白质嵌入表示中,从而显著提升了预测的准确性与可靠性,使通用编码器在性能上超越了现有的专用模型。
该研究构建了首个包含超过 1800 万张谱图的全面顶向下质谱谱库 TopRepo,不仅实现了跨数据集的蛋白质组特征分析,还显著提升了蛋白质组鉴定精度并支持了深度学习模型的训练。
本文提出了 CellAwareGNN,一种将单细胞基因组数据整合到增强版生物医学知识图谱(scPrimeKG)中的图基础模型,通过引入细胞类型特异性上下文显著提升了药物适应症预测的准确性与生物学可解释性,特别是在自身免疫疾病领域表现优异。
MetaTracer 是一款基于核苷酸比对的高分辨率框架,能够单次运行将宏转录组测序读段同时分配至特定微生物物种和表达基因,从而在保持物种级分辨率的同时实现基因表达与物种的精准关联。
本研究提出了一种可解释的时间分辨逆建模框架,通过分层处理 RNA 测序与细胞染色核形态数据,成功建立了低剂量辐射暴露下随时间变化的转录组响应与核形态特征之间的关联。
Cellects 是一款用户友好且开源的软件,旨在通过图形界面和 Python API 对从真菌菌落到单细胞分支网络等多种生物系统的二维图像及时间序列数据,进行自动化的生长、运动及形态量化分析。
本文提出了一种名为 DeepEST 的多模态深度学习框架,通过整合基因表达、基因位置及蛋白质结构信息,显著提升了细菌蛋白质功能预测的准确性,并有效填补了未分类假设蛋白的功能注释空白。
该研究通过理论推导与基于爱沙尼亚生物样本库的模拟分析,揭示了在忽略基因互作(上位效应)的情况下使用线性模型进行全基因组关联分析(GWAS)会导致检验统计量出现偏差,从而在真实参数设置下产生虚假显著性信号,提示在解读现有文献时需对此保持警惕。
本文介绍了 STELAR-X,一种基于三元组的统计一致物种树推断算法,它通过重构数据结构和利用 GPU 并行计算,将内存复杂度优化至 O(nk),从而实现了在 10 万物种或 10 万个基因的大规模数据集上高效、低内存的物种树重建,显著超越了现有方法(如 ASTRAL-MP)的扩展性极限。