PerturbLDM: conditional latent diffusion for modelling single-cell perturbation responses
PerturbLDM 是一个在 Tahoe-100M 数据集上进行预训练的条件潜在扩散框架,它在准确预测和生成不同生物学背景下对未见药物、剂量和细胞系组合的单细胞转录响应方面,优于现有方法。
1012 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
PerturbLDM 是一个在 Tahoe-100M 数据集上进行预训练的条件潜在扩散框架,它在准确预测和生成不同生物学背景下对未见药物、剂量和细胞系组合的单细胞转录响应方面,优于现有方法。
本文证明了将符合预测(conformal prediction)应用于 BayesAge 表观遗传钟,能够利用极少量的 CpG 位点生成无分布假设且经过校准的预测区间,用于基于 DNA 甲基化的年龄估计,从而解决了现有点估计模型中缺乏不确定性量化的问题。
本文表明,隐匿结合位点的检测目前受限的并非提出候选者的能力,而是由于排序能力差和缺乏共识,这揭示了将覆盖率与转化率指标分离可以发现显著的性能差距,并表明在严格的候选预算内结合几何与基于语言模型的检测器能产生最实际的改进。
作者介绍了 ProtInt,这是一个通过克服缺失值挑战,成功整合癌症细胞系与患者肿瘤蛋白质组数据的深度学习框架,从而超越了现有方法,并揭示了为了更好地使临床前模型与临床现实保持一致所需的关键生物学转变。
这项系统性基准测试研究表明,计算方法的选择而非潜在的生物学机制,是决定计算机模拟扰动结果的主要因素,因为大多数广泛使用的方法都无法检测到因果性的转录因子到通路信号,并且经常得出与 CRISPRi 实验验证相矛盾的结论。
本文表明,将单细胞基础模型与蛋白质组学数据进行跨模态预训练,能够产生优于单纯扩大仅含 RNA 模型规模的基因级和细胞级表示,以及更强的泛化能力,从而突显了多模态训练相较于仅通过参数规模扩大的价值。
本文介绍了“sigRecon”,这是一个全面的基准测试框架及开源 R 程序包,旨在系统地评估在不同生物背景下预测扰动特征的方法,研究表明投影法和基于网络的方法往往能达到或超越复杂的深度学习模型,同时强调了影响跨背景泛化能力的 key 因素。
Cell-Hub 是一个基于 R/Shiny 构建的免费、开源、基于 Docker 的图形界面,它通过将 Seurat 5、CellChat 2 和 Monocle 3 等先进工具集成到一个统一的无代码平台中,为各种计算背景的研究人员实现端到端单细胞 RNA 测序分析的民主化。
本研究表明,与标准线性参考基因组相比,使用具有 IUPAC 共识参考序列及具备歧义感知能力的比对器 novoAlign,能显著提高在临床挑战性基因组区域中的短读段变异检测性能,同时引入了开源的 BurdenBench 框架,以更好地评估不同变异检测工具在精确度-召回率权衡及净临床获益方面的表现。
该论文介绍了“disize”,这是一种通过改进的广义线性混合模型利用实验设计信息,来更准确地估计大小因子并改善下游差异表达分析的新型 RNA-seq 标准化方法,尤其适用于存在广泛表达变化的挑战性场景。