Differential analysis of genomics count data with edge*
本文介绍了 edgePython,这是一个将广泛使用的 R 语言 edgeR 包移植到 Python 生态系统的工具,旨在解决单细胞基因组学分析中的集成限制,并新增了适用于多受试者分析的负二项 - 伽马混合模型及细胞水平离散度的经验贝叶斯收缩功能。
1018 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文介绍了 edgePython,这是一个将广泛使用的 R 语言 edgeR 包移植到 Python 生态系统的工具,旨在解决单细胞基因组学分析中的集成限制,并新增了适用于多受试者分析的负二项 - 伽马混合模型及细胞水平离散度的经验贝叶斯收缩功能。
本文介绍了无需分子标签(UMI)的纳米孔测序生物信息学流程 NanoHIVSeq,该流程通过多步聚类、一致性修正和去噪等策略,能够从高错误率的牛津纳米孔(ONT)数据中高效、准确地恢复全长 HIV-1 包膜(Env)基因变异,为大规模队列研究提供了简化且可靠的解决方案。
该研究通过分子嵌入微调和大语言模型提示工程,在多个数据集上评估了通用及化学专用模型预测反义寡核苷酸疗效的能力,发现结合目标基因信息的 DNA 序列输入配合少样本提示(如 GPT-3.5-Turbo)取得了最佳预测效果。
本文介绍了 ModCRElib 这一独立软件包,它利用结构信息提供多种工具以分析和建模转录因子与 DNA 及调控复合物的相互作用,支持从结合位点预测到高分辨率结构建模的灵活工作流程。
本文提出了一种名为 RIMA 的计算方法,通过严格匹配跨物种单细胞转录组图谱,成功揭示了小鼠、兔和猕猴原肠胚发育过程中的分子保守性及时序差异,并展示了其在跨物种基因表达预测及模型修正方面的广泛应用潜力。
该研究提出了一种模型引导的虚拟筛选(MGVS)流程,通过将生成式结构药物设计模型与高效的化学相似性搜索相结合,成功在超大型化合物库中识别出具有可合成性且结合性能相当的类似物,从而有效解决了生成式分子设计中的可合成性难题并显著提升了筛选效率。
本文提出了名为 UnivAIRRse 的统一分层框架,旨在通过建立涵盖从序列数据到生成潜力五个操作层级的概念坐标系统,对适应性免疫受体库(AIRR)模拟器进行系统化组织与比较,从而解决现有模拟工具在基准测试、互操作性及生物学语境完整性方面的局限,并为迈向可解释、可复现且具备临床行动力的下一代免疫数字孪生建模奠定基础。
该论文提出了一种将结构化统计分布整合到图表示中的新框架,用于处理复杂的组学数据,该框架在多种癌症预测任务中表现优异,同时显著增强了对临床结果相关调控模块的生物学可解释性。
该研究通过药物重定位策略,利用分子动力学模拟证实抗 HIV/HCV 蛋白酶抑制剂(特别是茚地那韦)能通过与基孔肯雅病毒 nsP2 蛋白关键残基形成氢键并诱导构象变化来阻断其活性,从而将其确立为一种有潜力的抗病毒治疗候选药物。
BioGraphX 提出了一种基于生化规则直接从序列构建可解释蛋白质交互图的框架,通过融合 ESM-2 嵌入与 158 个可解释生物物理特征,在无需三维结构的情况下实现了高精度且具备深层生物学洞察力的亚细胞定位预测。