The Stochastic System Identification Toolkit (SSIT) to model, fit, predict, and design experiments
本文介绍了一种名为随机系统识别工具包(SSIT)的开源 MATLAB 软件,它通过整合多种随机模拟方法、统计推断及实验设计功能,旨在高效处理生物数据中的随机性与异质性,从而优化参数估计、预测准确性并指导实验设计。
1018 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文介绍了一种名为随机系统识别工具包(SSIT)的开源 MATLAB 软件,它通过整合多种随机模拟方法、统计推断及实验设计功能,旨在高效处理生物数据中的随机性与异质性,从而优化参数估计、预测准确性并指导实验设计。
本文提出了一种名为 SPAE 的集成正弦与分段自编码器模型,旨在通过提升准确性和鲁棒性,有效解析单细胞 RNA 测序数据中的细胞周期动态与细胞状态,并辅助去除细胞周期效应及预测癌症细胞周期转换。
REMAG 是一款利用对比学习(结合 HyenaDNA 基础模型、Siamese 网络和 Barlow Twins 损失函数)从长读长宏基因组数据中高效回收高质量真核生物基因组组装(MAGs)的新工具,有效解决了现有流程因依赖原核参考数据库而难以处理真核生物基因组的问题。
针对现有基因结构可视化工具在自定义注释和交互性方面的不足,本文介绍了名为 geneSTRUCTURE 的现代平台,该平台通过命令行和网页界面,支持基于 GFF3 和 GTF 格式灵活、交互式地可视化基因结构并叠加突变位点等补充注释。
本研究完成了兰花科首个端粒到端粒(T2T)水平的四倍体石斛基因组组装与单倍型解析,揭示了其约 86 万年前的四倍化事件,并阐明了 SWEET 基因家族在附生适应及菌根共生中的关键作用。
该研究提出了一种结合机器学习和深度学习的分析流程,通过分类表型并计算特征重要性,成功从开放 SNP 数据中识别出与 30 种表型相关的基因,其结果与 GWAS 目录高度一致,表明该方法能有效辅助疾病机制研究和治疗靶点发现。
本研究通过分子对接、动力学模拟及结合自由能分析,证实了 Withaferin A 能稳定结合 Marburg 病毒的关键蛋白(VP35 和 NP),展现出良好的药代动力学特征和作为多靶点抗病毒候选药物的潜力。
本研究开发了一个数据驱动的灵活模拟框架,首次系统评估了 CIRI-long、IsoCIRC 和 circNICK-Irs 三种工具在牛津纳米孔长读长测序数据中检测 circRNA 的性能,揭示了各工具在灵敏度、精度及重叠度上的显著差异,并为该领域的工具选择与算法优化提供了重要参考。
本文提出了一种基于耦合张量分解与多视图辅助信息(如化学结构、副作用等)的联合学习框架(SI-ADMM),通过改进的 ADMM 算法在解决数据稀疏问题的同时,实现了对药物组合疗效与药物相互作用(包括新药场景)的同步预测,并在多源数据集上验证了其优越性。
本文提出了 t2pmhc,这是一种利用 TCR-pMHC 复合物预测结构构建的图神经网络框架,通过捕捉三维结构相互作用显著提升了模型对未见肽段的泛化能力,并揭示了与生物学机制一致的注意力分配模式。