ML4SD: Leveraging Machine Learning and High-Throughput Search Algorithms for an Iterative Growth-Coupled Design Innovation
本文介绍了 ML4SD,这是一种将机器学习与一种新型高通量算法(gcSwarms)相结合的主动学习“设计-构建-测试-学习”循环,旨在高效识别生长耦合的微生物菌株设计,从而以远少于传统搜索方法的实验迭代次数,实现显著提高的碳收率。
1012 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文介绍了 ML4SD,这是一种将机器学习与一种新型高通量算法(gcSwarms)相结合的主动学习“设计-构建-测试-学习”循环,旨在高效识别生长耦合的微生物菌株设计,从而以远少于传统搜索方法的实验迭代次数,实现显著提高的碳收率。
本研究表明,尽管 Wasserstein GAN 在生成具有实验可行性的从头抗体方面优于变分自编码器(99% 对 5% 的成功率),但这种差异主要是由采样策略——无条件生成与利用已知抗体进行潜空间播种——而非架构本身的优越性所驱动的。
本文介绍了一种针对随机基因表达模型的具有不确定性感知能力的模型选择规则,该规则通过利用基于影响函数和坎泰利不等式(Cantelli's inequality)推导出的数据驱动阈值来增强传统的 PGF-BIC,从而在考虑采样不确定性并防止过度选择复杂模型的同时,保证了计算效率。
通过对配对的口腔和肠道微生物组数据应用基于 SHAP 的可解释性分析,本研究揭示了虽然结合模型在区分新生儿与成年人方面的预测准确度并未超越仅使用肠道数据的完美预测准确度,但它们发现了来自口腔腔内具有互补性且非冗余的生物特征,而这些特征是传统准确度指标所无法捕捉到的。
本文介绍了分层时间变换器(Hierarchical Temporal Transformer, HTT),这是一种利用纵向病理报告和癌症类型嵌入的双层架构,旨在实现最先进的癌症分级预测,并展示了在不损失性能的情况下向未见癌症类型的有效零样本迁移学习能力。
该论文介绍了 POME,这是一种旨在为部分观测的混合类型生物医学数据生成低维表示的自监督图嵌入模型,该模型实现了最先进的插补性能,并能有效支持下游任务,如患者亚组发现、预测建模和治疗推荐。
该论文介绍了 LAMINA,这是一种通过聚合软基序相互作用来准确预测肽-HLA结合的可解释深度学习模型,在仅从序列数据中涌现性地学习结合热力学和结构特征的同时,实现了最先进的性能。
本文介绍了 pydreg,这是一个对 dreg 算法进行的快速且易于维护的 Python 重实现,用于从新生转录中识别活跃的顺式调控元件,它在保持原方法准确性及与现代计算基础设施兼容性的同时,显著降低了运行时间和内存消耗。
通过对比中世纪蒙古个体匹配的全无去簇(full-UDG)与非去簇(non-UDG)古DNA文库,本研究表明,虽然各种计算损伤校正方法(修剪、重缩放和掩蔽)在位点保留与误差降低之间存在差异化的平衡,但最优选择取决于具体的下游分析,且校正后的数据对于非去簇文库中准确的亲缘关系推断至关重要。
本文提出了一种集成在 DMRcaller 软件包中的可扩展框架,该框架利用原生 Oxford Nanopore 测序技术来量化单分子 DNA 甲基化异质性并检测共甲基化位点,从而揭示了被传统的位点级平均分析所掩盖的表观遗传模式和调控相互作用。