scProfiterole: Clustering of Single-Cell Proteomic DataUsing Graph Contrastive Learning via Spectral Filters
本文提出了名为 scProfiterole 的计算框架,通过利用 Arnoldi 正交化实现谱图滤波器的多项式插值,并结合图对比学习,有效解决了单细胞蛋白质组数据中缺失值和噪声问题,从而显著提升了细胞类型聚类的准确性与鲁棒性。
1018 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文提出了名为 scProfiterole 的计算框架,通过利用 Arnoldi 正交化实现谱图滤波器的多项式插值,并结合图对比学习,有效解决了单细胞蛋白质组数据中缺失值和噪声问题,从而显著提升了细胞类型聚类的准确性与鲁棒性。
本文介绍了 AQuA2-Cloud,这是一个基于云的 Web 平台,旨在通过消除 MATLAB 许可依赖并支持多用户协作,使研究人员能够便捷地利用标准浏览器对荧光生物成像数据进行高精度的时空活动分析。
本文介绍了一种名为 OpticalFlow3D 的易用光学流工具,旨在克服生物成像中非刚性结构运动分析的难点,通过直接处理三维荧光显微镜图像像素级运动数据,为从蛋白质到生物体尺度的定量生物学研究提供新见解。
本文提出了名为“简单缠结遍历器(TTT)”的算法,利用深度覆盖和读段比对信息,通过混合整数线性规划与欧拉路径优化自动解决基因组组装图中因长重复序列导致的复杂缠结问题,从而消除人工干预需求并填补组装缺口。
本研究通过计算机模拟分析,首次揭示了人类肌联蛋白(Titin)中免疫球蛋白样、纤连蛋白 III 型和蛋白激酶结构域具有不同的降解稳定性,从而为将其作为推断死后间隔时间(PMI)的多结构域生物标志物奠定了理论基础。
本文介绍了一种基于 KNIME 的 DIA-NN EasyFilter 工作流,旨在通过提供无需编程技能即可执行的快速、用户友好的蛋白质过滤与可视化功能,解决 DIA-NN 原始输出文件难以直接分析的问题,从而提升大规模蛋白质组学数据的评估准确性与可解释性。
NanoVI 是一款基于 Nextflow 的开源流程,它利用贝叶斯变分推断和 GTDB 数据库,能够比现有工具更快速、准确地对全长 16S rRNA Nanopore 读段进行物种级分类,并提供包含不确定性量化的丰度估计。
PhosSight 是一个统一的深度学习框架,通过引入 PhosDetect 模型精准预测肽段可检测性,有效解决了 DDA 和 DIA 模式下的数据缺失与搜索效率瓶颈,显著提升了磷酸化蛋白质组的鉴定深度并助力发现了如 MARK2 等新的预后激酶靶点。
FAMUS 是一种基于对比学习的大规模蛋白质功能注释框架,它通过将查询序列与隐马尔可夫模型数据库的相似性评分转化为低维向量空间,克服了传统单条最佳匹配方法的局限性,在多个数据库基准测试中显著优于现有工具,并提供便捷的软件包与网络服务器以支持大规模基因组分析。
本研究开发并发布了名为 SCL2205 的高质量蛋白质亚细胞定位数据集,该数据集通过严格的数据预处理和划分策略解决了现有数据泄漏问题,显著提升了深度学习模型的预测性能,并揭示了现有最先进方法中普遍存在的性能指标虚高现象。