Robust semi-supervised scRNA-seq integration from virtual adversarial learning
该论文介绍了 scCRAFT+,这是一种鲁棒的半监督单细胞 RNA 测序(scRNA-seq)整合模型,它利用虚拟对抗训练来结合标记基因信息,从而克服了现有方法在保留细粒度细胞亚型区分方面的局限性,并提高了即使在标记集存在噪声或不完整情况下的注释准确性。
859 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
该论文介绍了 scCRAFT+,这是一种鲁棒的半监督单细胞 RNA 测序(scRNA-seq)整合模型,它利用虚拟对抗训练来结合标记基因信息,从而克服了现有方法在保留细粒度细胞亚型区分方面的局限性,并提高了即使在标记集存在噪声或不完整情况下的注释准确性。
Pillbox 是一个经过泄漏审计的基础模型预测器,它通过利用 FiLM 条件化图注意力机制整合了 CpGPT、CLAMP 和基因表达嵌入,以实现在癌症药物反应预测中的高准确度,同时利用跨架构残差相关性来诊断特征堆叠饱和现象,并确认组织谱系仍是药物反应的主导因素。
本文介绍了 GermRL,一种轻量级的强化学习框架,它有效地缓解了自回归抗体语言模型中的生殖系偏置(germline bias),使得从生殖系序列中一次性生成具有高突变阈值、结构合理且多样化的抗体候选序列成为可能,从而助力治疗药物的发现。
DivQuant 是一种基于优化的工具,它通过将问题构建为一个具有 Neyman 目标的凸二次规划问题,从而改进了从小样本中对物种丰富度和香农熵的估计,进而使其在多种生物数据集上实现了比现有最先进方法更优的准确性和经过良好校准的置信区间。
T21 研究助手是一个基于 NVIDIA Nemotron 模型构建的具备章节感知能力的检索增强生成系统,该系统优先考虑来自 1,789 篇开放获取唐氏综合征出版物的实验结果,旨在为研究查询提供具有严格引用且基于证据的回答。
EditorForge 是一个模块化框架,通过集成显式设计掩码、活性位点屏蔽以及结构质量控制,增强了基于逆折叠的蛋白质重新设计,从而为酶和基因组编辑结构域安全地生成受约束且高置信度的序列候选序列。
OMIO 是一个轻量级的开源 Python 库,它通过将低层级的文件读取与一个强制执行规范轴向约定和异构文件格式鲁棒元数据归一化的中心化、策略驱动层相分离,从而确保显微成像分析的可复现性。
本文提出并验证了一种名为 PFlogPF 的独特归一化方法,该方法结合了加法与乘法比例拟合以及对数变换,以有效地稳定方差、解释测序深度,并保持单细胞基因组学数据中特征丰度的单调性。
本文介绍了 BootDA,这是一种非参数自助法(bootstrap method),它能在不依赖转换或伪计数的情况下,同时纠正微生物组数据中的四个主要偏差来源,从而在识别真实的差异丰度以及完善冠状动脉疾病的微生物特征方面,实现了卓越的灵敏度和特异性。
本研究利用伪困惑度证明了蛋白质语言模型 ProtT5 对其训练数据存在可检测但有限的记忆现象,这表明该模型主要是在泛化蛋白质的统计语法,而非仅仅是机械地记忆序列。