BLOSUM Is All You Learn - Generative Antibody Models Reflect Evolutionary Priors
本研究表明,生成模型对数似然值与抗体结合亲和力之间的相关性,是因为这些模型隐式地学习了进化先验,其表现与针对已知亲本结合剂计算的简单 BLOSUM 相似度得分相当。
1018 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本研究表明,生成模型对数似然值与抗体结合亲和力之间的相关性,是因为这些模型隐式地学习了进化先验,其表现与针对已知亲本结合剂计算的简单 BLOSUM 相似度得分相当。
本文引入了一种基于 PARAFAC2 的新型分析框架,该框架通过显式捕捉纵向微生物组数据中特定于受试者的时空变化,克服了标准 CP 模型的局限性,从而能够发现此前被忽视的、具有可复制性的个体化发育特征。
该论文介绍了 SWARM,这是一个基于人工智能的框架,它通过克服纳米孔测序中的高假阳性率,显著提高了单分子 RNA 修饰图谱分析的精准度,从而实现了对新型修饰位点的发现,并揭示了关于假尿苷沉积的新见解,同时对现有的表观转录组协调模型提出了挑战。
本文介绍了 OptMini,这是一种通过克服暴力搜索和整数线性规划的局限性,来计算大窗口尺寸下最小密度极小值集(minimizers)的高效算法,同时也为极小值集密度与通用命中集(universal hitting sets)之间的关系提供了新的见解。
本文介绍了 AniAnn,这是一种开源的、无需比对的算法,它利用快速平均核苷酸一致性估计,能够快速且准确地注释不同真核生物基因组中的大型串联重复阵列和卫星 DNA,且与现有方法相比显著缩短了运行时间。
本文介绍了 GLYCAM 细菌碳水化合物构建器,这是一款增强型网络工具,它整合了细菌单糖参数及其衍生物,以促进复杂的细菌聚糖 3D 结构模型和分子动力学输入文件的直观生成。
LocAlign 是一个几何深度学习框架,它通过在配体结合对上进行弱监督训练,迭代地预测原子级对应关系和 3D 超配,从而实现局部蛋白质结构对齐,能够有效地在多种蛋白质折叠中识别功能基序,且无需地面真值对齐。
本文提出了一种新颖的算法,该算法能够构建基于 RLBWT 的压缩全文本索引,并在处理重复性数据集时,以最优的 时间和 空间复杂度计算 LCP 相关信息,与以往方法相比,在太字节级(terabase-scale)泛基因组分析中实现了峰值内存使用量 12.6 倍的降低。
本文介绍了一种可扩展、可解释且高效的蛋白质表示方法,该方法基于由 40 个进化保守片段组成的精选字母表,在聚类、数据库搜索以及指导功能性蛋白质骨架生成方面,其表现优于传统的序列和结构方法。
这项研究揭示了在男性心脏中一种罕见的神经元或胶质细胞类型中,存在着前所未有的雌性特异性长链非编码RNA XIST的内源性表达,其上调与心脏病和心肌梗死相关,这表明在心脏病理学中存在一条全新的、具有临床干预意义的非编码RNA通路。