TEDlm: domain-centric protein language models with optional structural pre-training
该论文介绍了 TEDlm,这是一种以结构定义域片段为预训练基础的领域中心蛋白质语言模型,其在远程同源性检测和分子功能预测方面优于规模更大的全序列模型,证明了专注于结构域内在信号可以产生紧凑且具备结构信息的表示。
1012 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
该论文介绍了 TEDlm,这是一种以结构定义域片段为预训练基础的领域中心蛋白质语言模型,其在远程同源性检测和分子功能预测方面优于规模更大的全序列模型,证明了专注于结构域内在信号可以产生紧凑且具备结构信息的表示。
amR R 软件包套件通过整合多尺度基因组特征提取、机器学习模型训练以及交互式可视化,提供了一个全面且具解释性的框架,用于预测细菌病原体的抗生素耐药性,从而揭示跨物种和多重耐药机制。
本文评估了 AlphaFold3 在多种生物分子应用中的表现,发现虽然它提供了强大的全原子建模能力,但其准确性和可靠性并不均衡且严重依赖于训练集的重叠情况,因此与前代模型相比,需要进行谨慎的解读。
基因组注释基础设施(GAIn)是一个能够通过声明式流水线、公共资源库以及支持自定义扩展和自动重注释的灵活 Web 和命令行界面,实现透明、可复现且可扩展的基因组变异注释的平台。
这项研究揭示了在多模态蛋白质语言模型 ESM3 中,不同的物理模态(序列、结构、二级结构和溶剂可及性)最初占据独立的子空间,随后在第 25 层至第 35 层之间融合为一个共享的低维表示,而功能注释在整个过程中保持正交,且这一融合过程是一个被学习到的、独立于蛋白质长度的普遍属性,但会被结构无序性所延迟。
ProtBLIP2-SST 是一种新型的两阶段框架,它通过结构感知语言模型和 Q-Former 投影器将蛋白质序列与 3D 结构信息进行整合,从而使大语言模型能够生成灵活、开放式的功能描述,进而克服了传统僵化的基因本体(gene ontology)分类的局限性。
EcoMorph 是一个模块化系统,它利用基于提示的 Segment Anything Model 3 (SAM3) 在无需针对特定分类群进行训练的情况下,精确量化不同生态背景下的面积、大小和丰度等形态特征,从而实现来自异构图像源的高通量生态研究。
本文介绍了 CellTok,这是一种将连续的单细胞转录组图谱分词为与预训练大语言模型兼容的离散序列的新颖方法,从而实现了一个统一的框架,用于共同处理细胞数据、生物学背景和文本指令,以执行诸如细胞识别、疾病推断和状态生成等多种任务。
本文介绍了 scDiagnostics,这是一个开源 R 包,旨在系统地检测单细胞转录组数据中复杂或具有误导性的细胞类型注释,从而通过确保下游解释的可靠性来解决当前分析工作流中的关键空白。
本文介绍了 onsite,一个开源 Python 框架,它整合了丙氨酸诱饵(alanine-decoy)策略,旨在跨多种磷酸化位点定位算法标准化假定位率估计,并证明了其在大规模质谱数据集上的卓越可扩展性与准确性。