Prediction of protein-carbohydrate binding sites from protein primary sequence
本研究引入了 StackCBEmbed,这是一种新颖的集成机器学习模型,它将传统的序列特征与预训练蛋白质语言模型嵌入相结合,旨在直接从一级序列中准确预测残基层面的蛋白质-碳水化合物结合位点。
1018 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本研究引入了 StackCBEmbed,这是一种新颖的集成机器学习模型,它将传统的序列特征与预训练蛋白质语言模型嵌入相结合,旨在直接从一级序列中准确预测残基层面的蛋白质-碳水化合物结合位点。
本文介绍了 spammR,这是一个旨在促进多样化空间多组学数据集端到端分析与整合的 R 语言包,其特别侧重于针对单个组织样本中通过质谱衍生的测量值进行分析。
本研究表明,CANDO平台的这种多靶点药物重定位方法通过分析化合物-蛋白质组相互作用特征,成功识别并验证了治疗精神分裂症的新型候选药物,揭示了涉及神经递质系统和钙信号通路既有的及潜在的新机制。
本文证明了广泛使用的两两求和得分往往无法识别出最准确的多序列比对,并提出了一种基于深度学习的评分框架,即模型 2,该框架能有效对备选比对进行排序,从而改善下游的系统发育重建。
LongPolyASE 是一个全面的端到端框架,旨在通过其集成的共线性基因识别、转录本定量和差异表达分析组件,利用长读长 RNA-seq 数据实现多倍体中的等位基因特异性基因和异构体分析,从而解决目前针对此类生物缺乏专门化工具的问题。
本研究表明,由于高假阳性率和工具间的不一致性,富含 poly(A) 的 RNA-seq 数据不适用于可靠的 circRNA 检测,从而确立了通过有效的核糖体 RNA 去除进行总 RNA 测序是准确进行 circRNA 图谱分析的必要标准。
RareCapsNet 是一个可解释的胶囊网络框架,它能够稳健地识别大规模单细胞 RNA-seq 数据中的稀有细胞群体及其转录组特征,在性能上超越了最先进的方法,同时实现了跨不同实验批次的知识迁移。
该论文介绍了 GCP-VQVAE,一种 SE(3) 等变且几何完备的特征提取器,它能将蛋白质主链转换为包含 4,096 个标记的离散词表,同时保留手性和方向性,在重建精度上达到了最先进水平,并实现了鲁棒的零样本泛化能力以及比以往方法显著更快的推理速度。
这项研究表明,虽然 AlphaGenome 模型通过捕捉局部调控语法,能够有效地预测染色质开放性的变化,但由于在模拟个体间差异所需的远程调控整合方面存在挑战,它在预测基因表达变化方面的表现显著不足。
MLMarker 是一个可解释的机器学习框架,它利用在健康组织上训练的随机森林模型来计算连续相似度得分,并识别复杂蛋白质组学数据(包括稀疏生物体液样本和转移性肿瘤)中的组织来源。