A geometric atlas of how ESM3 organizes modalities across depth
这项研究揭示了在多模态蛋白质语言模型 ESM3 中,不同的物理模态(序列、结构、二级结构和溶剂可及性)最初占据独立的子空间,随后在第 25 层至第 35 层之间融合为一个共享的低维表示,而功能注释在整个过程中保持正交,且这一融合过程是一个被学习到的、独立于蛋白质长度的普遍属性,但会被结构无序性所延迟。
858 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
这项研究揭示了在多模态蛋白质语言模型 ESM3 中,不同的物理模态(序列、结构、二级结构和溶剂可及性)最初占据独立的子空间,随后在第 25 层至第 35 层之间融合为一个共享的低维表示,而功能注释在整个过程中保持正交,且这一融合过程是一个被学习到的、独立于蛋白质长度的普遍属性,但会被结构无序性所延迟。
ProtBLIP2-SST 是一种新型的两阶段框架,它通过结构感知语言模型和 Q-Former 投影器将蛋白质序列与 3D 结构信息进行整合,从而使大语言模型能够生成灵活、开放式的功能描述,进而克服了传统僵化的基因本体(gene ontology)分类的局限性。
EcoMorph 是一个模块化系统,它利用基于提示的 Segment Anything Model 3 (SAM3) 在无需针对特定分类群进行训练的情况下,精确量化不同生态背景下的面积、大小和丰度等形态特征,从而实现来自异构图像源的高通量生态研究。
本文介绍了 CellTok,这是一种将连续的单细胞转录组图谱分词为与预训练大语言模型兼容的离散序列的新颖方法,从而实现了一个统一的框架,用于共同处理细胞数据、生物学背景和文本指令,以执行诸如细胞识别、疾病推断和状态生成等多种任务。
本文介绍了 scDiagnostics,这是一个开源 R 包,旨在系统地检测单细胞转录组数据中复杂或具有误导性的细胞类型注释,从而通过确保下游解释的可靠性来解决当前分析工作流中的关键空白。
本文介绍了 onsite,一个开源 Python 框架,它整合了丙氨酸诱饵(alanine-decoy)策略,旨在跨多种磷酸化位点定位算法标准化假定位率估计,并证明了其在大规模质谱数据集上的卓越可扩展性与准确性。
PKProbDesign 是一种新颖的基于采样的框架,它通过支架分解和条件系综评估直接优化热力学折叠概率,解决了伪结结构 RNA 反向折叠的挑战,在基准目标上优于 DesiRNA 和 MODENA 等现有方法。
通过将单细胞与空间转录组学与线粒体变异谱系追踪相结合,本研究揭示了骨肉瘤的进展涉及从 COL3A1 祖细胞到转移性 THY1 细胞的阶梯式转录级联反应,这种命运转换受限于与功能障碍的 PLVAP 内皮细胞的空间共定位,从而形成一个富含 PTN/NOTCH 的前转移生态位,进而建立了一个微环境信号驱动不可逆克隆定向分化的“时间-空间-谱系”框架。
本文介绍了 ProtAug,一个用于蛋白质语言模型(pLM)引导的蛋白质序列数据增强框架,该框架系统地论证了用户控制的变异水平如何能在多种任务中一致地提升下游预测性能,并揭示了虽然在低到中度变异时保持生物合理性是有益的,但高变异增强也能通过正则化效应驱动性能提升。
本文介绍了一种由 PubMLST 托管的、用于化脓性链球菌(*Streptococcus pyogenes*)的新型、可扩展且全球可访问的核心基因组 MLST 和 LIN 编码方案,旨在加强对疫情暴发的检测,并促进追踪遗传变异方面的国际合作。