In Search of Manifolds Inside Protein Language Models: A Largely Negative Report
本文通过一系列全面的几何与拓扑诊断手段,系统地研究了蛋白质语言模型(pLMs)中的流形假设,并得出结论:与单细胞基础模型不同,pLM 的表示形式主要是高维且线性的,而非围绕低维流形组织。
4404 篇论文
本文通过一系列全面的几何与拓扑诊断手段,系统地研究了蛋白质语言模型(pLMs)中的流形假设,并得出结论:与单细胞基础模型不同,pLM 的表示形式主要是高维且线性的,而非围绕低维流形组织。
这项实证研究表明,尽管生物学大语言模型(SCFMs)确实编码了一种真实的、低维的且部分线性化的生物学知识几何结构,但这种结构规模有限、通常呈非线性纠缠状态,并且在很大程度上与经典的基于表达的方法(如 PCA)所能恢复的内容相重叠,未能达到自然语言模型中所观察到的那种清晰且规则的几何形态。
本文提出了一个包含十一个虚拟细胞模型的统一基准测试,揭示了尽管深度学习方法在表征任务和组合扰动预测方面显著优于基准模型,但它们通常无法在预测未见的单基因扰动方面超越简单的线性模型,这表明该领域目前实现的是用于细胞状态分析的“虚拟显微镜”,而非用于因果扰动动力学的真正的“虚拟模拟器”。
本研究表明,尽管稀疏自编码器能够有效地从 DNA 基础模型中提取出如序列基序和阅读框等具有单语义性且具备生物学解释性的特征,但它们也揭示了编码复杂调控逻辑的特征显著匮乏,这表明目前的模型捕捉的是一种基因组词典而非语法引擎。
本文通过对六种生物数据模态的统一实证分析,证明了有限样本偏差会严重扭曲信息论估计,并指出在未指明估计器和样本量的情况下报告熵与互信息是站不住脚的,因为经偏差修正后的方法揭示了截然不同的生物学信号,并纠正了对熵的系统性低估以及对信息含量的系统性高估。
这项实证研究表明,在针对不同老化队列进行生物年龄预测时,前转换器模型(如惩罚回归和梯度提升)在准确性、数据效率、跨队列迁移以及死亡风险分层方面通常优于或等同于基于注意力的转换器模型,从而确立了它们作为长寿科学理性默认选择的地位,并将转换器定位为仅在拥有极大规模数据集时才具备可行性的专业化工具。
这项实证研究表明,对于基于血液的衰老时钟而言,预测目标(死亡率衍生的表型年龄与实际年龄)的选择压倒性地决定了生物标志物的有效性及其与死亡率的相关性,使得增加深度学习模型的容量在改善这些关键结果方面显得基本无效。
本研究提出,阿尔茨海默病并非仅仅源于单纯的被动蛋白毒性,而是由于衰老神经元与神经胶质细胞中被沉默的胚胎期肌动蛋白-肌球蛋白振荡通路发生了异常的表观遗传重激活,从而产生了驱动轴突“向后退行性死亡”和突触退缩的机械不稳定性。
由于作者为遵守机构预印本政策而撤回了本文,他们明确要求不要引用该项工作。
本研究确定了 REEP2 是 EMT 驱动的肺癌进展的关键介导因子,证明了 ZEB1/miR-183/193a 轴通过上调 REEP2 来增强从内质网到高尔基体的转运以及促肿瘤因子的分泌,从而促进肿瘤转移和免疫抑制。