← 最新论文
💻 bioinformatics

Single-cell foundation models benefit from cross-modal training: adding proteomics data beats parameter scaling

本文表明,将单细胞基础模型与蛋白质组学数据进行跨模态预训练,能够产生优于单纯扩大仅含 RNA 模型规模的基因级和细胞级表示,以及更强的泛化能力,从而突显了多模态训练相较于仅通过参数规模扩大的价值。

原作者: Burq, M., Stepec, D., Kim, C., Cimermancic, P.

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Burq, M., Stepec, D., Kim, C., Cimermancic, P.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在每一个活细胞内部,都进行着一场复杂的对话,而这场对话是用两种不同的语言书写的。一种语言是由 RNA 组成的,这种分子携带构建蛋白质的指令,而蛋白质是维持细胞生存与功能的劳模。科学家们多年来致力于学习阅读这些 RNA 信息,创建了巨大的数字库,用以描述细胞在健康与疾病状态下的行为。这些库已经变得如此庞大,以至于研究人员现在使用被称为“基础模型”的强大计算机程序来寻找其中的模式。这些程序学会了识别不同细胞类型的独特特征,就像一位图书管理员能通过封面瞬间识别出书籍的类型一样。长期以来,主流观点认为,让这些程序变得更聪明的唯一方法就是向它们喂入越来越多的 RNA 数据,希望单纯的容量积累最终能揭示细胞生命的每一个秘密。

然而,细胞不仅会说一种语言。除了 RNA,它们还会产生蛋白质,即执行细胞任务的实际结构。虽然 RNA 告诉细胞要建造什么,但蛋白质才是最终的成品。直到最近,大多数细胞计算机模型都忽略了这些蛋白质,而仅仅专注于 RNA 指令。这留下了一个理解上的空白,因为指令并不总是与最终结果相匹配。科学家面临的问题是:加入这第二层信息——蛋白质数据——是否能比仅仅增加 RNA 数据更能教会这些计算机模型。这是一个测试,旨在验证信息的质量与多样性是否能胜过那种通过单纯扩大模型规模并喂入更多同类数据的简单策略。

一个研究团队决定通过训练一个基于新型数据的计算机模型来回答这个问题。他们从一个已经从数亿个 RNA 样本中学习过的现有模型开始。他们并没有只是喂给它更多的 RNA,而是向其引入了大量的蛋白质谱图。这些谱图来自 440 项使用质谱技术(一种测量细胞中特定蛋白质存在情况的技术)的研究。研究人员仔细引导模型从这 48,843 个蛋白质样本中学习,这一过程他们称之为“跨模态持续预训练”。这意味着模型必须学习蛋白质语言如何与其已知的 RNA 语言相关联,从而有效地教会它通过指令和成品两个维度来理解细胞。

结果令人震惊。研究人员训练了一个拥有 7,000 万个参数(衡量其复杂性的指标)的模型,仅通过对蛋白质样本进行一次遍历(one pass)就完成了混合数据的训练。当他们测试这个模型时,它的表现与那些规模庞大得多且仅在 RNA 上训练的模型一样出色,甚至更好。具体而言,这个带有蛋白质数据的较小模型,其性能达到了甚至超过了拥有 10 亿和 30 亿参数的纯 RNA 模型。这一发现挑战了这样一种观点,即通往更好理解的唯一途径仅仅是扩大模型的规模以及增加 RNA 数据的量。相反,它表明引入另一种类型的生物学数据可以为模型的智能提供更高效的提升。

这种方法的益处超出了通用性能的范畴。经过蛋白质数据训练的模型展现出了更强的泛化能力,这意味着它能够将所学知识应用于从未见过的全新情境。这一点在测试模型如何应对蛋白质变化时表现得尤为明显。在这些测试中,仅仅扩大纯 RNA 模型的大小并不能帮助它更好地理解这些变化;然而,那个学习过蛋白质的模型却能更轻松地应对这些新挑战。这表明,蛋白质数据帮助模型建立了一种更稳健、更灵活的对细胞运作方式的理解,这种理解并不严格受限于仅在 RNA 中发现的模式。

这些发现表明,理解细胞的未来可能不在于构建基于单一类型数据且规模日益庞大的模型。相反,最强大的洞察力可能来自于精心结合不同种类的生物学信息。通过教会计算机模型同时阅读细胞的指令与产品,科学家可以创造出不仅更聪明而且预测更准确的工具。这种方法为构建更具信息量的模型提供了一条充满希望的路径,使其能够捕捉生命的完整复杂性,证明了有时,引入一个新的视角远比单纯增加相同的内容更有价值。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →