← 最新论文
🧬 biology

LucaCell: a sequence-centric foundation model for cross-species single-cell analysis

LucaCell 是一种以序列为中心的基座模型,它利用预训练的 mRNA 序列嵌入而非固定的基因标识符,以实现稳健的跨物种、跨模态和跨上下文单细胞分析,包括准确的细胞类型迁移、微生物物种区分以及宿主-病毒相互作用预测。

原作者: Yan Sun, Yong He, Minsi Ren, Yanhui Wang, Penghao Xu, Yong Hou, Yu Kang, Tingjun Hou, Jieping Ye, Huanming Yang, Zheng Wang

发布于 2026-09-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yan Sun, Yong He, Minsi Ren, Yanhui Wang, Penghao Xu, Yong Hou, Yu Kang, Tingjun Hou, Jieping Ye, Huanming Yang, Zheng Wang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在每一个活细胞内部,都有一套复杂的指令库,决定着该细胞如何运作、生长以及对环境做出反应。这些指令是用一种被称为 RNA 的化学语言书写的,它充当着从细胞主蓝图传递指令的信使。几十年来,科学家们开发了各种工具来读取这些信息,使他们能够对人体内的不同细胞类型进行编目,并理解疾病是如何破坏其正常运作的。然而,一个主要的障碍一直存在:这些工具依赖于基因的固定名称和标签,就像一个只有在每本书都有特定预设索书号时才能工作的图书馆一样。如果科学家试图将人类细胞与小鼠细胞或人类细胞与微生物进行比较,旧系统往往会失效,因为名称不匹配,或者数据来自完全不同的测量类型。这种局限性使得构建一个跨越不同物种和生物背景的统一、通用的生命理解体系变得十分困难。

现在,一组研究人员引入了一种全新的方法,完全绕过了这些命名问题。他们不再依赖静态标签,而是构建了一个直接从构成遗传密码的字母原始序列中学习的计算机模型。通过教导模型去识别这些化学字母本身的模式,研究人员创建了一个无需知道特定名称或所属物种,就能理解基因本质的系统。这个名为 LucaCell 的新模型将遗传密码视为一种连续的语言,而非一系列脱节的项目。其结果是,该工具可以实现生物信息的跨物种转换,预测细胞对变化的反应,甚至能在感染变得明显之前就将其识别出来,为研究生命的构建模块提供了一种更灵活、更强大的方式。

这一突破的核心在于模型如何表示基因。传统方法将每个基因视为一个独特的符号,类似于字典中的一个单词。如果字典发生了变化,或者你正在阅读另一本书的语言,这些符号就不再有意义。然而,LucaCell 观察的是构成基因的实际字母序列。它使用一个预训练系统将这些序列转换为捕捉其含义和关系的数学形状。当模型遇到一个基因时,它根据其化学结构而非标签来理解其功能。这使得它能够识别出人类肾脏中的一个基因与小鼠肾脏中的一个相似基因是相关的,即使它们的名称不同,或者数据是通过不同的技术收集的。研究人员通过在一个包含来自人类和小鼠的八千五百万个细胞的大规模数据集上训练该模型进行了测试,这些数据涵盖了数十种组织和疾病状态。这种训练赋予了模型对细胞行为的一种深刻且通用的理解。

一旦训练完成,该模型便被投入到几个旧系统通常难以应对的挑战性场景中进行测试。在一项实验中,研究人员要求模型识别人类、小鼠以及一种被称为灰鼠狐猴的小型灵长类动物肾脏中的细胞类型。模型成功地在这些不同物种之间匹配了细胞类型,即使数据来自于不同类型的测量方式(例如直接读取遗传密码与读取 DNA 的可及性)。它在处理未见过的鼠类数据方面表现尤为出色,表明基于序列的方法捕捉到了适用于跨物种的基础生物学真相。该模型也被证明能够处理微生物。在涉及单个细菌的测试中,模型分析了原始遗传读数,而无需预先将其比对到参考基因组。它成功区分了五十多种不同的细菌物种,甚至能通过观察其遗传序列中的模式,检测出细菌内部状态的细微变化,例如它们对抗生素压力的反应。

这种以序列为中心的视角的力量还延伸到了预测细胞如何响应特定变化方面。研究人员利用该模型模拟了如果关闭或改变特定基因会发生什么,这一过程被称为“扰动”。在这些测试中,该模型预测基因活动变化的准确度高于以往的系统。它还能考虑到个体之间极其微小的遗传代码差异,即单核苷酸多态性。通过纳入这些微小的差异,该模型提高了预测特定人群基因表达水平的能力,表明即使是遗传序列中的微小变化也会对细胞功能产生可衡量的影响。这种细致程度表明,该模型捕捉到了那些更广泛的、基于标签的系统往往会忽略的细微差别。

或许其中最引人注目的应用是在宿主-病毒相互作用领域。研究人员训练该模型来预测感染了不同流感病毒株的单个细胞中的病毒载量。面对从未见过的“病毒-宿主”组合时,该模型的表现优于所有现有的工具,能够正确识别出其他工具无法识别的感染模式。它甚至能够观察那些尚未暴露于病毒中的细胞,并识别出已经显示出即将发生感染的遗传特征的一小部分亚群。这一发现表明,该模型可以检测出细胞中存在的微妙预存状态,使它们更容易受到感染,这一能力对于理解疾病如何在细胞层面传播至关重要。

LucaCell 的成功表明,遗传字母的序列包含了理解生物学的可迁移基础。通过从固定的标识符转向关注底层的化学语言,研究人员创建了一个更具适应性和鲁棒性的模型。虽然当前版本依赖于人类和小鼠的数据,并使用了简化的遗传序列视图,但结果表明,这种方法可以弥合物种、数据类型和生物背景之间的鸿沟。它提供了一种看待细胞世界的新方式,在这个世界里,生命的根本语言被直接理解,而无需翻译或僵化的分类。这种从“标签”到“序列”的转变,很可能成为未来探索细胞如何运作、互动以及应对生命挑战的标准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →