← 最新论文
🧬 biology

A vision foundation model for single-cell biology via spatial gene cartography

该论文介绍了 scVision,这是一个视觉基础模型,它通过基于共表达对基因进行空间排列,将单细胞转录组转化为连续图像,从而在无需微调的情况下,利用基因布局中固有的生物学信号而非仅仅依靠神经网络架构,实现了最先进的零样本细胞类型注释和基因程序恢复。

原作者: Ridvan Yesiloglu, Sakib Mostafa, James Zou, Ash Alizadeh, Jiajun Wu, Lei Xing, Ehsan Adeli, Md Tauhidul Islam

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ridvan Yesiloglu, Sakib Mostafa, James Zou, Ash Alizadeh, Jiajun Wu, Lei Xing, Ehsan Adeli, Md Tauhidul Islam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

将生物学想象成一座规模宏大、繁忙有序的图书馆,每一本书都是一个活生生的细胞。长期以来,科学家只能读到混合在一起的一整排书的“平均”故事,这意味着他们错过了单个卷册中那些独特而微小的细节。但多亏了名为单细胞测序的技术,我们现在可以阅读图书馆中的每一本书,揭示关于我们身体如何运作、疾病如何开始以及细胞如何变化的数百万个独特故事。然而,问题在于:这些图书馆增长得太快了,拥有数十亿页的内容,试图阅读它们就像试图用消防水柱来喝水一样困难。为了理解这一切,科学家们正在构建“基础模型”——超级聪明的计算机大脑,它们学习生物学的通用规则,以便在不需要每次都从头学习的情况下,帮助我们理解新的细胞。核心问题是:我们如何才能最有效地教这些计算机阅读细胞的故事?

你即将阅读的论文介绍了一种教导这些计算机大脑的新方法,称为 scVision。scVision 没有将细胞视为由随机单词组成的句子(这是目前大多数模型的工作方式),而是决定将细胞视为一张图片。研究人员意识到,基因(细胞内的“单词”)并不只是孤立行动;它们像场景中的角色一样协同工作。通过将这些基因排列成一个特定的、有组织的网格——就像把相关的角色放在舞台相邻的位置上——他们将细胞数据转化为了连续的图像。随后,他们训练了一个计算机视觉模型(那种通常用于识别猫和狗的模型)来理解这些“细胞图片”。结果是,该模型速度极快,学习新事物所需的示例极少,并且能够发现其他模型会错过的隐藏生物学模式。这就像是从一个基于文本的翻译器升级到了一位视觉艺术家,后者能瞬间洞察一个细胞正在进行的整体图景。

将细胞转化为图片

想象你有一个巨大的乐高积木袋,每块积木代表一个基因。在大多数计算机模型中,科学家把这些积木倒进一堆,然后要求计算机猜出结构的形状。计算机必须仅通过观察这一堆积木来弄清楚哪些积木属于一组。这有点像是在地板上散落着拼图碎片时尝试解开谜题。

由斯坦福大学研究人员领导的这篇论文作者决定尝试一些不同的做法。他们问道:如果我们先完成拼图呢?

他们提取了细胞中最重要的基因,并将它们排列在一个固定的网格上,就像一张 104x104 像素的图像。他们使用了一种被称为“最优传输”(optimal transport)的巧妙数学技巧来决定每个基因的位置。规则很简单:通常一起工作的基因(比如一组消防员)会被放置在网格中相邻的位置。互不沟通的基因则会被放置在较远的地方。当他们将细胞的活动“绘制”到这个网格上时,每个细胞都会生成一张独特的图像。如果一个细胞正忙于对抗感染,图像的特定区域就会呈现出明亮的色彩;如果一个细胞处于休息状态,则会出现不同的模式。

这把理解细胞的问题从一个阅读文本的任务转变为一个视觉任务。计算机不再是阅读单词列表,而是观察一张图片。这使得他们能够利用强大的“视觉 Transformer”(这类 AI 常用于帮助自动驾驶汽车识别道路或帮助手机识别你的面部)来理解生物学。

超级学生:scVision

研究人员构建了一个名为 scVision 的模型。他们在包含 7200 万个来自人体不同部位的人类细胞 的大规模数据集上对其进行了训练。他们并没有告诉模型要寻找哪些特定的细胞类型;相反,他们使用了一种称为“掩码图像建模”(masked image modeling)的技术。想象一下,向模型展示一张细胞图片,但用黑盒遮住了其中 75% 的部分。模型的任务是根据可见部分来猜测隐藏部分的样貌。通过进行数十亿次的这种练习,模型学习了细胞是如何构建以及如何行为的深层底层规则。

一旦训练完成,模型就会进入“冻结”状态。这意味着他们不需要为每一次新实验重新教导它。他们只需拿取一个新的细胞,将其转化为图像,然后询问模型:“这是哪种细胞?”而无需任何额外的训练。

为什么这很重要:零样本(Zero-Shot)的魔力

衡量一个基础模型的真正标准是它在从未见过的东西上的表现如何。研究人员在六个完全不同的数据集上测试了 scVision,这些数据集从未出现在其训练过程中。这些数据集包括来自肾脏、卵巢、大脑、肠道甚至是一个包含多种器官的复杂混合体中的细胞。

这就是奇迹发生的地方:

  • 它是高效的学习专家: 在人工智能领域,通常你需要数千个带标签的示例(比如向计算机展示 1000 张猫的照片并说“这是一只猫”)来教它一项新任务。scVision 则不同。在许多测试中,该模型仅凭一个带标签的示例就能识别出新的细胞类型。在一项实验中,sc,Vision 仅凭每个细胞类型一个示例的表现,就优于那些拥有 50 个示例的其他模型。这就像一个学生只需阅读课本的一页就能掌握新学科,而其他人却需要读完整个章节。
  • 它看到了大局: 当研究人员观察模型如何组织细胞时,他们发现 scVision 创建了最清晰、最明显的群体。其他模型有时会产生混淆,将相似的细胞类型混在一起,而 scVision 则能将它们清晰地分隔开,使区分变得更加容易。
  • 它非常快速: 由于它将细胞视为图像,scVision 的效率极高。它在标准计算机芯片上每秒可以处理 528 个细胞。相比之下,其他模型可能每秒只能处理 1 到 14 个细胞。这是短跑选手与蜗牛之间的区别。

阅读细胞的思想

scVision 最酷的特性之一是它不仅仅是一个给出答案的“黑箱”;它可以解释为什么它做出了某个决定。因为基因被排列成了图片,模型的“注意力”(即它关注的对象)可以映射回图像的特定区域。

研究人员发现,当模型观察特定类型的细胞时,它会聚焦于图像中的一个小局部区域。当他们将该区域映射回基因时,发现它对应着真实的生物程序。例如:

  • 在肾脏细胞中,模型关注的是与损伤和压力相关的基因。
  • 在卵巢细胞中,它突出了涉及压力反应的基因。
  • 在大脑细胞中,它找到了在健康大脑和患病大脑中都活跃的一组特定基因,表明模型学习到了一种跨器官通用的“免疫细胞”身份。

这表明 scVision 不仅仅是在记忆数据;它实际上是在学习基因如何协同工作的生物学“语法”。

它不是什么(以及它排除了什么)

论文谨慎地指出了该模型不是什么。

  • 它不仅仅是一个更好的分类器: 研究人员测试了模型的成功是否仅仅是因为使用了特定的数学方法来预测答案。他们尝试了许多不同的方法,而 scVision 依然胜出。这种优势来自于图像表示本身,而不仅仅是预测游戏。
  • 它并非万能药: 虽然 scVision 在识别细胞类型和寻找模式方面表现出色,但它确实存在局限性。例如,如果数据非常“嘈杂”(比如测序深度很浅),模型的性能下降会比其他模型稍明显。然而,它对缺失基因具有很强的鲁棒性,而这在现实世界的数据中是一个常见问题。
  • 它还不是终极解决方案: 该模型是在人类数据上训练的,因此我们尚不知道它在其他动物身上的表现如何。此外,虽然它可以发现模式,但它并不能取代科学家进行实验以证明这些模式含义的需求。

总结

这篇论文表明,我们如何表示生物学数据,与其模型的规模同样重要。通过将细胞的遗传密码转化为一张图片,并以尊重其自然关系的方式排列基因,研究人员创造了一个比以往方法更快、更准确且更容易理解的工具。

这是一种思维方式的转变:从将细胞视为一份成分清单,转变为将其视为一个复杂的、有组织的景观。正如一张好的地图能帮助你在新城市中穿行一样,scVision 帮助科学家在浩瀚、未知的领域中航行,寻找定义我们在细胞层面之上的隐藏街道和地标。作者们认为,这种“基于视觉”的方法可能是解锁下一代医学和生物学发现的关键,将压倒性的数据洪流转化为一幅清晰、美丽的图景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →