← 最新论文
💻 computer science

CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification

CytoFormer 是一种新型细胞基础模型,它利用来自 16 个器官的配对 H&E 组织学和空间转录组学数据,在不依赖病理学家人工标注的情况下,实现了准确、高效且具有泛化能力的细胞分类。

原作者: Jialu Yao, Songhao Li, Alina Yu, Zhi Huang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jialu Yao, Songhao Li, Alina Yu, Zhi Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在医学领域,观察人体内部最常用的方法是通过显微镜观察用粉紫色染料染色的组织薄片。这是诊断癌症等疾病的标准护理手段。病理学家通过观察这些切片来识别存在的不同细胞类型——无论是健康的组织、入侵的免疫细胞,还是异常的肿瘤细胞。这种视觉检查功能强大,但也存在缓慢、主观且难以规模化的问题。靠肉眼计数数百万个单独的细胞是不可能的,甚至专家也可能在判断特定细胞时产生分歧,尤其是当不同类型的细胞在显微镜下看起来几乎完全一致时。几十年来,人们一直梦想着教会计算机自动进行这种计数,但构建此类计算机一直受困于一个瓶颈:它需要人类专家手动标记数百万个细胞,以教导机器该寻找什么。这种手工劳动枯燥、昂贵且往往不可靠,导致该领域缺乏足够高质量的数据来训练真正的智能系统。

宾夕法尼亚大学的一个研究小组找到了一种完全绕过这种人类瓶颈的方法。他们没有要求病理学家去标记细胞,而是使用了一种不同类型的生物图谱来教导计算机。他们将标准的粉紫色组织切片与一种被称为“空间转录组学”的新技术相结合,后者就像是一个分子条形码扫描仪。这个扫描仪可以在细胞仍位于组织中的位置时,读取其内部的遗传活性。由于遗传代码对细胞身份而言是唯一的,它能准确告诉研究人员正在观察的是哪种类型的细胞,而无需人类进行猜测。通过将这些分子身份与标准切片上对应的图像相匹配,该团队创建了一个大规模的自监督数据集。他们利用这一数据集训练了一个名为 CytoFormer 的新型人工智能模型,该模型学会了仅通过观察常规显微镜图像中细胞的形状和纹理来识别细胞类型。

结果表明,该系统的识别准确度足以媲美人类专家,且在训练过程中无需人类画出任何一个细胞的边界框。研究人员收集了涵盖人体 16 个不同器官(从乳腺、肺部到大脑和骨髓)的 81 种不同组织切片的数据。总计,他们处理了超过 1500 万个单独的细胞。对于每个细胞,计算机都学会了将染色图像中的视觉外观与遗传扫描仪提供的特定分子身份联系起来。这使得模型能够学习一种适用于全身的通用细胞形态语言。在对模型从未见过的全新组织切片进行测试时,它平均能在 85% 的案例中正确识别细胞类型。更重要的是,该模型不仅仅是在计数,它还重建了整个组织的架构,正确绘制出了肿瘤、免疫细胞和健康结构所在的位置,有效地还原了器官的生物学景观。

这项发现之所以特别重要,在于该模型向新情境迁移知识的能力之强。研究人员测试了该 AI 是否能够处理其训练过程中从未遇到过的器官和细胞类型。他们将模型应用于包含来自结肠和皮肤等器官细胞的四个不同的公开数据集,而这些器官并不在原始训练集中。即使在之前未见过这些特定组织的情况下,该模型的表现依然优于其他六个基于数百万张人工标记图像进行训练的领先人工智能系统。在细胞看起来非常相似的困难场景中(例如区分正常健康组织与模仿其特征的癌变组织),它的表现尤为出色。在一项测试中,该模型仅利用人类提供的几百个样本就学会了识别隐藏在看似相同的肿瘤细胞中的正常细胞,而其他系统则需要更多的样本才能达到同样的准确度。这表明该模型学习的是细胞在其环境中呈现形态的基本视觉规则,而不仅仅是死记硬背一份特定的细胞清单。

研究人员还探索了计算机需要观察多少周围组织才能做出正确的识别。他们测试了每个细胞周围不同大小的图像窗口,从仅显示细胞本身的微小视图到显示整个邻里环境的大视图。他们发现,当模型能够看到细胞及其直接邻居,但又不至于看到整个组织切片时,效果最好。这种平衡使得计算机既能理解细胞的上下文环境——即它位于血管、肿瘤块还是健康的腺体中——又不会丢失细胞自身形状的精细细节。这种特定的窗口大小(对应于一个非常小但清晰的细胞视图)被证明是准确性的最佳平衡点。

通过将遗传扫描仪的分子数据转化为视觉识别的教学工具,该团队创造了一个可以应用于任何常规组织切片的重复使用资源。该模型不需要运行昂贵的新设备;它可以分析医院每天都在使用的标准切片。研究人员已向科学界开放了代码和训练好的模型,允许他人使用这种新的细胞观察方式。虽然目前的模型会将一些非常相似的细胞(如不同类型的免疫细胞)归为一类,因为它们看起来很像,但这代表了一个重大进步。它证明了我们可以在不依赖缓慢且昂贵的人工标记过程的情况下,构建强大的细胞分析工具。这种方法为分析数千名患者的数百万个细胞打开了大门,将常规的显微镜切片转化为详细的细胞活动图谱,从而帮助医生更早、更准确地诊断疾病。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →