← 最新论文
🧬 biology

Benchmarking cell type annotation in spatial transcriptomics: resolving cellular hierarchies, biological fidelity, and dynamic cell states

本研究对 20 种最先进的细胞类型注释方法在多种空间转录组学技术和生物学背景下进行了全面的基准测试,结果表明,尽管 scANVI、Seurat 和 TACCO 等工具整体表现良好,但准确的细粒度和动态状态注释仍然具有挑战性且高度依赖于上下文,这凸显了未来方法需要更好地处理开集识别、空间整合以及稀有细胞群体。

原作者: Xin Maizie Zhou, Yuling Zhu, Yunfei Hu, Manfei Xie, Haoran Qin, Zuzanna Szul, Derek Young, Weiman Yuan, Qimeng Wang, Yichen Liu, Shan Meltzer

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Xin Maizie Zhou, Yuling Zhu, Yunfei Hu, Manfei Xie, Haoran Qin, Zuzanna Szul, Derek Young, Weiman Yuan, Qimeng Wang, Yichen Liu, Shan Meltzer

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一座每座建筑都藏着秘密的城市,而理解这个社区的唯一方法是阅读每个房间里的蓝图。几十年来,科学家只能通过拆解建筑、将所有房间混合在一起,并试图猜测哪面墙属于哪个公寓来阅读这些蓝图。这就像是通过研磨落叶来研究森林,并试图弄清楚它们分别来自哪棵树。但一种被称为空间转录组学(spatial transcriptomics)的新技术改变了一切。它允许研究人员在细胞仍处于活体组织精确位置时,读取其内部的遗传指令。这不仅揭示了存在哪些细胞,还揭示了它们的排列方式、谁是它们的邻居,以及它们如何相互作用以构建复杂的器官。然而,阅读这些遗传蓝图仅仅是第一步。为了理解数据,科学家必须识别他们正在观察的是哪种类型的细胞——无论是神经元、肌肉细胞,还是某种特定的免疫战士。这一过程被称为细胞类型注释(cell type annotation),它是解锁组织中隐藏故事的关键钥匙。

范德堡大学的一个研究小组最近致力于解决如何最好地进行这种识别这一难题。他们收集了二十种旨在为空间数据中的细胞进行标记的计算机程序,并对它们进行了严格的测试。目标不仅是看哪个程序最快或最受欢迎,而是要找出哪一个真正讲述了组织的生物学真相。他们在四种截然不同的生物景观上测试了这些工具:小鼠的脊髓、受癌症影响的人类淋巴结、正在从损伤中恢复的小鼠肾脏,以及发育中的蠑螈大脑。在每种情况下,研究人员都有由专家利用深厚的生物学知识手动识别细胞所创建的“金标准”答案表。这使得他们能够精确测量每个计算机程序与现实的匹配程度。

结果显示,并没有一个适用于所有工作的“最佳”工具。正如锤子非常适合钉钉子但并不适合拧螺丝一样,不同的计算机程序在不同的情况下各擅胜场。有些工具在组织稳定且细胞类型清晰的情况下表现得异常出色,例如发育过程中的正常状态下的蠑螈大脑。另一些工具在细胞快速变化时则显得力不从心,例如在受伤肾脏剧烈的修复过程中。研究发现,虽然有些程序可以正确识别宽泛的细胞类别,但它们往往无法区分非常相似的亚型。例如,一个程序可能会正确地将一个细胞识别为某种类型的神经元,但却无法分辨它是否是负责特定功能的特定亚型。这是一个至关重要的区别,因为在生物学中,两种紧密相关的细胞类型之间的差异可能意味着健康与疾病之间的界限。

其中一个最令人惊讶的发现是,获得正确的标签并不总是意味着计算机理解了生物学。一些程序在标准的准确性测试中获得了高分,但产生的结果在生物学上却毫无意义。它们可能正确地将一个细胞标记为“肌肉细胞”,但将其放置在肌肉细胞并不存在的区域,或者它们可能会将本应分离的细胞归为一类。研究人员发现,最好的工具是那些能够保留组织自然组织结构、让相关细胞聚集在一起并尊重不同区域边界的工具。他们还发现,那些经过海量遗传数据训练的、更复杂的新型人工智能模型,并不一定会比旧的、更简单的模型表现得更好。事实上,在某些情况下,较简单的工具反而更可靠,这表明原始的计算能力并非是通往准确性的唯一路径。

该研究还强调了一个主要挑战:当一个细胞不符合任何已知类别时,会发生什么?在发育中的蠑螈大脑中,出现了不在用于训练程序的参考数据中的新细胞类型。大多数计算机工具只是简单地将这些新细胞强行归入最接近的现有类别中,从而有效地误标了它们。这就像是试图把一种新型水果分到苹果和橙子的篮子里;计算机可能会因为它圆而称其为苹果,尽管它完全是另一种东西。研究人员得出结论,未来的工具需要具备识别它们正在遇到新事物的能力,而不是将每个细胞都强行塞进预定义的框框里。

最终,这项工作为在复杂的空间生物学领域航行的科学家们提供了一份实用的指南。它表明,工具的选择很大程度上取决于所提出的具体问题以及所研究组织的性质。如果研究人员观察的是具有已知细胞类型的稳定器官,那么一套工具是最好的。如果他们研究的是细胞不断变化的伤口愈合或发育中的胚胎,则需要另一种方法。这项研究并未提供一个能解决所有问题的“万灵药”,但它提供了一张清晰的地形图。通过了解每种方法的优缺点,科学家们可以为自己的特定实验选择合适的工具,从而确保他们讲述的关于人体内细胞的故事是尽可能准确且真实的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →