Neighbor-Contrastive Heterogeneous Graph Learning for Spatially Coherent Representation of Single-Cell Data
本文提出了一种邻域对比异质图学习方法,该方法通过用空间邻接正样本取代标准的实例判别,在不牺牲紧凑性或轮廓系数的情况下,显著增强了单细胞表示的空间相干性和莫兰指数(Moran's I),并降低了计算成本。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在人体内,组织并非细胞的随机堆积,而是高度组织的“邻里社区”。正如城市拥有不同的区域——繁华的市场、安静的公园、密集的住宅区——组织也包含着特定的细胞群共同生活和工作的连续区域。近年来,科学家们开发出了强大的显微镜,能够一次捕捉数十万个独立细胞的快照,不仅记录下每个细胞正在使用哪些基因,还精确记录了它们在组织中的具体位置。这项技术开启了生物学的一个新前沿:在微观尺度上绘制生命架构图的能力。然而,要将这些庞大的地图转化为有意义的见解,需要一种方法将细胞归类到正确的“邻里”中。挑战在于,同类型的细胞根据其所在位置的不同,看起来可能大相径庭;而不同类型的细胞也经常并排生活在同一个功能区内。为了解决这个问题,研究人员使用计算机模型将组织视为一个网络,其中相邻细胞之间的连接有助于定义一个区域。
一位研究人员最近解决了一个关于这些计算机模型如何学习识别组织邻里的基本问题。多年来,训练这些模型的标准方法借鉴了人类识别面孔的逻辑:计算机被展示两张略有不同的同一物体的照片,并被告知它们是相同的,同时被告知房间里的其他物体都是不同的。这种方法迫使计算机将每一个细胞都视为独特的个体,推动它将每一个细胞从其他所有细胞中分离出来。虽然这种方法在识别特定细胞类型方面效果很好,但在目标是寻找细胞共同生活的更大规模“邻里”时却失效了。在组织中,物理上相互接触的细胞理应属于同一个组,但标准的训练方法却在积极地教导计算机将它们拉开。
为了弥补这种不匹配,中国民用航空大学的研究员赵政(Zheng Zhao)提出了一个简单但激进的改变,用于优化计算机的学习方式。他不再将每个细胞视为其自身的独特类别,而是通过新方法教导计算机,物理上相互接触的细胞应该被视为一组“正对”(positive pair),或者说是一次匹配。该模型是在一个包含来自人类结肠组织九个不同部分的近45.9万个细胞的大型数据集上进行训练的,涵盖了健康样本以及来自炎症性肠病患者的样本。研究人员构建了一个复杂的地图,根据物理接近程度将细胞连接起来,创建了一个拥有超过260万个连接的网络。随后,他训练了一个神经网络(一种旨在处理这些连接的人工智能),让它在内部记忆中将相互接触的细胞的表征拉近,而不是推开。
这一改变的结果是惊人的。当研究人员将新模型与现有的最强方法进行对比测试时,新方法产生了一个清晰得多的组织结构图像。一个衡量模型捕捉组织自然流向能力的标准指标显著提升,从0.633上升到了0.756。另一个衡量同一邻里中的细胞被一致分组程度的指标从0.765跳升至0.862。这些改进是在仅使用之前最佳方法一半的计算时间和一半内存的情况下实现的。该模型成功识别了组织样本中的十个不同区域。其中一些区域由特定细胞类型主导,例如几乎完全由上皮细胞组成的领地;而另一些则是不同细胞类型的复杂混合体,仅出现在特定的疾病状态中,例如仅在克罗恩病或溃疡性结肠炎中发现的特定区域。
这项研究还揭示了一些关于如何评估这些模型以及应该避免什么的惊人真相。研究人员测试了添加一个要求计算机从损坏版本中重建原始细胞数据的特征是否会有所帮助,这是该领域的一种常见做法。他们发现结果恰恰相反:添加这种重建任务实际上降低了模型识别邻里的能力,使其在所有衡量的指标上表现都变差了。此外,研究强调了科学家在判断这些地图质量时存在的一个缺陷。一种常见的指标,即衡量识别出的区域有多紧凑,被发现具有高度的不稳定性。当研究人员使用不同的随机起点运行完全相同的模型时,该指标的分数发生了剧烈波动,变化幅度达到了2.4倍。这意味着单次测试运行不能被用来公平地比较不同方法,因为结果可能更多取决于随机起点而非模型本身的质量。
另一个关键发现涉及科学家如何测试细胞类型之间的相互作用。一种常用的统计工具假设,如果两种细胞类型没有相互作用,它们的排列应该看起来像是跨越整个组织的标签随机洗牌的结果。研究人员指出,对于细胞自然聚集的组织,这一假设是有缺陷的。当他们应用这种标准测试时,该测试错误地表明巨噬细胞和成纤维细胞在刻意避开彼此。然而,当他们使用一种尊重局部邻里结构的更严谨的测试时,这个假警报消失了,显示出这些细胞正以预期的速率进行相互作用。这一发现警告研究人员,如果不考虑组织中细胞的自然聚集特性,标准工具可能会得出关于细胞行为的误导性结论。
最终,这项工作证明了计算机如何被教导学习与它所看到的数据同样重要。通过简单地将“匹配”的定义从“同一个细胞”改为“接触的邻居”,研究人员使模型能够将组织视为一系列连贯的邻里,而非一系列孤立的个体。该模型不仅表现得更好,还产生了一种不同类型的地图,一种反映了组织组织生物学现实的地图。虽然该研究局限于结肠组织,且并未与所有现有方法进行对比,但它为分析空间数据提供了一条清晰的前行路径。它表明,对于涉及发现组织区域的任务,目标应该是保持空间的连续性,并且用于衡量成功的工具必须足够稳健,以处理聚类算法固有的变异性。该方法的代码现已向其他科学家开放,为绘制人体复杂邻里提供了更高效、更准确的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。