CHACAM: a cell-cell interaction-guided hierarchical attention model for high-precision cell identity annotation of scRNA-seq data in early C. elegans embryogenesis
CHACAM 是一个监督式机器学习框架,它通过整合基因表达、配体-受体相互作用以及细胞接触图谱,利用细胞间相互作用特征来实现对早期秀丽隐杆线虫胚胎发育中模糊细胞身份的高精度注释。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
生命始于一个单细胞,一个包含整个生物体蓝图的微小球体。在发育的最早期阶段,这个细胞会不断分裂,形成一个快速增长的细胞簇。几十年来,科学家们一直知道,在微小的圆线虫(Caenorhabditis elegans)中,这一过程具有显著的可预测性。每一个圆线虫都遵循完全相同的路径:第一个细胞分裂,子细胞分裂,然后再次分裂,始终以相同的顺序进行,并始终到达相同的位置。由于这种完美的连贯性,生物学家长期以来一直将这种蠕虫作为理解单个细胞如何变成复杂动物的地图。然而,随着技术的进步,一个新的挑战出现了。科学家现在可以读取这些胚胎内单个细胞的遗传指令,即“转录组”。虽然这听起来是一个突破,但它揭示了一个令人困惑的问题:随着细胞的分裂,亲缘关系极近的姐妹细胞之间的遗传指令变得几乎完全相同。当科学家试图仅根据遗传代码来对这些细胞进行分类时,他们往往无法区分它们,从而被迫将不同的细胞归入模糊、模棱两可的类别中。
为了解决这个谜题,一个研究团队开发了一种新的方法,该方法不再仅仅关注细胞内部的遗传代码。他们意识到,细胞并非存在于真空中;它不断地与邻居接触并进行交流。在早期胚胎中,一个细胞的命运在很大程度上受其所接触的具体细胞发出的信号的影响。研究人员构建了一个名为 CHACAM 的计算机模型,该模型将细胞的遗传数据与详细的“谁在接触谁”的地图相结合。通过整合这种物理背景,该模型可以区分那些在遗传上看起来相同但处于不同邻里环境中的细胞。这种方法使他们能够创建一个清晰完美的早期蠕虫胚胎图谱,解决了多年来一直模糊不清的身份识别问题,并发现了定义每个独特细胞的新遗传标记。
问题的核心在于亲缘关系接近的细胞之间的相似性。在蠕虫发育的早期阶段,细胞分裂得如此迅速,以至于由同一个亲本产生的姐妹细胞具有几乎完全相同的遗传特征。传统的识别方法依赖于寻找起着“名牌”作用的特定基因,就像一个标签。然而,当遗传差异如此微小时,这些名牌不足以区分姐妹细胞。在以往的研究中,这种情况导致科学家只能用一个通用的名称来标记一组细胞,例如“ABalx”,承认他们知道这组细胞的存在,但无法确定其中具体是哪一个细胞。这种缺乏精确性的情况使得理解驱动发育的准确序列变得困难,因为研究人员实际上是在使用一张模糊的地图进行工作。
研究人员假设缺失的信息是物理环境。他们知道,根据数十年的观察,蠕虫胚胎中的特定细胞总是接触特定的邻居。例如,一个细胞可能会接触一个向其发送信号以成为肌肉细胞的邻居,而它的姐妹细胞——尽管在遗传上看起来完全一样——却接触另一个向其发送信号以成为神经细胞的邻居。新模型 CHACAM 正是基于这一知识设计的。它从一个已知的细胞间通信通道精选数据库开始,特别是允许一个细胞向另一个细胞发送信号的分子对。然后,它将此与一个高分辨率的四维胚胎图谱相结合,该图谱显示了在发育的每一分钟内哪些细胞正在相互接触。
该模型的工作原理是观察一个细胞并提出两个问题:它正在表达哪些基因?以及它正在接触谁?它将细胞的遗传特征与已知细胞类型的参考库进行比较。如果遗传特征具有模糊性,模型就会查看该细胞的邻居。它会计算一个分数,该分数基于该细胞与其邻居之间特定相互作用的可能性。例如,如果一个细胞正接触着一个已知会与特定细胞类型发生相互作用的邻居,模型就会推断该细胞很可能就是那种类型。研究人员使用了一种称为“三角测量”的策略来确认这些猜测。他们会挑选一个具有已知身份的参考细胞,并检查它与模糊细胞之间的相互作用。如果参考细胞已知会接触其中一个姐妹细胞而非另一个,且相互作用得分符合该模式,那么模糊细胞的身份就可以被高度自信地确定。
当团队将此方法应用于现有的 C. elegans 胚胎数据时,结果令人瞩目。在涵盖从一个细胞到十六个细胞阶段的数据集中,该模型成功解析了每一个细胞的身份。此前,在十六细胞阶段,有八个细胞被归为四个无法区分的孪生对。新方法分离了所有这些细胞,实现了百分之百的解析率。这意味着,科学家们首次拥有了一份完整的、无歧义的十六细胞胚胎每个细胞的遗传身份图谱。该模型在处理高达一百零二个细胞阶段的更大数据集时同样表现出色,即使在某些数据缺失的情况下,也能正确识别绝大多数细胞。
除了对细胞进行分类,该模型还提供了关于是什么让每个细胞变得独特的更深层次的理解。一旦细胞被正确识别,研究人员就可以寻找区分一个细胞与其孪生兄弟的特定基因。他们发现了一组新的标记基因,这些基因仅在其中一个姐妹细胞中活跃,而之前的研究只能发现适用于细胞组的标记。例如,他们发现了可以区分两个此前被归为一类的特定细胞的基因。这些新标记提供了更精细的细节,允许科学家观察每个个体细胞中运行的精确遗传程序。这种高分辨率图谱作为一个新的资源,用于理解细胞如何做出决策,提供了一份涉及每个步骤的基因清单。
这种方法的成功凸显了科学家看待细胞身份方式的一个根本转变。它证明了细胞的身份不仅由它携带的基因决定,还由其周围的物理和化学环境决定。通过将内部遗传数据与外部现实(即谁在接触谁)相结合,研究人员得以看穿困扰以往分析的噪声。该模型并不依赖于猜测或复杂的模拟;它利用蠕种发育中已知的、不变的规则来指导对遗传数据的解释。这种方法证明了,当细胞因其基因而难以区分时,胚胎的物理图谱才是解锁其真实身份的关键。
该研究方法的意义延伸到了蠕虫之外。虽然这项研究重点关注 C. elegans,是因为其具有完美的谱系图谱,但其逻辑适用于任何细胞难以区分的系统。在更复杂的生物体(如人类)中,细胞通常存在于拥挤的环境中,其邻居会影响它们的行为。如果科学家能够绘制出组织或肿瘤中细胞之间的物理接触,他们就可以使用类似的方法来分类那些在显微镜下看起来完全相同的细胞类型。研究人员指出,随着绘制细胞位置技术的改进,这种具备上下文感知能力的分析将变得越来越重要。这项研究作为一个概念验证,证明了将物理交互数据与遗传数据相结合可以揭示此前隐藏的生物学真相。
研究人员也承认了他们方法的局限性。该模型在很大程度上取决于接触图谱的准确性和细胞间信号数据库的完整性。如果“谁接触谁”的图谱是错误的,或者关键的信号通路在数据库中缺失,模型的运行效果可能会大打折扣。在蠕虫中,由于数十年的成像技术,接触图谱被极其精确地掌握,但在其他生物中,获取此类信息可能更为困难。此外,目前的模型将相互作用视为时间的静态快照,而不是追踪它们如何随着胚胎生长而变化。尽管存在这些局限性,该方法已经交付了一个完全解析的早期蠕虫胚胎图谱,这是一个此前无法触及的资源。这一成就为未来的研究奠定了坚实的基础,使科学家能够提出关于细胞如何交流以及它们如何决定自身命运的更精确的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。