← 最新论文
🧬 biology

Beyond Gene Reconstruction: Learning Cell Representations through Complementary Transcriptomic Views

本文提出了一种用于单细胞转录组学的创新对比预训练框架,该框架通过构建由共表达引导的基因划分、表达感知型难负样本构建以及能力门控对比起始所组成的互补视图,学习鲁棒的全细胞表示,从而在细胞类型注释和基因调控网络推断等下游任务中优于传统的基因重构方法。

原作者: Jiaqi Xiong, Yuntao hu, Yu Zheng, Yifei Shi, Xinyue Guo, Jiaxin Qi

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaqi Xiong, Yuntao hu, Yu Zheng, Yifei Shi, Xinyue Guo, Jiaxin Qi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图了解一座规模宏大、繁忙喧嚣的城市。你拥有一座巨大的图书馆,里面存有数百万张手写的微型便签,每张便签都记录着某家特定餐厅正在烹饪的一道菜肴的配料。在生物学的世界里,这些“便签”就是单细胞转录组数据,而“配料”则是基因。科学家们一直在构建超级聪明的 AI 模型来阅读这些便签,希望能借此了解这个“城市”(即身体)是如何运作的。

长期以来,训练这些 AI 模型最好的方法是一种“填空游戏”。计算机会在页面上隐藏几个单词(基因),并要求 AI 根据周围的文本猜出它们是什么。这被称为“掩码重建”(masked reconstruction)。这种方法非常擅长教 AI 学习哪些配料通常会出现在一起——比如面粉和糖通常都会出现在蛋糕里。然而,这里有一个陷阱:仅仅因为 AI 擅长猜测缺失的配料,并不意味着它真正理解了整个餐厅或整个城市的氛围。它可能知道做蛋糕的配方,但却无法识别出这家餐厅其实是一家面包店,而不是一家披萨店。要真正理解一个细胞,AI 需要掌握该特定细胞的“全貌”,而不仅仅是单个基因之间的关系。

正是在这里,一项新研究提出了一个新鲜的想法。由 Xiong Jiaqi 和 Qi Jiaxin 领导的研究人员意识到,旧的“填空”游戏不足以教会 AI 如何识别一个完整的细胞。他们提出了一种新的训练方法,称为 CoCoS(其全称是一个听起来很高级的说法:“共表达引导的对比起始”,Co-expression-Guided Contrastive Onset)。你可以把它想象成:不是通过观察一个人的喜好颜色,而是通过同时观察两张互补的照片来教 AI 识别一个人。

CoCoS 的工作原理可以用一个简单的类比来解释:想象你有一个细胞拼图,但它不是一张大图,而是被拆分成了两个独立的盒子。一个盒子装有“奇数编号”的碎片,另一个盒子装有“偶数编号”的碎片。这些就是你的两个“视角”。AI 会观察这两个盒子,并学习尽管它们包含不同的碎片,但它们都属于同一个拼图(同一个细胞)。这有助于 AI 将细胞作为一个整体单位来理解。

但研究人员必须避开两个棘手的陷阱。首先,如果你只是随机打乱碎片,你可能会不小心创造出一幅完全不同细胞的图像。为了解决这个问题,CoCoS 使用“共表达引导”来拆分基因。它将自然协同工作的基因(就像总是出现在同一份食谱中的配料一样)进行分组,并确保它们以保持生物学故事完整的方式被分配到两个盒子中。

其次,AI 有点喜欢“抄近路”。如果给它看细胞 A 的图片和细胞 B 的图片,AI 可能会仅仅通过观察存在的基因类型(例如,“细胞 A 有基因 X,细胞 B 没有”)来区分它们,而没有真正学习这些基因在“做什么”。为了阻止这种投机取巧的行为,CoCoS 创建了“硬负样本”(hard negatives)。它提取与细胞 A 完全相同的基因列表,但打乱了它们的数值(即每个基因的数量)。现在,AI 不能只看基因名称;它必须关注具体的数值,才能意识到:“嘿,这仍然是细胞 A,但配方被搞乱了!”这迫使 AI 去学习基因与其活动水平之间的真实关系。

最后,研究人员意识到,你不能立即开始这种“全细胞”训练。AI 需要先学习基因关系的基础知识。因此,他们添加了一个“能力门槛”(competence gate)。AI 会先独自进行一段时间的“填空”游戏。只有当一个特殊的“哨兵”(一组 AI 未曾见过的测试细胞)显示出 AI 已经能够很好地重建基因时,系统才会切换开关,开始“全细胞”对比训练。这就像教练在教学生写文章之前,会等待学生先掌握字母表一样。

这项新方法的实验结果令人振奋。在识别不同类型细胞的任务(例如分辨肌肉细胞和神经细胞)中,经过 CoCoS 训练的模型表现得比以往顶尖的模型更出色。它们也更擅长预测基因如何相互调节,这对于理解疾病至关重要。虽然研究人员指出,“胜者”会因测试的网络不同而有所变化,但其整体平均性能在所有对比的方法中是最高的。

简而言之,这篇论文表明,通过将细胞的视角拆分为互补的部分,迫使 AI 关注基因数值而非仅仅是基因名称,并等待合适的时机开始训练,我们可以构建出真正理解细胞“全貌”而非仅仅是其组成部分的 AI 模型。这是我们在数字化的生物学理解上迈出的、向着更完整、更准确迈进的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →