想象一下,你正在试图理解一个单细胞如何成长并分化为身体的特定部分,比如红细胞或胰腺细胞。
问题:“快照”的局限性
目前,科学家拥有强大的工具(称为“基础模型”),它们就像超级智能的百科全书。它们阅读了数百万本基因“书籍”,能够告诉你一个细胞此刻的样子。然而,这些工具大多只能提供静态快照。它们能告诉你“这是一个婴儿细胞”或“这是一个青少年细胞”,但难以预测细胞接下来会如何变化。
这就像翻看相册。你可以看到婴儿、幼儿和青少年的照片,但如果只有这些照片,就很难准确预测这个青少年成年后会是什么样子。你错过了他们到达那里的动态过程和故事。
新想法:“电影”方法
本文的作者提出了一种观察生物学的新方式。他们不再仅仅拍摄照片,而是想要制作一部电影。
他们通过以下方式实现:
- 创建时间线:他们收集一堆细胞,根据其基因活性,从“最年轻”到“最年长”进行排序。他们称之为“拟时序”。
- 绘制地图:在这个时间线的每一步,他们绘制基因之间如何相互交流的地图。这些被称为基因调控网络(GRNs)。想象一张地图,其中基因是城市,它们之间的线条是道路,显示谁在指挥谁。
- 观看电影:随着细胞发育,这些地图会发生变化。道路开通,道路关闭,新的城市变得重要。作者将这一系列变化的地图视为时序图(随时间移动的图)。
工具:“时间旅行建筑师”
为了预测这些细胞的未来,他们使用了一种特殊的人工智能,称为时序图神经网络。
想象一下,标准的人工智能就像一位只查看一张蓝图并猜测下一个房间的建筑师。而新的人工智能则像一位时间旅行建筑师,它观察了整个建筑从建造开始的历史。它看到了地基是如何打下的,墙壁是如何砌起的,以及管道是如何安装的。因为它理解了建造的过程,所以它能比只看单张蓝图的人更好地预测下一层楼的样子。
实验:测试电影
该团队在两个真实的生物“电影”上测试了这种方法:
- 小鼠红细胞发育:一个细胞如何变成红细胞。
- 小鼠胰腺发育:一个细胞如何成为胰岛素生成系统的一部分。
他们向人工智能提出了三个问题:
- 基因表达:“如果细胞现在正在做 X,接下来它会开启哪些基因?”
- 链接预测:“接下来哪些基因会开始相互‘交谈’?”(就像预测谁会成为下一个朋友)。
- 枢纽预测:“在下一阶段,哪些基因会成为最重要的‘老板’(枢纽)?”
结果:电影胜出
结果令人惊讶且充满希望:
- 击败百科全书:“电影”方法(时序图学习)的表现优于当前的“百科全书”冠军(scGPT 和 scFoundation)。这表明,了解基因相互作用的历史与了解基因本身同样重要。
- 最佳建筑师:一种名为GCRN-GRU的特定人工智能(结合了图数学和记忆机制)在预测未来方面表现最佳。它特别擅长识别控制细胞发育的“老板基因”。
- 真实生物学:当人工智能预测哪些基因会成为“老板”时,结果被证明是正确的。它正确识别了已知对制造血细胞至关重要的基因,证明该模型不仅仅是在猜测,而是在学习真实的生物学规律。
结论
本文认为,要真正理解生命如何发育,我们需要停止将细胞视为静态照片,而是开始将它们视为动态电影。通过使用能够理解关系如何随时间变化的人工智能,我们可以比以往任何时候都更准确地预测生物系统的未来。
注:作者指出这是一篇“进行中”的论文,意味着他们仍在完善这些想法,并计划在未来在更多数据集上进行测试。
技术摘要:时序图学习在预测生物系统动态中的应用
问题陈述
生物基础模型(如 scGPT、scFoundation、Geneformer)的最新进展已证明,利用 Transformer 架构从单细胞转录组数据中学习表征具有强大的性能。然而,这些方法主要在静态设置下运行,未能显式地建模发育程序的时序演化。这一局限性在发育生物学中至关重要,因为在该领域中,细胞状态不断涌现、分化并重组。虽然拟时序推断(pseudotime inference)和 RNA 速度(RNA velocity)等技术允许从异步单细胞数据中重建有序轨迹,但现有方法通常将细胞状态视为独立个体或建模为静态快照,忽视了支撑发育转变的演化调控结构(基因调控网络,即 GRNs)。核心挑战在于将发育生物系统表述为适用于时序图学习的演化图过程,从而实现对静态表征之外未来生物状态的预测。
方法论
作者提出了一条将单细胞转录组数据转化为离散时间时序图以应用时序图神经网络(TGNNs)的流程。方法论步骤如下:
- 轨迹推断与离散化:从单细胞基因表达矩阵出发,利用扩散拟时序(DPT)推断发育轨迹。随后,根据拟时序值将细胞聚合为时间分箱(快照)。分箱大小经过优化,以平衡时间分辨率与 GRN 推断所需的统计稳健性(通常每个快照目标为 300–500 个细胞)。
- 时序 GRN 构建:对于每个拟时序分箱,使用 SCENIC 推断基因调控网络(GRN)。该框架结合了基因共表达分析与转录因子基序富集,以识别具有生物学意义的调控相互作用。结果是一个离散时间时序图 G={G(1),…,G(T)},其中每个快照 G(t) 包含:
- 节点(V):随时间保持身份不变的基因。
- 边(E(t)):在时间 t 推断出的调控相互作用。
- 节点特征(X(t)):分箱内聚合的基因表达统计量(均值、中位数、方差等)。
- 边特征:来自 GRN 推断的置信度评分。
- 时序图学习:将 TGNNs 应用于该图序列,以学习时序节点表征,这些表征既能捕捉快照内的结构依赖性,也能捕捉快照间的时序动态。
- 预测任务:该框架在三个互补任务上进行了评估:
- 未来基因表达预测:预测连续快照之间平均基因表达的时序变化(Δx)。
- 未来链接预测:估计在下一个快照 G(t+1) 中存在的调控相互作用的概率。
- 未来出度中心性预测:预测基因在未来快照中的拓扑重要性(出度),以识别调控枢纽。
主要贡献与结果
该研究在两个公开可用的小鼠发育数据集(红细胞系原肠胚形成和胰腺内分泌发生)上评估了所提出的框架。结果突出了几个关键发现:
- 优于静态基础模型:在基因表达预测中,基于图的时序模型 consistently 优于成熟的生物基础模型(scGPT 和 scFoundation)。这表明,显式建模演化的调控结构提供了静态预训练表征本身无法捕捉的预测信息。
- 谱架构的有效性:谱图卷积架构,特别是 ChebNet 和 GCRN-GRU,在所有任务中表现最强。作者推测,这些架构特别适用于 GRN 的异质性和以枢纽为中心的拓扑结构,其中转录因子作为连接多个靶点的中心调节因子。谱卷积可能有效地在这些星状拓扑结构中跨多跳邻域传播信息。
- 链接预测中的时序动态:在链接预测方面,时序模型(特别是 GCRN-GRU)显著优于静态基线(GCN、GAT)和简单的记忆策略(EdgeBank)。这表明数据集包含超越简单边持久性的非平凡时序动态,而 TGNNs 成功捕捉到了这些动态。
- 枢纽预测的生物学相关性:该模型成功识别了时间上重要的调控枢纽。在红细胞系原肠胚形成数据集中,预测的中心性轨迹与已知的生物学程序一致:早期阶段由增殖调节因子(如 E2f8、Ran)主导,而后期阶段则显示出经典红细胞调节因子(如 Klf1、Spi1、Erg)的中心性增加。
意义与主张
该论文将时序图学习定位为当前单细胞生物学基础模型方法的一种有前景且互补的范式。作者主张:
- 动态的显式建模:将发育系统重构为演化图,允许对调控结构变化进行显式建模,这比静态表征学习具有独特的优势。
- 互补性:时序图学习并非要取代基础模型,而是为需要预测动态系统演化(如发育进程和疾病轨迹)的任务提供了一种必要的扩展。
- 可行性:尽管单细胞 RNA 测序具有破坏性(无法直接追踪单个细胞),但通过拟时序分箱进行时序图的计算重构,是将深度学习应用于动态生物系统的一种可行策略。
该工作被呈现为一项“进行中的工作”,作者指出计划在未来工作中将基准测试扩展到更多数据集、更新的基础模型以及更近期的基于时序注意力的架构(如 DyGFormer)。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。