← 最新论文
🤖 machine learning

DeMixPert: Decomposed Response Modeling with Gaussian Mixtures for OOD Single-Cell Perturbation Prediction

DeMixPert 是一个新颖的框架,它通过将转录组响应分解为基底依赖的系统性偏移、扰动特异性信号以及通过自适应高斯混合模型建模的群体水平变异,从而改进了分布外单细胞扰动预测,进而有效地捕捉了细胞对未见遗传扰动的异质性反应。

原作者: Jiawen Liu, Xuechenxiao Cao, Yutong Li, Bing Liu, Jiaming Liang, Tinghe Zhang, Xiaoqi Sheng, Hongmin Cai

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiawen Liu, Xuechenxiao Cao, Yutong Li, Bing Liu, Jiaming Liang, Tinghe Zhang, Xiaoqi Sheng, Hongmin Cai

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在生物体微观世界的细胞中,每一个细胞都是一座繁忙的化学反应之城,不断地阅读并重写自身的指令手册,以适应周围环境。当科学家想要了解细胞如何对特定变化做出反应——例如某个基因被关闭或引入某种药物时——他们可以进行遗传扰动实验。这是一种受控实验,研究人员通过微调单个基因,观察细胞的整个遗传活动如何随之发生转变。然而,由于可能的基因、细胞类型和环境条件的组合数量极其庞大,在实验室中测试所有可能性是不可能的。计算机科学家的挑战在于构建一个能够准确预测这些未见反应的模型,不仅是靠猜测平均结果,而是要捕捉不同细胞反应的完整多样性。

多年来,试图预测这些细胞反应的计算机模型一直面临着一个根本性的问题:它们往往模糊了不同类型生物学变化之间的界限。想象一下,当你试图在整个乐队大声演奏时,去聆听其中一种特定的乐器;那件乐器的独特声音会淹没在整体的噪音中。同样地,现有的模型经常将几乎在每个细胞中都会发生的、可预测的共同变化,与由特定基因微调引起的独特且具体的变化,以及个体细胞之间自然发生的随机变异混为一谈。这种纠缠使得模型很难看清一种新的、未见的遗传变化所带来的真实影响,尤其是在模型从未见过该特定变化的情况下。

为了解决这个问题,华南理工大学的刘嘉文及其同事开发了一种名为 DeMixPert 的新方法。DeMixPert 并没有试图将整个细胞反应视为一个巨大的、混乱的整体进行预测,而是将问题分解为三个截然不同的部分。首先,它识别“系统性”响应,即无论针对哪个特定基因,都会根据细胞的初始状态而发生的预测性偏移。其次,它分离出“扰动特异性”响应,即由特定遗传变化本身留下的独特指纹。最后,它考虑了“群体水平的变异”,这代表了导致某些细胞与邻近细胞反应略有不同的个体细胞之间自然的、随机的差异。通过分离这三个层面,模型可以独立学习每一层的规则,然后将它们重新组合,从而做出更清晰的预测。

这个新系统的核心在于处理细胞间随机变异的一种巧妙方式。研究人员并未将这些变异视为随机噪声,而是将其视为一组独特的模式或“原型”(prototypes),这些原型可以根据情况以不同的方式进行混合。他们使用一种数学结构,使模型能够观察一个细胞的初始状态和特定的遗传变化,然后决定如何混合这些预先学习到的模式,以创造出该特定细胞行为的现实预测。这使得模型能够生成反映真实细胞群体多样性的广泛可能结果,而不是仅仅预测一个单一、平庸的平均值。

当团队利用来自四个大型遗传实验的数据,使用该方法与现有工具进行对比测试时,结果令人瞩目。在模型必须预测从未见过的遗传变化所产生的反应时,DeMixPert 始终表现优于竞争对手。它在识别哪些基因会被开启或关闭方面表现尤为出色,在一个数据集中实现了 22.000 的共同差异表达基因(C-DEGs)得分,相比之下,其他方法的得分仅为个位数。更重要的是,它不仅能让平均值趋于正确,还能成功重现真实实验中看到的复杂且多样化的响应分布。虽然其他模型生成的预测看起来在平均水平上是正确的,却无法捕捉到个体细胞行为的多样性,而 DeMixPert 则保持了整个群体的保真度。

这项研究还清晰地展示了为什么这种组件分离的方法如此有效。当研究人员对数据进行可视化处理时,他们发现,移除预测中的“系统性”部分后,不同遗传变化的独特特征变得更加清晰且易于区分。这证实了之前的模型确实让细胞初始状态的背景噪声掩盖了遗传变化的特定信号。通过在预测前明确地剥离这种背景噪声,新模型可以专注于真正重要的内容。研究结果表明,如果计算机模型想要真正理解细胞是如何运作的,它们必须停止将所有变化视为单一事件,并开始识别驱动它们的不同生物学层面。这种方法提供了一种更精确的模拟细胞行为的方式,最终可能通过预测细胞对治疗的反应,帮助研究人员设计出更好的疗法,而无需在实验室中测试每一种可能性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →