A Prior-Regularized Framework for Knowledge-Guided Differentiable Causal Discovery
本文提出了一种通用先验正则化框架,该框架将精选的生物学知识整合到可微因果发现算法中,通过利用现有的领域先验,在基准方法难以处理的高维、小样本转录组数据中,显著提高了图恢复的准确性,从而稳定了学习过程。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在活细胞那庞大而寂静的机械结构中,数以千计的基因在复杂的因果网络中相互作用。有些基因充当开关,开启或关闭其他基因,而另一些则充当刹车或加速器。科学家们长期以来一直试图绘制这些隐形的连接图谱,希望能理解一个健康的细胞是如何运作的,以及它在癌症等疾病中是如何出错的。几十年来,研究人员一直试图仅利用他们可以测量的数据——即组织样本中的基因活性水平——来重建这些图谱。然而,这种方法面临着一个棘手的难题。当科学家试图通过观察“玩家”来弄清游戏的规则时,他们往往会迷失在噪声之中,尤其是在基因数量巨大但样本数量很少的情况下。这就像是试图通过仅观察一个主要路口几分钟的时间,来理解一座大城市的整个交通系统;其中的模式过于微弱,难以清晰辨识。
为了解决这个问题,研究人员开发了强大的计算机方法,利用数学来推测这些基因网络的结构。这些方法令人印象深刻,但它们有一个盲点:它们将基因之间所有可能的连接都视为完全的未知,忽略了数十年来已经证实了许多这些联系的生物学研究。高帅东(Shuaidong Gao)的一项新研究提出了一种修复方法。该研究者构建了一个框架,允许这些计算机方法在开始进行推测之前先“阅读”现有的生物学知识。通过向计算机输入一份已知的关系列表——就像一份经过证实的交通规则参考表——该方法可以集中精力寻找新的、未知的连接,而不是浪费时间去重新发现旧的连接。
这项工作的核心是一个简单而强大的理念:将来自细胞的原始数据与科学家已知的知识库相结合。研究人员采用了一种旨在寻找因果关系的流行计算机算法,并为其添加了一层新的引导。该算法不再是从白纸开始,而是被赋予了一张“先验”图谱。这张图谱构建自两个巨大的、经过整理的数据库,其中记录了数以千计经实验验证的基因与蛋白质之间的相互作用。其中一个数据库侧重于转录因子(细胞的主开关)如何控制其目标;另一个则侧重于蛋白质如何进行物理相互作用。随后,计算机被指示将这些已知的连接视为高度可能的,但仍允许数据在证据足够充分时覆盖这些连接。
该方法的测试通过两种方式进行。首先,研究人员在计算机上创建了数千个模拟基因网络,其中真实的连接是已知的。在这些测试中,使用先验知识的方法始终优于标准方法。这种改进在最困难的情景下最为显著:即网络较小且数据稀缺时。在一次针对三十个基因且数据有限的具体测试中,标准方法的表现仅仅略好于随机猜测,而新方法则几乎使准确率翻了一番。计算机被允许使用的已知连接越多,其表现就越好,这表明该方法在拥有坚实现有知识基础时效果最佳。
研究人员还在来自三十三种不同类型人类癌症的真实数据上测试了该方法。在这里,结果则更为微妙。该方法成功识别了已知的生物学枢纽,例如 TP53 基因,它是癌症中的关键调节因子,并与数百个其他基因相连。当计算机使用先验知识时,它找到了更多具有生物学意义的连接,将基因与细胞分裂和 DNA 修复等过程联系起来。然而,与标准方法相比,该方法在真实世界数据中的统计提升并不如在模拟实验中那样显著。研究人员指出,这可能是因为真实的生物学数据比干净的模拟数据要嘈杂且复杂得多。已知的数据库虽然庞大,但仍然是不完整的,仅涵盖了癌症细胞中真实相互作用的一小部分。
尽管面临挑战,这项研究展示了一条清晰的前行之路。该方法证明,可以在不强迫计算机忽略数据的情况下,用人类知识来引导强大的计算机算法。研究人员发现,该方法适用于不同的算法,而不仅仅是所测试的那一个,并且它足够灵活,可以使用任何关系数据库。研究结论认为,该框架的最大价值在于“小数据”领域,即传统方法失效的地方。通过让计算机站在数十年生物学研究的肩膀上,科学家现在可以处理那些此前几乎毫无成功的希望的基因网络绘图问题。这项工作并不声称已经解开了基因调控之谜,但它提供了一个强大的工具,改变了研究人员处理该问题的方式,将对模式的搜索转变为对原因的搜索。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。