← 最新论文
🧬 biology

Simulation and inference methods for non-Markovian stochastic biochemical reaction networks

本文通过将下一反应算法和 τ\tau-leaping 算法推广以处理任意事件间隔分布,并引入一种能够通过多层蒙特卡洛和多保真度方法实现显著计算增益的耦合方案,为非马尔可夫生化反应网络开发了高效的随机模拟与推断方法。

原作者: Thomas P. Steele, David J. Warne

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas P. Steele, David J. Warne

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

细胞内部是一个混乱、嘈杂的地方。分子在不断的随机风暴中碰撞、反应并发生转化。几十年来,科学家们一直使用数学模型来理解这种混沌,将这些分子相互作用视为一系列瞬时的跳跃。在这些传统的模型中,一旦反应开始,它就会立即完成,系统仅根据当前所处的位置向前推进,而忘记了之前发生的一切。这种被称为马尔可夫过程(Markovian process)的方法在理解许多生物系统方面非常有用。然而,它无法捕捉像基因转录这样复杂过程的现实,在转录过程中,从 DNA 指令到生成最终蛋白质的过程需要一段可衡量的时长。在这些情况下,反应的历史至关重要;系统会“记住”它在某项任务上已经投入了多久,而这种记忆会改变任务完成的可能性。

当科学家试图模拟这些“非马尔可夫”系统(即时间和历史起关键作用的系统)时,数学变得异常困难。用于模拟这些网络的标准工具运行速度过慢,难以投入实际应用,而且从实验数据中推断出系统的隐藏规则也几乎变得不可能。这为试图理解从细胞分化到疾病传播等现象的研究人员制造了瓶颈。昆士兰科技大学的一个研究小组现在开发了一套新工具来打破这一障碍。他们创建了更快速的方法来模拟这些复杂的、依赖记忆的系统,并开发了一种巧妙的方法,能够比以前更高效地推测这些模型的隐藏参数。

问题的核心在于生物反应是如何计时的。在一个简单的模型中,反应发生在条件成熟的那一刻。但在现实世界中,像基因转录成信使 RNA 这样的反应涉及一系列需要时间的步骤。研究人员意识到,为了准确建模,他们必须将反应视为一个具有起点和终点的过程,其中两者之间的时间间隔不是固定的,而是取决于细胞的当前状态以及该过程已经运行了多久。为了处理这个问题,他们改进了一种经典的模拟技术,称为“下一反应法”(next reaction method)。这种方法通常追踪系统中下一个化学事件何时发生。研究人员对其进行了修改,使其能够追踪每一个正在进行的反应,记录下每个反应的开始时间和已运行的时长。这使得计算机能够精确计算出延迟反应何时完成,即使完成过程的规则会随着细胞的变化而改变。

虽然这种精确方法很准确,但由于它必须单独计算每一个反应的每一个步骤,因此仍然非常缓慢。为了提高速度,该团队开发了第二种近似方法。这种方法是“τ\tau-跳跃”(tau-leaping)技术的延伸,它通过观察系统在微小时间段内的表现,而不是逐个瞬间进行观察。它不再追踪每一个分子的碰撞,而是估算在那个短时间窗口内会发生多少次反应。这种近似法速度极快,但也引入了少量的误差。突破点在于研究人员找到了将这两种方法联系起来的方法。他们创建了一个“耦合方案”(coupling scheme),一种让慢速、精确的模拟与快速、近似的模拟并排运行,并使用相同的随机事件的方法。因为它们运行在相同的随机路径上,所以快速模拟中的误差与精确模拟高度相关。这种相关性是实现高效的关键。

通过利用这种联系,研究人员可以应用一种强大的统计技巧,称为“多层级蒙特卡洛法”(multilevel Monte Carlo)。他们不再需要运行数百万次昂贵的精确模拟来获得精确答案,而是运行少量的精确模拟和大量的廉价近似模拟。快速模拟提供了大部分数据,而慢速模拟则提供了一个消除偏差的修正项。这使得他们能以极小的计算成本获得慢速方法的精度。他们在两个截然不同的生物场景中测试了这种方法。第一个是基因调节网络,其中一种蛋白质会抑制自身的产生,这一过程自然地产生了振荡或节律。第二个是疾病传播模型,其中感染者康复所需的时间不是固定的,而是遵循特定的分布。在这两种情况下,他们的新方法产生的结果都与精确的慢速模拟相匹配,但速度要快得多。

这项工作的真正威力体现在尝试从真实数据中推断系统的隐藏规则时。在生物学中,科学家通常拥有在特定时间点存在的分子数量的测量值,但他们并不了解反应发生的精确速率。为了找到这些速率,他们通常必须运行成千上万次模拟,以观察哪组规则产生的实验数据看起来最接近真实世界。这在计算上是非常耗时的。研究人员将他们这种耦合模拟方法应用于这一问题,使用了名为“多保真度近似贝叶斯计算”(multifidelity approximate Bayesian computation)的技术。他们将自己的方法与标准的、缓慢的方法进行了对比。结果令人震惊。他们的新方法在估计隐藏参数方面达到了与标准方法相同的准确度,但其计算时间减少了约五倍。在某些对比中,提速效果更为显著,达到了一个数量级的提升。

研究人员证明,他们的方法不仅适用于简单的模型,也适用于那些反应时间取决于系统状态和流逝时间的复杂系统。他们表明,通过仔细管理快速模拟与慢速模拟之间的关系,可以大幅缩减理解这些系统所需的时间。这为将这些详细、真实的模型应用于更大、更复杂的问题打开了大门,例如模拟整个细胞,或者在具有更现实康复时间的情况下模拟流行病的传播。这项工作并不声称解决了生物建模中的所有问题,但它提供了一个稳健且高效的基础。它证明了通过以聪明的方式结合精确方法与近似方法,科学家现在可以模拟并理解作为生命基础的、依赖历史的非马尔可夫过程,而不受计算能力的限制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →