G-Mamba: A Mechanism-Guided Graph State Space Network for Multi-Objective Prediction in Tyrosine Fermentation Process
本文提出了一种名为 G-Mamba 的灰盒多目标预测网络,该网络将机理知识与双向 Mamba 架构及图卷积网络相结合,通过有效捕捉长序列时间动态和复杂的空间耦合,实现了对酪氨酸发酵过程中生物量和产物浓度的实时、高效计算且准确的预测。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在广阔且轰鸣着的工业生物制造世界中,工厂生产的不是塑料或钢铁,而是培育生命。在巨大的不锈钢罐内,细菌等微观生物被诱导产生有价值的物质,从救命药物到食品和化学品中必不可少的氨基酸。这些作业的成功完全取决于让这些微观居民保持在完美的平衡状态。如果环境发生哪怕极其轻微的变化——变得过热、过酸或缺乏氧气——这些微小的“工人”可能会停止生产,或者更糟,成批死亡。为了管理这一过程,工程师们依赖于持续不断的数据流。一些测量值(如温度或空气流量)由传感器即时采集。而另一些测量值(如最终产品的浓度或细胞生长数量)则需要提取物理样本并送往实验室进行化学分析。这种通常持续数小时的延迟,造成了一个危险的盲区。当实验室报告结果时,发酵过程可能已经偏离了轨道,使得实时控制几乎变得不可能。
几十年来,科学家们一直试图利用计算机来弥补这一差距。他们构建了模型,试图根据可见的变量来推测隐藏的数值,希望能在实验室结果到达之前预测培养物的未来状态。早期的尝试依赖于基于已知物理和化学定律的僵化数学公式,但由于生物系统是混乱且充满未知变量的,这些尝试往往以失败告终。随后,研究人员转向人工智能,教计算机从历史数据中寻找模式。虽然这些“黑箱”系统可以从经验中学习,但它们经常面临两个主要问题:它们处理长序列数据(即完整发酵运行过程中产生的复杂序列)的速度太慢,且缺乏理解不同变量如何相互影响的生物学规则。由于缺乏这种内在逻辑,计算机可能会发现一个看起来正确但并不符合生物学常理的模式,从而导致预测不可靠。
来自中国科学技术大学和苏州生物医学工程技术研究院的研究团队提出了一种新方法来解决这些特定难题。他们开发了一个名为 G-Mamba 的系统,专门用于预测酪氨酸发酵的结果,这是一种通过工程化细菌生产用于制药和食品中的氨基酸的过程。研究人员专注于一个包含三十个历史发酵批次的数据集,追踪了从搅拌叶片速度到罐内进氧量等三十个不同的变量。他们的目标是创建一个能够准确预测两个通常只能在实验室中测量的关键结果的模型:细菌细胞密度和酪氨酸浓度。
G-Mamba 的核心创新在于它如何结合了两种不同的数据思考方式。首先,它使用了一种专门设计的架构来处理长序列时间。与那些难以记忆久远事件或需要巨大计算能力的旧系统不同,这种新结构可以高效地追踪发酵过程在数小时内的演变。它学习了罐内某一时刻的状态如何影响数小时后的状态,捕捉到了生物培养物的缓慢、稳定漂移。其次,或许更为重要的一点是,研究人员并没有让计算机去猜测变量之间的关系。相反,他们向系统输入了一张已知的生物学关系图。他们告诉模型,某些操作(如增加空气流量)会直接影响溶解氧的含量,而像二氧化碳这样的废气产生则与培养液的酸度相关联。这种“先验知识”充当了指南,确保模型遵循真实的生物学规则。
为了实现这一点,该系统将数据分为两条并行路径。一条路径侧重于时间线,观察每个变量如何逐秒变化。另一条路径则观察变量之间的连接网络,利用预设的生物学规则图谱来理解一个区域的变化如何波及整个系统。该模型还具有学习新的、隐藏连接的能力,这些连接是科学家并未明确定义的,这使其能够适应每个批次的特定特性。最后,一种轻量化机制将这两股信息流合并,决定在任何给定时刻要给时间线和生物学连接分别赋予多少权重。这使得系统不仅能理解发生了什么,还能理解为什么发生,以及接下来可能发生什么。
当研究人员将这个新系统与另外八个领先模型进行对比测试时,结果显而易见。在模型需要根据近期数据预测当前培养状态的任务中,G-Mamba 比其所有竞争对手都更准确。它在展望更远未来、预测未来几小时趋势方面也表现得更加可靠。然而,最显著的发现出现在模型被要求同时预测细胞密度和酪氨酸浓度时。在这些多目标任务中,该系统展现出了理解两者之间权衡关系的独特能力。它识别出细菌细胞的生长与产物的生产之间存在着复杂的资源竞争关系。通过同时预测两者,该模型利用较易预测的细胞生长作为引导,提高了对较难预测的产品浓度的预测精度。这表明该系统成功捕捉到了生物体生存与生产能力之间潜在的生物学张力。
该研究还强调了这种新方法的效率。虽然其他强大的模型在预测窗口期增长时需要大量的计算资源和内存,但 G-Mamba 保持了较低的计算成本。随着输入数据变得更加广泛,其性能并未下降,而这正是旧技术的常见失效点。研究人员发现,将已知的发酵过程规则纳入系统是至关重要的;当他们移除这种生物学引导时,模型的准确性显著下降。同样,移除追踪长期时间趋势的能力也会导致性能大幅下滑。这两个元素的结合证明是成功的关键。
最终,这项工作表明,工业发酵控制的未来在于尊重数据与科学相结合的混合系统。通过教导人工智能生物世界的规则,而不是让它盲目猜测,研究人员可以构建出不仅更快、更准确,而且更可靠的工具。对于管理这些复杂生物反应器的工程师来说,这种工具提供了实时洞察力的承诺,使他们能够在问题发生前调整工艺,确保每一批次的细菌都能以最高的稳定性生产出最大量的有价值产品。研究证实,当我们用成熟的科学知识来引导强大的新算法时,我们可以解决那些此前无论是单独依靠数据还是单独依靠科学都难以处理的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。