← 最新论文
🧬 biology

Scalable Enumeration of Pareto-optimal Polymers for Computing Equilibrium Concentrations

本文提出了一种利用希尔伯特基(Hilbert basis)计算与组合覆盖设计来枚举领域-单体系统中帕累托最优聚合物的可扩展框架,从而能够为大型 DNA 分子编程系统实现高效且符合热力学依据的平衡浓度预测。

原作者: Archit Patil, Minki Hhan, David Soloveichik

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Archit Patil, Minki Hhan, David Soloveichik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在工程生物学的微观世界中,科学家们正在利用 DNA 构建复杂的机器。这些并非细胞中携带遗传代码的长而扭曲的链条,而是旨在以特定模式组合在一起的短促合成片段。当这些片段相遇时,它们会相互结合,形成被称为“复合物”的更大结构。其目标是创造出能够执行逻辑、感知环境或组装成特定形状的系统,就像一个分子工厂一样。然而,预测这些系统的行为极其困难。虽然设计者可能从一小组 DNA 片段开始,但化学定律允许这些片段以无数种方式结合,从而产生无限数量的可能结构。其中一些是预期的产物,但许多是意外的副产物,它们会阻塞系统或导致系统失效。为了确保这些分子机器按计划工作,研究人员必须了解在系统达到平衡(即平衡态)时,哪些结构会形成以及形成的量是多少。

几十年来,科学家一直依赖计算机程序来模拟这些相互作用,但当系统变得庞大时,这些工具就会显得力不从心。它们通过检查 DNA 片段可以连接的所有可能方式来运行,当组合数量爆炸式增长时,这项任务就变得无法完成了。由德克萨斯大学奥斯汀分校和韩国科学技术院的研究人员开发的一种新方法,提供了一种在不损失准确性的情况下穿透这种复杂性的途径。该团队并没有试图列出所有可能的结构,而是专注于一组特定的、热力学稳定的较小规模的结构。他们证明了绝大多数不稳定的、偶然产生的结构在平衡系统中出现的概率极低,因此可以被安全地忽略。通过过滤掉这些不太可能的候选对象,他们将一个无限的问题转化为一个有限的问题,使得分析以前过于庞大而无法研究的系统成为可能。

研究人员首先定义了一个他们称之为“帕累托最优”(Pareto-optimality)的概念。简单来说,如果一个结构不能在不破坏化学键的情况下分解为更小的独立部分,那么它就是帕累托最优的。如果一个大型复合物可以分裂成两个不需要粘在一起的独立部分,它就被视为是不稳定的。物理定律更倾向于分裂的版本,因为这会产生更多的独立单元,从而增加无序度,即熵,这是化学反应的一个关键驱动力。团队在数学上证明了这些不稳定的、可分裂的结构永远不会出现在系统最稳定、能量最低的状态中。此外,即使在现实世界的非理想条件下,这些不稳定结构的总量与稳定结构相比也非常微小,以至于对整体结果的影响可以忽略不计。这一发现使研究人员能够丢弃那无穷无尽的、不可能或不太可能的结构海洋,转而只关注有限且稳定的、帕累托最优的聚合物集合。

为了寻找这些稳定的结构,团队转向了被称为“希尔伯特基”(Hilbert basis)的一个数学分支。这种方法使他们能够识别出一个系统的基本构建模块,所有其他有效的结构都可以由此衍生出来。在过去,这种数学工具仅用于每个可能的键都必须强制形成的系统,而这并不反映 DNA 化学中键可能较弱或不完整的混乱现实。研究人员扩展了这种方法,以处理这些更真实的、不饱和的情况。他们证明了所有稳定结构的集合精确对应于一组特定的数学解,证明了相关结构的数量是有限的且可以计算的。然而,即使进行了这种简化,计算大型系统的完整集合仍然太慢,无法投入实际使用。所需计算的数量增长得如此之快,以至于对于一个中等复杂度的系统,可能需要数年才能完成。

为了解决这个速度问题,团队引入了一种基于限制所寻找结构规模的策略。他们认为,在许多工程化系统中,最重要的结构并不是由所有可用的 DNA 类型组成的,而是由较小的子集组成的。他们开发了一种算法,用于寻找包含不超过特定数量不同 DNA 类型的稳定结构,他们将此参数称为“支撑界限”(support bound)。他们没有去检查这些类型的每一种可能组合(这仍然会非常多),而是使用了一种巧妙的数学技术,称为“覆盖设计”(covering design)。这种技术就像一个筛子,选择一组具有战略意义的小型组别进行测试。通过仅在这些选定的组别上运行复杂的计算,他们就可以重建整个系统的相关完整结构集,而无需为每一个可能的选项都进行繁重的计算。

该方法的有效性在近期科学文献中描述的几个 DNA 系统家族上得到了测试,包括线性链和逻辑门树状结构。在一次涉及七个模块链的测试中,新方法仅用了 24 秒就计算出了相关结构。而对同一系统的直接暴力计算则耗时超过 1,000 秒;对于更大的系统,如果直接法还能运行的话,也将耗费数小时甚至数天。研究人员发现,通过将 DNA 类型的数量限制在一个适中的数值,他们几乎找回了对系统行为至关重要的所有结构。他们遗漏的少数结构极其罕见,不足以改变系统的预测结果。这种方法使他们能够进行详细的“泄漏分析”(leakage analysis),即检查移除输入后产生了多少非预期产物,而这对于拥有超过几个模块的系统来说,此前是无法实现的。

这项工作为设计复杂的分子系统提供了一条切实可行的路径。通过将“忽略不稳定结构的物理热力学依据”与“使用数学筛法的可扩展算法”相结合,研究人员使得分析以前无法触及的 DNA 系统成为可能。他们的方法并不要求系统是完美的,也不要求化学键是强固的;即使在化学性质较弱且不完整的情况下,该方法依然有效。通过用少量的理论完整性换取巨大的速度提升,研究人员为工程师提供了一个在实验室构建之前验证其设计的全新工具。随着 DNA 计算向着更大、更复杂的机器发展,这种高效预测平衡浓度的方法对于确保这些分子设备按预期功能运作将至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →