BioForm-LM: Generative Design of Biologics Formulations via In-Context Learning and Physics-Informed Decoding
BioForm-LM 是一种结合了机制模拟、上下文少样本学习和物理信息解码的新型生成系统,能够自动设计从头合成的生物制剂配方,在现实世界的基准测试中显著优于传统的排序方法和随机采样。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
研发一种救命的蛋白质药物仅仅是成功了一半;另一半则是让它足够稳定,以便在货架、注射器或人体内存活。生物制剂(包括抗体和其他复杂的蛋白质)是脆弱的分子,如果溶解它们的液体平衡得不够完美,它们很容易发生聚集或失去形状。几十年来,寻找这种完美的平衡一直是一个缓慢、依赖人工且充满试错的过程。科学家将蛋白质与不同的缓冲液、糖类和盐类混合,然后等待数周以观察其是否能保持稳定。这一瓶颈既昂贵又限制了新药到达患者手中的速度,尤其是在那些缺乏可靠冷藏条件的地区。核心挑战在于,虽然科学家了解蛋白质与其环境相互作用的基本规则,但目前几乎没有现实世界的数据可以用来教计算机如何预测适合新药的混合比例。大多数现有的计算机工具只能对人类已经提出的混合物列表进行排序;没有一个能够从零开始发明一种全新的、稳定的混合物。
一位研究人员现在推出了一种名为 BioForm-LM 的新系统,试图通过教计算机“想象”稳定的药物混合物来解决这个问题。该系统并非依赖于庞大的过往实验库(对于大多数新蛋白质而言,这些库并不存在),而是采用了三部分策略。首先,它运行一个快速的、基于物理学的模拟过程,模拟蛋白质在不同液体中的行为。这个模拟器生成了包含一百万个蛋白质混合物及其稳定性的合成示例,从而教会计算机化学和物理的基本定律。其次,该系统使用了一种只需少量样本即可学习的人工智能。当科学家想要稳定一种新蛋白质时,他们只需向计算机提供关于该特定蛋白质的三到十个真实测量值。系统利用这几个数据点即时调整其理解,而无需重新训练。最后,一个经过相同物理规则训练的专门检查器会审查计算机的建议,并挑选出在现实世界中最有可能奏效的方案。
研究人员在科学文献中发现的十八种真实药物配方组成的精选小规模集合上测试了这种方法。结果显示,该系统能够生成新的、可行的混合物配方,且显著优于随机猜测。在涉及一种小型抗体片段的具体案例中,系统仅使用三个真实数据点进行引导,就实现了预测结果与实际实验结果的完美匹配。平均而言,该系统探索的化学空间几乎是随机搜索覆盖范围的五倍,这表明它学习到了关于如何稳定蛋白质的真实模式,而非仅仅是记忆旧数据。该系统还展示了它可以适应不同类型的蛋白质,根据其试图拯救的特定分子来转变策略。
然而,作者谨慎地指出,这些结果目前仅为计算假设,而非最终完成的药物。该系统尚未在湿实验室中进行测试,以确认生成的混合物在物理试管中是否确实有效。用于测试的数据集非常小,仅包含十八条记录,这限制了目前研究结果的广泛适用性。研究人员强调,他们的工具旨在为科学家提供测试候选方案,而不是完全取代实验室工作。他们将此视为迈向未来的一步,在那个未来,计算机可以迅速将成千上万种可能的混合物缩小到少数几种最有希望的方案,从而节省数月的手动筛选时间。尽管该系统在模拟中表现出了巨大的潜力,但最终的证明将来自于物理实验,以验证这些计算机生成的配方是否确实能让脆弱的蛋白质保持稳定多年。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。