AutoProteinEngine: A Large Language Model Driven Agent Framework for Multimodal AutoML in Protein Engineering
AutoProteinEngine (AutoPE) 是一个由大语言模型驱动的智能体框架,它使不具备深度学习专业知识的生物学家能够通过自然语言交互来处理模型选择、超参数优化和数据检索,从而进行蛋白质工程的多模态自动化机器学习。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位试图发明新菜肴的大厨,但你的食材不是香料和蔬菜,而是蛋白质——那些驱动每一个生命体的微小且复杂的分子机器。在生物学世界中,“蛋白质工程”是微调这些分子机器以使其更好地完成特定任务(如开发新药或创造超高效酶)的艺术。长期以来,进行这项工作就像是用锤子去修理一块复杂的机械表:科学家们只能靠猜测、测试并不断重复,这个过程既缓慢又昂贵,且经常陷入死胡同。
最近,一种名为“深度学习”的新工具来到了这个领域。把深度学习想象成一个超级聪明的数字学徒,它读遍了宇宙中所有的食谱,并且仅通过观察蛋白质的“配方”就能预测其行为。然而,问题在于:这个数字学徒使用的是一种由复杂代码和数学组成的困难语言。大多数生物学家是生命“风味”方面的专家,但他们并不懂这种代码。他们需要一个翻译官。这便引出了一个重大的问题:我们如何让才华横溢的科学家使用这些强大的数字工具,而不必强迫他们先成为专业的程序员?
这正是论文《AutoProteinEngine》(简称 AutoPE)试图解决的问题。作者们——来自不同大学和一家生物技术公司的研究团队——构建了一个聪明的“智能体”(agent)框架,充当人类科学家与深度学习模型之间的通用翻译官。生物学家无需编写代码,只需用普通的英语与系统对话,例如说:“我需要预测改变这种蛋白质会如何影响它的甜度。”随后,系统就会接管工作,在幕后完成所有繁重的计算任务。
该论文介绍了 AutoPE,这是一个利用大语言模型(LLM,即驱动对话式聊天机器人的同类技术)来自动化蛋白质机器学习全过程的框架。该系统旨在处理“多模态”数据,这意味着它能同时从两种方式理解蛋白质:作为字母序列(就像一份配方),以及作为 3D 结构(就像一个折叠的折纸形状)。研究人员发现,通过让 LLM 选择最佳模型、自动调整参数设置,甚至从 PDB 和 UniProt 等大型在线数据库中抓取缺失的数据,他们可以创造出一种既易于使用又更高效的工作流。
在实验中,团队在两个现实世界的任务上测试了 AutoPE:预测一种名为 Brazzein 的突变蛋白质是否具有甜味,以及预测一种名为 STM1221 的酶的活性水平。他们将这种全新的基于对话的系统与另外两种方法进行了对比:“零样本”(zero-shot)推理(使用预训练模型而不进行额外训练)以及“人工微调”(由专家级人类程序员仔细调整模型)。结果令人振奋。在甜度分类任务中,经过自动调优的 AutoPE 实现了 0.7306 的 F1 分数和 0.8908 的准确率,显著优于零样本方法,并在平衡性和鲁棒性方面击败了人工微调方法。在酶活性回归任务中,经过自动调优的 AutoPE 实现了最低的误差率(RMSE 为 0.3488)和最高的解释能力(R2 分数为 0.6805),这表明它预测酶行为的能力比测试的其他方法更准确。
该论文指出,这种方法成功地弥合了复杂深度学习与生物学专业知识之间的鸿沟。它提出,通过使用自然语言来引导过程,没有计算机科学背景的研究人员现在也可以利用先进的 AI 工具。该系统不仅是在运行数字,它还扮演着得力助手的角色,用通俗易懂的英语解释它正在做什么,甚至总结它找到的数据。虽然作者指出,这是针对蛋白质工程开发多模态 AutoML 框架的一次全新尝试,但他们的研究结果表明,这是一条通往让蛋白质工程变得更加普及且高效的可行路径,让科学家能够专注于科学本身,而非软件本身。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。