← 最新论文
💻 bioinformatics

PG-LLM: Benchmarking General-Purpose Language Models for Protein Variant Ranking

PG-LLM 基准测试表明,尽管通用语言模型缺乏对结构数据或多序列比对的访问权限,但它们能够有效地对蛋白质变体进行排序,并表现出优于许多成熟的基于序列的预测器的能力,尽管它们仍然落后于专门的生物分子工具。

原作者: Arora, R. K., Chen, L. T., Du, M., Marks, D., Church, G.

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Arora, R. K., Chen, L. T., Du, M., Marks, D., Church, G.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下你是一位试图发明新食谱的大厨。你有一个表现良好的基础菜肴(蛋白质),但你想微调其中的配料(氨基酸),让它味道更好、保质期更长,或者能在不同的厨房里使用。在生物学领域,这被称为蛋白质工程。多年来,科学家们一直使用专门的计算机程序——就像是一群背诵过所有既定食谱的资深美食评论家——来猜测哪些微调会奏效。这些专家通过观察这道菜的家族历史(进化数据)和锅具的物理形状(蛋白质结构)来进行预测。

最近,一种新型的“大厨”进入了厨房:通用语言模型(LLMs)。这些是与编写诗歌、解决数学问题和聊天历史知识相同的 AI 大脑。它们非常聪明,擅长理解语言和模式。一个大问题是,这些通用的 AI 大厨并没有经过专门的“美食评论员”训练,他们能否在看了一份食谱和一份配料替换清单后,告诉我们哪个新版本会是最好的?他们没有家族历史书,也没有锅具的 3D 模型;他们只有食谱的文本以及关于单词(在这种情况下是氨基酸)如何组合在一起的广博知识。

这篇题为“PG-LLM”的论文建立了一个大规模的“口味测试”来寻找答案。研究人员创建了一个名为 PG-LLM 的基准测试,这就像一场巨大的烹饪比赛。他们拿了 217 种不同的“食谱”(蛋白质),并要求 13 位不同的 AI 大厨根据在真实实验中的表现,将每种食谱的 50 个不同版本从“最好”到“最差”进行排序。陷阱在于,这些 AI 大厨不允许使用任何专门的蛋白质工具、进化图谱或 3D 结构。它们必须仅依靠自身的通用智慧。

结果呈现出一种“惊艳”与“尚未完全达标”并存的状态。表现最好的 AI 大厨 Claude Opus 5 获得了 0.406 的分数(在 1.0 为完美的量表中)。这是一个相当不错的分数!这意味着 AI 实际上非常擅长猜测哪些蛋白质微调会奏效,它击败了 49 个已经存在多年的专门计算机程序。事实上,它的表现优于几乎所有的“仅序列”专家(即那些只看配料清单而不看 3D 模型的专家)。

然而,AI 大厨并没有赢得整场比赛。最顶尖的专业蛋白质专家,比如一个名为 VenusREM 的程序,得分仍然更高,达到了 0.523。这就像通用的 AI 是一个非常有天赋的家庭厨师,能够猜中烘焙大赛的获胜者,但拥有数十年专门训练的专业甜点师仍然更了解其中的奥秘。

论文还发现了一些关于这些 AI 大厨思考方式的有趣特征。当研究人员让 AI 思考得更深入、更久时(给予更多“测试时计算”),得分提高了,但最终遇到了瓶颈。此外,当 50 个食谱的列表太长,导致 AI 在脑中难以处理时,它的表现会下降,而专门的专家则不在乎列表有多长。有趣的是,无论蛋白质有着深厚的家族史还是浅显的历史,AI 的表现都没有太大变化,这表明 AI 使用的是一种与进化专家不同的逻辑。

最后,为了确保 AI 不仅仅是依赖互联网上的记忆答案,研究人员在 AI 训练数据截止日期之后发表的新食谱上对它们进行了测试。结果相似:AI 仍然可以对新食谱进行推理,证明它是在学习游戏的规则,而不仅仅是在背诵旧答案。

简而言之,这篇论文表明,通用人工智能正在成为一个极具能力的“生物推理者”。它已经能够超越许多成熟的工具,并且正在接近顶尖的专家。但目前来看,它还没有完全取代那些专注于蛋白质的专业专家。它是一个实验室里的强大新工具,但大师级大厨们依然在局中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →