Published benchmark AUROC does not predict generalisation: an independent evaluation of protein solubility predictors on native and heterologous E. coli proteins
这项研究表明,已发表的基准 AUROC 无法有效预测蛋白质溶解度模型在独立分布上的泛化性能,揭示了最先进的深度学习模型在应用于其特定训练领域之外时,表现可能逊于简单的可解释基准模型。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下你是一位正试图烤制完美蛋糕的厨师。在生物学的世界里,“蛋糕”就是蛋白质——一种微小的分子机器,在我们的身体里几乎承担着所有的工作,并在生物技术领域也大有作为。有时,当科学家试图在工厂(通常是用大肠杆菌这类细菌作为“烤箱”)中制造这些蛋白质时,蛋白质无法正确折叠。它们没有变成蓬松的蛋糕,而是变成了硬邦邦、毫无用处的面团块,被称为“包含体”(inclusion bodies)。这是一个巨大的问题,因为如果你不能让蛋白质溶解并发挥作用,你就无法利用它来制造药物或研究生命。
为了避免这种灾难,科学家们使用被称为“预测器”的计算机程序。把它们想象成神奇的食谱书,它们会观察成分表(蛋白质序列),然后猜测:“嘿,这个会变得很蓬松!”或者“不,这个会变成一块石头。”长期以来,这些食谱书都是通过一个单一的分数来评判的,叫做 AUROC,这就像是一张成绩单。分数越高,意味着这本食谱书越好。但大问题在于:如果一本食谱书在一项特定的测试中拿了“A”,是否意味着当你给它一套完全不同的食材时,它仍然是最好的厨师?这篇论文调查了这些闪亮的成绩单是否真的反映了这些计算机厨师在现实世界中的表现。
伟大的蛋白质烘焙大赛:当成绩单撒谎时
在这项研究中,一位名叫 Jakob Oeschey 的研究人员决定对最受欢迎的蛋白质预测“食谱书”进行测试,但他加了一个转折。他不仅仅是看它们的官方成绩单,而是将它们放在两个完全不同的厨房里进行测试,看看它们是否真的能经受住考验。
两个厨房
想象两种不同类型的烘焙挑战:
- 原生厨房(The Native Kitchen): 这就像是用在同一个花园里生长了数代的食材进行烘焙。这里的蛋白质是“原生的”,意味着它们是存在于大肠杆菌体内的天然、未经修改的蛋白质。它们已经适应了周围的环境,就像一位了解烤箱运作方式的当地面包师。
- 异源厨房(The Heterologous Kitchen): 这是“外来”的厨房。在这里,科学家们试图烘焙那些根本不属于大肠杆菌的蛋白质——也许是人类蛋白质,或者是来自其他昆虫的蛋白质。这些是“异源”构建体。这就像要求一位当地面包师突然制作复杂的法式糕点,但使用的是不同类型的面粉和全新的烤箱。这要难得多,而且更容易出错。
参赛选手
Oeschey 请来了重量级选手:
- RP3Net 和 NetSolP: 这些是“深度学习”厨师。它们是超级聪明、复杂的 AI 模型,阅读过数百万份食谱。它们是蛋白质界的明星,在各自的官方测试中拥有极高的分数。
- 简单基准模型(The Simple Baselines): 这些是“奶奶的经验法则”。它们并不高级,也不是 AI,而是基于基础化学原理(比如计算混合物中有多少“粘性”或“润滑”成分)的简单、传统的经验法则。它们是谦逊、务实的烘焙者。
令人震惊的结果
当 Oeschey 在原生厨房(容易的、本地的花园)测试这些厨师时,结果是混乱且令人惊讶的。
- NetSolP 成为了明星厨师,得分 0.792。它是预测哪些原生蛋白质能正常工作的佼佼者。
- RP3Net——那个声称在自己官方测试中获得 0.83 分的明星 AI——却遭遇了惨败。它的得分仅为 0.709。
- 最关键的是:简单的、老派的“奶奶”规则(特别是溶解度加权指数,即 SWI)得分 0.745。这意味着简单的规则竟然打败了高级 AI!那个理应是最优秀的 AI,实际上甚至不如一个基础的计算器。
- 最好的 AI(NetSolP)与最差的 AI(RP3Net)之间的差距为 0.083。在科学界,这是一个巨大的差异。这个差距如此之大,以至于这两个“超聪明”的模型甚至无法达成共识;它们处于光谱的两端。
外来厨房的灾难
随后,Oeschey 将厨师们转移到了异源厨房(困难的外来挑战)中。
- 突然之间,两位 AI 厨师(NetSolP 和 RP3Net)的表现变得一致了。它们的分数都在 0.63 左右,虽然还可以,但并不出色。
- 简单的规则虽然落后于它们,但仍在竞争之中。
- 但真正的戏码来自于第三个名为 PLM_Sol 的 AI。该模型声称在自己的测试中获得了 0.83 的高分。但当 Oeschey 在异源蛋白质上测试它时,它崩溃到了 0.564。这基本上就是在靠运气瞎猜!它的表现甚至不如简单的规则,仅仅比随机猜测好一点点。即使在剔除了它可能通过“死记硬背”来获取优势的蛋白质后,它依然失败了。
这意味着什么
主要的教训是,一张闪亮的成绩单(高基准分数)并不能保证一个厨师能胜任一种新的烹饪任务。
- RP3Net 非常擅长其特定任务(预测人类药物靶点),但在原生任务上表现糟糕。
- NetSolP 在原生任务上表现出色,但在异源任务上表现平平。
- PLM_Sol 在纸面上看起来非常完美,但在食材改变时彻底崩溃。
研究还排除了几种借口。他们检查并确保 AI 并不是通过“死记硬背”训练数据中的答案来“作弊”。即使在清理了测试集以移除任何重叠的蛋白质后,结果依然保持不变。失败的原因不是因为作弊,而是因为这些模型是针对特定类型的蛋白质进行训练的,因此无法推广到另一种类型的蛋白质。
总结
如果你是一名试图制造蛋白质的科学家,不要仅仅挑选包装盒上数字最高的工具。如果你的蛋白质与该工具训练时的蛋白质不同,那个数字可能是一个谎言。有时,一个简单的、传统的经验法则实际上比高级的、昂贵的 AI 更可靠。了解一个工具是否有效的最好方法,是在你试图制造的确切类型的蛋白质上进行测试,而不是仅仅相信头条新闻上的数字。
简而言之:在蛋白质预测的世界里,环境(Context)才是王道。一个在某个厨房里是天才的模型,在另一个厨房里可能会变成灾难;而在条件合适的情况下,一个简单的规则有时能战胜超级计算机。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。