← 最新论文
🧬 biology

In Search of Manifolds Inside Protein Language Models: A Largely Negative Report

本文通过一系列全面的几何与拓扑诊断手段,系统地研究了蛋白质语言模型(pLMs)中的流形假设,并得出结论:与单细胞基础模型不同,pLM 的表示形式主要是高维且线性的,而非围绕低维流形组织。

原作者: Olivia Denvis

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Olivia Denvis

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图理解一座庞大而混乱的图书馆。在这座图书馆里,每一本书都是蛋白质——这些构建并运行所有生命活动的微小分子机器。长期以来,科学家们一直使用被称为“蛋白质语言模型”的高级计算机程序来阅读这些书。这些程序就像数字侦探,它们阅读了数十亿个蛋白质序列,并学会了如何预测它们的折叠方式、功能以及可能发生的改变。

但这里有一个巨大的疑问:计算机究竟是如何“思考”这些蛋白质的?当计算机观察蛋白质时,它看到的是一堆杂乱的数据,还是一个隐藏的、平滑的形状?科学家们有一个最钟爱的理论,叫做“流形假设”(manifold hypothesis)。你可以这样理解:想象一张巨大的、皱巴巴的纸漂浮在一个巨大的三维空间里。尽管这张纸在三维空间中漂浮,但如果你是一只在上面爬行的蚂蚁,你的世界感觉会是平坦的二维。 “流形假设”表明,即使计算机的大脑(高维空间)非常庞大且复杂,关于蛋白质的重要信息实际上可能隐藏在一个平滑的、低维的表面上,就像那张平坦的纸一样。这个想法在其他领域也曾大获成功,比如在研究细胞生长和变化的过程中,科学家们发现了细胞沿着这些平滑、低维“道路”行进的轨迹。所以,大问题在于:这些检测蛋白质的计算机,其大脑内部是否也存在这些平滑的、隐藏的道路?

一位名叫奥利维亚·德维尼斯(Olivia Denvis)的研究员决定开展一场寻找这些模型内部隐藏道路的“寻宝行动”。她并非凭空猜测,而是构建了一个庞大的“检测电池”,这就像是一个集超先进金属探测器和地图绘制功能于一体的综合工具。她将这个工具应用于几种不同的蛋白质模型进行测试,包括著名的 ESM-2 系列(其规模从微小的 800 万参数到巨大的 30 亿参数不等)以及其他的 ProtBERT 和 ProtT5。她使用了各种巧妙的技巧来验证数据是否真的位于一个平滑的低维表面上。她检查了数据的“内在维度”(intrinsic dimension,这是一种高级说法,即:我们需要多少个方向才能描述这些数据?),她尝试将数据压平到二维地图上以观察是否会出现模式,她甚至寻找了拓扑环(类似于甜甜圈中间的孔),以此来证明数据是否呈现出某种特定的形状。

这场寻宝的结果如何?一份基本全盘否定的报告。

德维尼斯发现,认为这些蛋白质模型内部存在平滑、低维道路的想法很可能是错误的。与其说是在三维空间中寻找一张漂浮的平纸,她发现数据实际上是分布在一个广阔的高维空间中的。当她测量“内在维度”(描述数据所需的方向数量)时,它并不是一个像 2 或 3 那样小巧易处理的数字:对于中等规模的模型(ESM-2 650M),维度约为 63;而对于巨大的 30 亿参数模型,这个数字跳到了 88。更具说服力的是,随着模型变得更大、更聪明,维度反而增加了,而不是减小了。如果存在一条单一且平滑的道路,那么随着模型的改进,维度应该保持不变或变得更简单。相反,这些模型似乎正在利用越来越多的方向来存储信息,这表明其结构是复杂的、“高维”的,而非简单的曲线。

她还尝试使用计算机的“制图”工具将数据压平到二维,就像我们在单细胞数据中所做的那样。但当她这样做时,有用的信息被破坏了。这就像试图把一个多层复杂的蛋糕压成一张薄饼;其中的“风味”(生物学信息)丢失了。当她测试这些压平后的地图是否能预测蛋白质的稳定性或结构时,表现得非常糟糕。事实上,最简单的方法——仅仅使用直线(线性探针)观察原始的高维数据——效果反而最好。计算机并不需要一条弯曲的、低维的道路;它需要一条拥有数十条车道的宽阔、平坦的高速公路。

此外,她还寻找了数据中的“环”或“孔”,这些特征可以指示数据具有类似甜甜圈或圆圈的特定形状。结果她什么也没找到。数据的拓扑结构是“平凡的”(trivial),这意味着它只是一个巨大的、实心的团块,没有任何有趣的形状。她还发现,那些在二维地图上看起来像是形成了整齐分组的蛋白质簇,实际上只是一种错觉。当她去除了蛋白质长度或基本成分(氨基酸)的影响后,这些分组就瓦解了。她们曾经认为看到的那个“流形”,其实只是这些基础、枯燥事实的反映。

为了确保她的工具没有损坏,她将这些工具测试在了一些她“已知”具有平滑道路的对象上,例如合成的“瑞士卷”(Swiss roll)形状和真实的单细胞数据。她的工具表现完美,成功找到了低维结构和环状结构。这证明了她的方法是正确的;问题不在于工具,而在于蛋白质数据本身。

那么,这意味着什么?事实证明,蛋白质语言模型并不像细胞发育那样拥有平滑、连续的地图。相反,它们更像是一个庞大的、高维的图书馆,其中的每一本书都由长度、组成成分和家族历史的复杂组合进行组织。信息确实存在,而且极其有用,但它并不是隐藏在一个简单的低维表面上。它是分布在一个高维空间中的,如果试图将其强行压缩进一个简单的二维地图,实际上会丢掉最重要的细节。论文的结论是:对于蛋白质模型,我们不应再寻找平滑的、弯曲的道路,而应开始欣赏它们实际行驶在其中的宽阔、高维的高速公路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →