The Complex Geometry of Biological Knowledge in Artificial Intelligence: Manifolds, Spectra, and Concept Structure in Foundation-Model Representations
这项研究表明,虽然蛋白质语言模型编码了具有生物学意义且可线性解码的信息,但它们缺乏单细胞基础模型中所发现的那种复杂的低维流形、多尺度谱结构和层级概念几何结构,而是通过一种由序列数据的离散性和同源驱动特性所塑造的、几何结构简单且高线性维度的空间来呈现知识。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正试图理解一座巨大的图书馆是如何组织其书籍的。在人工智能的世界里,存在着“基础模型”——这些庞大的计算机程序通过海量数据进行训练,以学习特定学科的规则。其中一种流行的模型类型是基于生物数据进行训练的,例如细胞的遗传密码或蛋白质的序列。科学家们最近发现,其中一些模型(特别是那些针对细胞数据训练的模型)似乎拥有一个非常精妙的内部地图。它们表现出沿着平滑、弯曲路径(称为“流形”)组织信息的能力,并具有一种复杂的、多层级的结构,看起来就像一座精美而复杂的雕塑。这令人兴奋,因为如果计算机像组织复杂雕塑一样组织知识,那么我们可能更容易理解它的思考方式,甚至可以利用这种结构来发现新的生物学规律。
但这里有一个大问题:是否所有生物 AI 模型都以这种方式组织它们的知识?例如,那些针对蛋白质训练的模型呢?蛋白质是人体内完成大部分工作的微型机器,它们的“语言”是氨基酸组成的漫长字符串。如果这些蛋白质模型也拥有这种精妙、弯曲且复杂的几何结构,对于试图解码它们的科学家来说将是一个巨大的胜利。如果它们没有,那就意味着我们可能是在一个只有平坦开阔地的场所寻找藏宝图。这篇论文旨在通过放大镜观察这些蛋白质模型,看看它们是否真的拥有像其专注于细胞的“表亲”那样复杂的秘密架构,还是说它们的内部世界是建立在完全不同的逻辑之上的。
伟大的蛋白质地图搜寻战:曲线与云团的故事
认识一下蛋白质语言模型(pLMs)。把它们想象成超级聪明的厨师,他们品尝过宇宙中所有的食谱(数以亿计的蛋白质序列),并在从未见过任何一道成品菜肴的情况下,学会了烹饪的规则。它们如此出色,以至于可以预测蛋白质如何折叠成 3D 形状,或者它在体内的功能。科学家们一直在问:“这位厨师是如何在脑海中组织知识的?”
有一段时间,答案似乎是“在一个复杂、弯曲的迷宫中”。其他生物 AI 模型(基于单细胞训练)被发现其知识存储在平滑、低维度的曲线中,就像一条在超高维空间中蜿蜒穿行的丝带。它们拥有“谱系”结构(就像彩虹中清晰的分层颜色)和“概念层级”(就像一个想法整齐分叉的家族树)。这引发了一个巨大的假设:也许所有生物 AI 都以这些精妙、复杂的几何形状来组织知识。
由研究员刘陈(Liu Chen)领导的这篇论文决定对这一假设进行测试。他们构建了一个“三镜电池”来检查八种不同蛋白质模型的“大脑”,其中包括著名的 ESM-2 系列(从仅有 800 万参数的小模型到拥有 30 亿参数的巨型模型)以及像 ProtBERT 和 Ankh 这样的模型。他们不仅仅是在观察,还使用了一套严谨的工具来测量三个具体指标:
- 形状(流形): 数据是否组织在一个平滑、弯曲的表面上?
- 谱系: 数据是否具有像彩虹一样清晰、分离的条带?
- 概念: 想法是否排列成整齐的层级或家族树?
他们还在“合成控制组”——即他们创建的已知具有复杂形状(如扭曲的甜甜圈或螺旋形)的虚假数据——上运行了这些相同的测试。如果他们的工具有效,他们应该能在这些虚假数据中发现复杂的形状。
结论:它是扁平、线性的云团,而非弯曲的迷宫
结果令人有些意外,但非常明确。作者发现,蛋白质语言模型并不具备细胞模型所拥有的那种复杂、弯曲的几何结构。相反,它们的内部知识是“真实但简单”的。
1. 形状:是云团,不是丝带
当研究人员试图寻找一个平滑、弯曲的表面(流形)来承载蛋白质数据时,他们一无所获。
- 发现: 虽然数据看起来可能位于低维曲线上(大型模型的“非线性内在维度”很小,约为 26),但现实并非如此。数据实际上扩散在一个巨大的、高维的空间中(线性维度约为 131)。
- 类比: 想象尝试压平一张揉皱的纸。如果它是一条平滑的丝带,你可以很容易地压平它。但这些蛋白质模型更像是一团巨大的、蓬松的棉花糖云。从远处看它很小,但如果你试图把它挤压成扁平的形状,它就会向四周扩散。
- 证据: 当研究人员尝试使用高级的、基于曲线的数学方法来可视化数据(例如用于制作漂亮二维图像的 UMAP)时,结果非常糟糕。模型失去了预测蛋白质属性的能力。然而,简单的、直线型的数学方法(线性探针)却表现得非常完美。作者得出结论:蛋白质知识的“几何结构”不是一个平滑、弯曲的流形,而是一个“近线性、高维的云团”。
2. 谱系:是一条平滑的滑梯,而不是彩虹
接下来,他们观察了数据的“谱系”,这就像观察歌曲中的声音频率。
- 发现: 他们发现了一条遵循幂律(一种指数接近 1 的特定数学曲线)的单一、平滑的数据“滑梯”。并没有出现分隔不同生物概念的明显“条带”或间隙。
- 类比: 如果说细胞模型像是拥有清晰红、橙、蓝条带的彩虹,那么蛋白质模型就像是单一、平滑的灰色渐变。在数据的内部结构中,没有明显的界限来区分一种蛋白质和另一种蛋白质。
- 细微差别: 虽然没有复杂的结构,但那条平滑滑梯的“陡峭程度”(指数)实际上非常有用。它起到了“质量评分”的作用。滑梯越平坦(指数越接近 1),模型的实际表现就越好。因此,虽然结构并不复杂,但它是一个可靠的指标,可以衡量模型的优劣。
3. 概念:是扁平的,而非层级的
最后,他们检查了模型如何组织诸如“这是膜蛋白吗?”或“它的二级结构是什么?”之类的“概念”。
- 发现: 模型擅长使用简单的直线来回答这些问题。如果用线性探针询问:“这是膜蛋白吗?”它能以很高的准确率回答“是”。然而,这些概念之间的关系是扁平的。
- 类比: 想象一座图书馆。在复杂的层级结构中,书籍按洲、国家、城市、街道进行排列。而在这些蛋白质模型中,书籍只是散落在巨大的、平坦的桌面上。你可以轻松找到正确的书(线性可解码性),但并没有一个整齐的家族树将它们连接起来。此外,“类比”测试(检查模型是否理解“A 之于 B 如 C 之于 D”)也失败了;这些关系很弱,并且不像在语言模型中那样呈平行方向排列。
- 干扰因素: 作者还发现,某些表象上的结构实际上只是模型对基本特征(如蛋白质长度或某些氨基酸的数量)的反应,而非深层的生物学意义。
为什么会有差异?数据的本质
论文提出了一个引人入胜的原因,解释了为什么蛋白质模型与细胞模型不同。
- 细胞数据: 细胞的变化是连续的。一个干细胞会缓慢转变为血细胞。这创造了一个平滑、蜿蜒的路径(流形)。
- 蛋白质数据: 蛋白质是离散的。它们是由 20 种可能的氨基酸组成的字符串。所有可能的蛋白质空间是巨大且“块状”的,是根据进化历史(同源性)而非平滑过渡来组织的。
- 结论: 由于数据本身是离散且呈簇状分布的,AI 模型不需要构建一个平滑、弯曲的地图。它只需将其知识扩散在一个高维、线性的云团中即可。细胞模型中所报告的“复杂几何结构”并不能转移到蛋白质上,因为蛋白质的底层现实是不同的。
总结
作者得出结论:蛋白质模型中的生物知识是真实的且可获取的,但其几何结构是简单的。
- 有效的方法: 简单的线性工具(如直线探针和 PCA)是读取这些模型的最佳方式。
- 无效的方法: 试图将这些模型强行纳入复杂的、弯曲的形状中,或者在它们的内部结构中寻找深层的、层级化的家族树,注定是死路一条。
- 慰藉之处: 知识是线性且简单的,这实际上是一件好事。这意味着我们可以信任这些模型给出直接的答案,而无需去解码一个神秘的、弯曲的迷宫。尽管“复杂几何结构”的假设对于细胞模型来说非常美丽,但它并不适用于蛋白质世界。这篇论文证实了,对于蛋白质而言,地图不是一条蜿蜒的丝带,而是一片广袤、开阔且出奇地直截了当的旷野。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。