← 最新论文
💻 bioinformatics

A geometric atlas of how ESM3 organizes modalities across depth

这项研究揭示了在多模态蛋白质语言模型 ESM3 中,不同的物理模态(序列、结构、二级结构和溶剂可及性)最初占据独立的子空间,随后在第 25 层至第 35 层之间融合为一个共享的低维表示,而功能注释在整个过程中保持正交,且这一融合过程是一个被学习到的、独立于蛋白质长度的普遍属性,但会被结构无序性所延迟。

原作者: Steenwyk, J. L.

发布于 2026-07-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Steenwyk, J. L.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一个拥有 14 亿参数的巨型数字大脑——ESM3。它的任务是理解蛋白质,即构建生命的微小分子机器。但这个大脑不仅仅是在阅读蛋白质的“配方”(氨基酸序列);它还会观察蛋白质的三维形状、二级结构(例如某部分是卷曲还是螺旋)、它接触了多少水分,甚至还有一份关于它功能的清单(功能注释)。

核心问题在于:这个大脑是如何将这些不同类型的信息融合在一起的? 它是将它们分别存放在不同的抽屉里,还是将它们搅拌成一杯平滑的奶昔?

理解的“层级蛋糕”

把 ESM3 想象成一座 48 层高的摩天大楼。信息从底部(第 0 层)进入,一直向上传输到顶层。作者使用了一份“几何图谱”(大脑内部几何结构的地图)来观察这些不同的信息流在沿着大楼向上移动的过程中是如何分布的。

1. 大分离阶段(第 0–24 层)
当信息刚进入大楼时,不同类型的数据就像一群拒绝交谈的派对宾客。

  • 物理类宾客(序列、三维结构、二级结构和水暴露度)最初处于各自独立的角落。
  • 功能类宾客(关于蛋白质“做什么”的列表)则更加孤立。它待在一个完全不同的房间里,从未与其他宾客交集。
  • 在向大楼上半部分移动的过程中,这些群体实际上变得更加分离,在第 24 层左右达到了隔离的峰值。这就像是大楼正在将宾客组织成严格、互不往来的小圈子。

2. 大融合阶段(第 25–35 层)
接着,神奇的事情发生了。在第 25 层到第 35 层之间,物理类宾客不再互相忽视,而是合并到了一个共享的舞池中。

  • 到达顺序: 三类基于结构的宾客(三维形状、二级结构和水暴露度)从一开始就是最好的朋友。他们立即就手牵着手。
  • 迟到者: 序列(氨基酸配方)是最害羞的一个。它一直待在角落里,直到第 28 层才加入舞池,在结构宾客对齐之后才姗姗来迟。
  • 结果: 到达第 35 层时,所有四种物理模态都融合进了一个统一的低维“云团”中。它们不再是独立的,而是一个统一的团队。

3. 孤独的狼:功能注释
这是最令人惊讶的部分:功能注释(“它做什么”的列表)从未加入这场派对。

  • 尽管物理模态融合到了一个共享空间,但功能数据在所有 48 层中始终保持在完全独立的、正交(呈 90 度角)的维度上。
  • 作者测试了这是否是因为功能数据是“全蛋白质”层面的(整个蛋白质一个标签),而其他数据是“逐残基”层面的(每个微小部分的标签)。他们加入了逐残基的功能数据,猜怎么着?它依然保持独立。
  • 这表明大脑选择将功能放在一条单独的轨道上,不是因为数据的格式问题,而是因为其学习组织信息的方式。

这(是什么)以及这(不是什么)

作者非常小心地排除了一些显而易见的解释:

  • 这不仅仅是数学: 如果你使用完全相同的建筑,但赋予它随机的、未经训练的权重(一个“随机初始化的模型”),融合永远不会发生。宾客们会永远保持分离。这证明了融合是一种学习到的属性,而不仅仅是简单相加产生的副作用。
  • 这不只是一个平均技巧: 作者担心也许他们只是在蛋白质层面进行了“平均”,从而使数据看起来像是融合了。他们检查了单个残基(在不进行平均的情况下),发现融合依然存在。这种融合是真实的,发生在单个组成部分层面,而非仅仅是整体层面。
  • 这与蛋白质的长度无关: 无论蛋白质长短,都不会改变融合发生的时间。然而,无序性会产生影响。具有大量“卷曲”(无序部分)的蛋白质融合得稍晚,而折叠良好的螺旋蛋白融合得更早。
  • 它是通用的: 他们在来自 12 种不同生物的 5,555 种蛋白质上进行了测试,涵盖了细菌、古菌和真核生物(包括人类)。每种生物都在完全相同的第 35 层达到了融合峰值。这种模式被锁定在模型的设计之中,而不仅仅是人类蛋白质的特质。

融合的“形状”

当融合发生时,数据并不是坍缩成一个点或随机扩散。

  • 当各组最为分离时,“有效秩”(衡量数据使用的维度的一种度量)降至约 3,然后在融合区扩展到约 85 个维度。
  • 数据重新组织了其方差:它不再是组间不同,而是变为组内不同。
  • 至关重要的是,大脑从未失去辨别所属模态的能力。即使在融合区,一个简单的探测器仍能在全空间内以 100% 的准确率识别出来源。这种融合是一种受控的重组,而非混乱的模糊。

核心结论

研究表明,ESM3 拥有一种非常具体且有序的思考方式:

  1. 它首先为结构和序列构建独立的、专门化的特征。
  2. 它等到网络的中部(大约在第 35 层)才将所有物理世界的数据(形状、序列等)融合为一个统一的表示。
  3. 它将“功能标签”(蛋白质的功能)保留在一条完全独立的平行轨道上,绝不让它们与物理数据混合。

这并非随机模式,而是这个特定的 14 亿参数模型在整个生命之树中采用的一种学习到的、通用的策略。作者指出,虽然这解释了模型如何组织数据,但他们尚未证明为什么这种特定的排列是最优的,或者这种现象是否适用于更大规模的闭源版本。但对于他们研究的这个开放版本而言,地图已经清晰:结构融合,序列晚到,功能独立。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →