← 最新论文
🧬 biology

Retrieval and competition: how a protein foundation model starts a protein

本文揭示,ESM2-8M 蛋白质语言模型并非通过直接识别被掩蔽的残基来预测甲硫氨酸起始这一普遍生物学规则,而是通过一个复杂且分布式的计算回路检索统计先验,从而表明高模型置信度可能反映的是统计默认值而非真实的生物学证据。

原作者: Piotr Jedryszek, Oliver M. Crook

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Piotr Jedryszek, Oliver M. Crook

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象你有一位名叫ESM2的非常聪明、学识渊博的图书管理员。这位管理员读过数百万本书(蛋白质序列),并以预测新故事第一个词的能力而闻名。

在生物学界,有一条简单的规则:几乎每个蛋白质故事都以“甲硫氨酸”这个词开头(我们称之为**"M"**)。由于这位管理员读过如此多的书,他们非常有信心:如果你给他们一本第一个词被隐藏(掩码)的故事书,答案就是"M"。

但这里有一个谜题,也是本文要解决的:这位管理员究竟是在查看故事中的线索来推断这一点,还是仅仅出于习惯在猜测?

本文的作者决定窥探这位管理员大脑(计算机模型)背后的运作机制,看看他们如何做出这个猜测。他们发现,管理员并非真正在“阅读”故事的第一个位置来寻找"M"。相反,他们使用了一个巧妙的多步技巧,涉及一本参考书、一个特殊查询和一场拔河比赛

以下是这个技巧的分解说明:

1. “参考书”(BOS 标记)

在管理员的办公室里,每个文件的开头都有一个特殊的标记,称为BOS(序列开始)。通常,人们认为这只是一个无聊的标签,就像一张写着“从这里开始”的便利贴。

本文发现,对于管理员来说,这张便利贴实际上是一本参考书。在这本书里,管理员永久地写下了答案:"M"。无论你在读什么故事,这本书都保持不变。它是这条规则的静态记忆。

2. “特殊查询”(侦探的便条)

当管理员需要猜测第一个词时,他们不会只看第一个位置。他们必须派遣一名侦探(注意力头)去查阅参考书。

但是,侦探只有在持有特殊便条(一个“查询”)时才能前往参考书,这张便条上写着:“我正处于故事的开头。”

  • 这张便条是如何制作的? 它不是一步完成的,而是在管理员大脑的多个层级中逐步构建的。早期层级中的其他侦探会查看“开始”标签,并将该信息传递下去,慢慢组装成一张写着“我们处于位置 0!”的便条。
  • 转折: 如果侦探站在位置 5(故事的中间),他们构建的便条看起来就不同了。它不会说“去参考书”,而是说“忽略参考书”。

3. “拔河比赛”(电路竞争)

这是最重要的部分。管理员并非只有一个声音。他们有许多内部声音(电路)在喊出预测。

  • 声音 A(位置先验): 只要侦探处于位置 0,这个声音就会一直大喊"M!”它既响亮又一致。
  • 声音 B(上下文电路): 这些声音会倾听故事的其余部分。如果故事是关于一串"A"(丙氨酸)的长链,声音 B 就会大喊:“不!是'A'!”

结果:

  • 在故事的开头(位置 0),声音 A 通常最响亮,因此管理员预测为"M"。
  • 在故事的中间,声音 A 仍然在大喊"M!”(因为参考书始终存在),但声音 B 大喊"A!”的声音要大得多。管理员听从最响亮的声音,因此他们预测为"A"。

本文发现,管理员没有一个“静音按钮”可以在故事中间让声音 A 闭嘴。相反,声音 A 始终存在;它只是被上下文压倒了。

4. “几何门控”(RoPE)

管理员如何知道自己在故事中的位置以构建正确的便条?他们使用一种名为RoPE(旋转位置编码)的数学工具。

把 RoPE 想象成随着你在故事中移动而旋转的指南针时钟指针

  • 在位置 0,指南针指向北方。这与“参考书”完美对齐,使侦探能够找到它。
  • 在位置 10,指南针指向南方。这使侦探错位,因此他们找不到参考书,即使那本书仍然坐在那里。

本文发现,这种对齐通过两种方式发生:

  1. 方向: 指南针指向正确的方向(角度对齐)。
  2. 强度: 侦探的声音会根据位置变大或变小(范数放大)。

如果你弄坏了指南针(移除 RoPE),管理员就会感到困惑。他们开始在故事的每个位置大喊"M!”,而不仅仅是在开头,因为他们再也无法区分开头和中间了。

主要结论

本文得出结论,管理员在预测蛋白质开头为"M"时的信心,并非因为他们识别出了该特定位置上的生物信号。

相反,这是因为:

  1. 他们从“参考书”(BOS)中检索了存储的规则。
  2. 他们使用由一群侦探构建的“特殊便条”来确认自己处于开头。
  3. 他们在与试图根据故事其余部分进行猜测的其他声音的“拔河比赛”中获胜。

这为什么重要?
作者警告说,如果管理员很有信心,这并不意味着他们“理解”了生物学。他们可能只是凭借统计默认值在拔河比赛中获胜。如果某种蛋白质的生物学特性很奇特(例如,它以"M"以外的东西开头),管理员仍然会猜测"M",因为他们的内部“参考书”是这么说的,而他们尚未学会这个例外。

要真正信任科学中 AI 的预测,我们不能只看答案;我们必须理解电路(侦探、指南针和拔河比赛),以查看 AI 是在使用真实证据,还是仅仅在碰运气。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →