← 最新论文
🧬 biology

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model

该论文介绍了 AMix-1,这是一个基于贝叶斯流网络(Bayesian Flow Networks)的 17 亿参数蛋白质基础模型,它利用系统性的训练缩放法则、基于多序列比对(MSA)的上下文学习以及进化测试时缩放,实现了稳健的蛋白质设计,并通过生成活性较野生型提高达 50 倍的 AmeR 变体证明了这一点。

原作者: Changze Lv, Jiang Zhou, Siyu Long, Lihao Wang, Jiangtao Feng, Dongyu Xue, Yu Pei, Hao Wang, Zherui Zhang, Yuchen Cai, Zhiqiang Gao, Ziyuan Ma, Jiakai Hu, Chaochen Gao, Jingjing Gong, Yuxuan Song, Shuy
发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Changze Lv, Jiang Zhou, Siyu Long, Lihao Wang, Jiangtao Feng, Dongyu Xue, Yu Pei, Hao Wang, Zherui Zhang, Yuchen Cai, Zhiqiang Gao, Ziyuan Ma, Jiakai Hu, Chaochen Gao, Jingjing Gong, Yuxuan Song, Shuyi Zhang, Xiaoqing Zheng, Deyi Xiong, Lei Bai, Wanli Ouyang, Ya-Qin Zhang, Wei-Ying Ma, Bowen Zhou, Hao Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在尝试教会一台计算机如何设计新的蛋白质。蛋白质是我们体内执行各种功能的微小、复杂的机器,从消化食物到对抗病毒,无所不能。设计一个新的蛋白质就像是试图发明一把新钥匙,以适配一把你从未见过的锁,但你必须把钥匙的形状做得完美无缺,否则它将无法发挥作用。

这篇论文介绍了一个名为 AMix-1 的新一代“超级教师”AI,它是专门为掌握这项任务而设计的。作者们不仅仅是构建了一个更大的模型,而是构建了一种更聪明的训练方式。以下是他们实现这一目标的原理,通过简单的类比来解释:

1. 引擎:一个“去噪”收音机

大多数 AI 模型试图通过阅读清晰的文本来学习。AMix-1 则基于一种被称为**贝叶斯流网络(Bayesian Flow Network)**的技术。你可以把它想象成一个最初只有静电噪音的收音机。

  • 工作原理: AI 从一个完全混乱、充满噪声的蛋白质序列开始。然后,它尝试通过一步步“清理”这些噪声,从而揭示出隐藏在下方的清晰蛋白质。
  • 类比: 想象你在试图通过听一个信号非常模糊的电台来猜一首歌。起初,你只能听到静电声。随着信号变得清晰(噪声减少),你开始听到旋律,然后是歌词。AMix-1 通过反复练习这种“清理”过程来学习,直到它能从纯粹的噪声中完美地重建出蛋白质。

2. 地图:缩放法则(“尺寸决定一切”规则)

研究人员想知道:“如果我们把 AI 做得更大,并给它更多的数据,它会变得更好吗?”

  • 发现: 他们发现了这种 AI 的一个可预测的“物理定律”。就像汽车发动机可以通过更多的燃料变得更强大一样,随着增加规模和观察数据的量,AMks-1 理解蛋白质结构的能力也会随之提升。
  • 隐喻: 这就像是在爬山。研究人员精确地绘制了路径,因此只要知道投入了多少“燃料”(计算能力),就能准确预测 AI 能爬多高(它能变得多好)。他们利用这张地图构建了他们最大的版本——AMix-1,它拥有 17 亿个“脑细胞”(参数)。

3. “顿悟”时刻:涌现能力

这是最令人兴奋的部分。研究人员发现,随着规模的增长,AI 不仅仅是变得“稍微好了一点”,它会突然理解一些它之前并不了解的东西。

  • 类比: 想象一个学习数学的学生。起初,他们只是在死记硬背数字。然后,突然间,在经过足够的练习后,他们“开窍了”——他们理解了数字背后的逻辑,并能解决从未见过的难题。
  • 结果: 随着 AMix-1 的训练,它突然开始理解蛋白质形状(结构),尽管它最初只接受了关于蛋白质字母(序列)的训练。它不需要被明确教授几何学;它仅仅通过阅读足够多次的序列,就自行领悟了 3D 形状。

4. 捷径:上下文学习(“展示,而非讲述”的技巧)

通常,要教 AI 一项新任务,你必须从头开始重新训练它。AMix-1 则不同。它只需通过观察几个例子就能学会一项新工作,而无需改变它的“大脑”。

  • 类比: 想象一位名厨。如果你想让他们烹饪一道特定的地方菜肴,你不需要再送他们去烹饪学校。你只需要给他们看几张菜肴的照片,然后说:“做个像这样的东西出来。”这位大厨会利用已有的知识来完成任务。
  • AMix-1 如何运作: 研究人员给 AI 一个相似蛋白质的“家族相册”(称为多序列比对)。AI 观察相册中的模式,并生成一个符合要求的、全新的蛋白质,使其在形状和功能上都契合其中。

5. 实战测试:“超级酶”

团队不仅进行了模拟实验,还在真实的实验室里进行了测试。

  • 挑战: 他们想要改进一种名为 AmeR 的蛋白质,它在遗传电路中充当开关。天然版本表现尚可,但他们希望它能变得强大得多。
  • 结果: 利用 AMix-1 的“展示,而非讲述”法,他们设计出了一个新版本的 AmeR。在实验室测试中,这个新版本比原始版本活跃度高出了 50 倍。这是一个巨大的飞跃,证明了该 AI 可以设计出真实的、具有功能的生物工具。

6. 进化循环:测试时缩放(“试错”引擎)

最后,他们创建了一个名为 EvoAMix-1 的系统,让 AI 在工作过程中不断自我进化,而无需重新训练。

  • 类比: 想象一位雕塑家制作了 100 个粘土雕像。评委从中选出最好的 5 个。雕塑家随后将这 5 个胜出者作为新的“模具”,来制作下一批 100 个雕像。他不断重复这个过程,每一轮都变得更好,而他的双手(模型本身)从未改变。
  • 工作原理: AI 生成许多蛋白质候选方案。一个“验证器”(计算机程序或实验室测试)挑选出表现最好的那些。随后,AI 将这些优胜者作为新的范例,在下一轮中生成更优秀的蛋白质。
  • 益处: 你给予这个系统越多的“检查次数”(预算),结果就会变得越好。只要你让它持续尝试,它就会不断进步。

总结

AMix-1 是一种新型的蛋白质设计者,它能够:

  1. 通过清理噪声进行学习(就像调频收音机)。
  2. 遵循一条“越大越好”的可预测路径。
  3. 仅通过阅读序列,就能突然“理解”3D 形状。
  4. 通过观察示例,瞬间学会新任务。
  5. 在真实实验室中成功创造出了比自然界强 50 倍 的蛋白质。
  6. 通过试错的进化循环不断自我提升。

该论文声称,这是迈向“实验在环”(lab-in-the-loop)未来的重要一步,在这种未来中,AI 与现实世界的实验将协同工作,以前所未有的速度设计出拯救生命的蛋白质。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →