想象一下,你正在尝试创作一首新歌。你希望这首歌听起来属于某个特定的流派(比如“爵士乐”或“重金属”),但同时你又希望它是一首前所未闻的、新鲜原创的乐曲。
这正是科学家在设计新蛋白质(生命的构建模块)时所面临的挑战。他们希望创造出满足以下条件的蛋白质序列:
- 属于特定的家族(例如,某种特定的酶)。
- 具有生物学合理性(它们实际上能够折叠成三维结构并发挥作用)。
- 具有新颖性(不仅仅是现有蛋白质的复制品)。
这篇论文介绍了一种名为LineageFlow的新工具来解决这一问题。以下是其工作原理,通过简单的类比来说明。
问题:从“静态”开始
目前大多数用于创造蛋白质的 AI 模型,就像试图从白噪声(收音机里的杂音)或空白页开始创作一首爵士乐。
- 它们从一个完全随机的字母混乱开始。
- 它们试图一步步“清理”这些噪声,直到一首乐曲浮现。
- 缺陷:由于它们从零开始,AI 必须从头摸索出一切,包括爵士乐的基本规则(保守部分)。它经常忘记流派规则,导致生成的乐曲听起来像噪声或完全不同的流派。它在保持“家族”身份的同时融入新想法方面存在困难。
解决方案:LineageFlow(“家族树”方法)
LineageFlow 改变了起点。它不是从杂音开始,而是从一件家族传家宝开始。
祖先支架(传家宝):
在生成新蛋白质之前,该模型会查看该蛋白质类型的“家族树”。它使用一种称为祖先序列重建的技术,来推测数百万年前这种蛋白质的古老原始版本是什么样子的。
- 类比:想象你是一位爵士音乐家。你不是从寂静开始,而是从你曾祖父演奏的一首经典、知名的爵士标准曲开始。你知道核心旋律(保守部分)是正确且安全的。
结构化突变(即兴演奏):
该模型不试图从头重建整首乐曲。相反,它将生成过程视为在那首经典旋律之上进行即兴演奏。
- 它保持“传家宝”旋律(蛋白质中essential的、保守的部分)完整无损。
- 它只改变那些允许变化的部分(“独奏”部分)。
- 结果:新乐曲立刻就能被识别为爵士乐(高家族有效性),因为它拥有相同的根源,但独奏部分是新颖且富有创意的。
“重路由”功能:引导进化
论文还介绍了一个巧妙的技巧,称为重路由(Rerouting)。
- 场景:你正在那首爵士标准曲上进行即兴演奏。在乐曲进行到一半时,你希望确保新的独奏部分真的很好(例如,它需要更快,或更有活力)。
- 旧方法:你可能试图每一秒都去引导整首乐曲,这既令人疲惫,又往往会破坏流畅性。
- LineageFlow 方法(重路由):你在乐曲进行到一半时暂停音乐。你截取当前即兴演奏的快照,进行几次快速修改(突变),挑选出最佳版本(选择)并加以放大。然后,你从那个改进后的位置继续演奏。
- 类比:这就像定向进化(一种真实的实验室技术,科学家通过培育细菌来寻找更好的性状)。AI 在生成过程中模拟这种“突变 - 选择 - 放大”循环,将蛋白质推向特定目标(例如更稳定或更易溶),而不会失去其家族身份。
他们发现了什么?
作者在数千种不同的蛋白质家族(就像一个巨大的不同音乐流派图书馆)上测试了 LineageFlow。
- 更好的家族身份:与其他经常无法生成可识别的“爵士乐”歌曲(家族)的模型不同,LineageFlow 几乎总是能生成听起来完全符合预期流派的歌曲。
- 更好的结构:生成的蛋白质更有可能折叠成稳定的三维结构(更高的“合理性”)。
- 依然具有创造性:尽管它从古老的“传家宝”开始,但最终结果与现有蛋白质仍然非常不同(高新颖性)。
- 零样本成功:他们在模型训练期间从未见过的酶家族上测试了它。仅通过利用“家族树”逻辑,它就成功生成了看起来属于该类别的新的类酶序列,而无需额外训练。
总结
LineageFlow 是一种蛋白质生成器,它不再试图用一堆随机砖块建造房屋。相反,它从一个坚固、古老的基石(祖先蛋白质)开始,只翻新那些需要改变的房间。这确保了新房屋结构稳固,符合社区风格(蛋白质家族),并且仍然拥有独特、现代的设计。
技术摘要:LineageFlow
问题陈述
蛋白质工程需要生成在生物物理上合理、且能保持为目标家族或结构域可识别成员的同时,探索家族内多样性的序列。当前的离散生成模型,包括扩散和基于流的模型,通常从均匀单纯形噪声或掩码令牌破坏中初始化生成过程。作者认为,这些通用先验是“家族无关”的,并丢弃了由进化诱导的强位置特异性约束。因此,模型被迫从严重破坏的状态(“从头合成”)重建几乎每一个残基,包括高度保守的残基。这种负担导致家族控制力弱、合理性低,且难以维持可识别的家族 - 结构域结构。
方法论:LineageFlow
作者提出了LineageFlow,这是一种狄利克雷流匹配模型,它将蛋白质序列生成重新框架化为从进化支架出发的结构化突变,而非从通用噪声中合成。
1. 谱系先验初始化
LineageFlow 不使用均匀先验,而是利用源自祖先序列重建(ASR)的祖先先验来初始化生成过程。
- 构建:对于给定的蛋白质家族,作者构建多序列比对(MSA),推断最大似然系统发育树,并在根节点执行边缘 ASR,以获得残基的位点特异性后验分布。
- 表示:该根后验被编码为狄利克雷浓度参数(α(h,l)),定义了一个家族特异性的祖先先验 q0(h)(X)=∏lDir(x(l);α(h,l))。
- 机制:这种方法保留了保守支架(家族在此处不变),同时仅在真正可变的位点保留不确定性。因此,生成过程被建模为从该祖先分布向现存序列在概率单纯形上的连续输运。
2. 单纯形上的流匹配
LineageFlow 采用狄利克雷流匹配(DFM)。
- 轨迹:定义了一个条件概率路径 pt(x∣x1),其中狄利克雷质量随时间 t∈[0,1] 集中在目标顶点 x1 周围。
- 向量场:模型学习一个神经时间依赖向量场 v^(X,t;θ),将祖先先验输运至数据分布。漂移通过分类器参数化 p^θ(x1∣xt,t) 重建,最小化序列平均交叉熵损失。
- 理论保证:作者证明了谱系特异性的解析场满足单纯形上的连续性方程,确保了概率质量的守恒,并使轨迹保持在有效状态空间内。
3. 用于目标引导采样的重路由
为了在不进行每步预测器引导的情况下融入外部适应度目标,作者引入了重路由(Rerouting)。
- 过程:在中间时间 tint,生成轨迹暂停。应用一种受定向进化启发的“突变 - 选择 - 扩增”干预。
- 突变:提议核向粒子群注入多样性。
- 选择:根据适应度分数 J(X)(例如,合理性或特定属性预测器)对粒子进行重加权。
- 扩增:根据权重进行重采样。
- 理论基础:作者将重路由形式化为 KL 正则化选择问题,表明重加权后的分布在最大化预期适应度的同时,最小化了与提议定律的 KL 散度。
- 细化:选定的粒子随后通过基础流从 tint 整合至 t=1,以生成最终样本。
主要贡献
- 祖先先验与通用噪声:论文证明,从 ASR 衍生的谱系先验初始化显著优于均匀或掩码初始化的基线。它将生成从“从头”去噪转变为结构化突变,从而保留了保守支架。
- 流形保持引导:重路由提供了一种单步、中间时间的干预,将样本引导至目标,而无需在每个欧拉步进行梯度计算,经验上保持了家族有效性。
- 高保真生成:该模型实现了接近留自然序列的家族有效性,并提高了预测的结构置信度(合理性),同时保持了显著的多样性和新颖性。
实验结果
该模型在 8,886 个 Pfam-A 家族(RP35 数据集)上进行了评估,每种方法生成 1024 条序列。
- 家族有效性:LineageFlow 实现了 95.3% 的 top-1 家族准确率(Accfam),而均匀先验基线(DFM, EvoDiff)为 0%,仅基于 ASR 的基线(ASR-PSSM i.i.d.)为 92.8%。这表明,即使以家族标签为条件,通用噪声先验也无法生成可识别的家族成员。
- 合理性(可折叠性):LineageFlow 实现了 76.6 的平均 pLDDT,优于仅基于 ASR 的基线(70.8),并显著超越了 DFM(46.2)和 EvoDiff(45.4)。尽管 ProtBFN 在约大 8 倍的语料库上进行了训练,LineageFlow 仍优于预训练的 ProtBFN(71.9)。
- 新颖性与多样性:在可折叠样本(pLDDT ≥ 70)中,86.2% 满足最近邻同一性(NNId)<0.8,48.9% 满足 NNId <0.6,证明了在保持家族身份的同时具有深度的新颖性。
- 零样本酶生成:在三个留外酶家族的零样本设置中,带有重路由的 LineageFlow 在针对目标家族进行微调的情况下,保留了保守基序,并提高了溶解度和热稳定性代理分数。
- 理论验证:对“困难机制”(早期时间步)的分析表明,与均匀先验相比,ASR 先验为去噪器提供了更高的可恢复信号,从而实现了更高的贝叶斯最优准确率和更低的训练损失。
意义与主张
论文声称,LineageFlow 通过在生成先验中直接利用进化历史,为蛋白质序列生成建立了一个新范式。
- 机制:通过将通用噪声替换为系统发育信息的祖先支架,模型减少了生成早期步骤的歧义,使学习到的向量场能够专注于建模进化变异,而非重建保守结构。
- 实用性:重路由的引入实现了目标引导采样(例如,优化稳定性或溶解度),而无需每步引导的计算成本,使其适用于定向进化风格的任务。
- 局限性:作者指出,该方法依赖于高质量的 MSA 和系统发育推断。生成与家族特定的比对坐标绑定(将空位处理为固定掩码),而非显式建模插入缺失(indels)。此外,评估依赖于计算代理(例如 OmegaFold pLDDT、ESM-IF)和基于预测器的分数,意味着现实世界的功能验证仍有待测试。
这项工作表明,纳入明确的进化背景(谱系先验)对于实现高保真、家族感知的蛋白质设计至关重要,为标准的基于噪声的生成过程提供了强有力的替代方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。