蛋白质是生命的动力源泉,是驱动维持我们生命化学过程的微型分子机器。为了发挥功能,蛋白质必须折叠成特定的、稳定的三维形状,就像一条长而灵活的链条扭转成一个精确的结一样。科学家们已经非常擅长预测这条链的主干,即支撑结构的中心脊柱。然而,最后也是最关键的一步涉及排列从主干中长出的较小的化学分支,即侧链。这些分支决定了蛋白质如何与其他分子(例如试图与其结合的药物)进行相互作用。如果这些侧链的位置稍有偏差,蛋白质的功能就可能失效,或者药物可能会错过其目标。虽然现代计算机程序可以高度可靠地预测主干形状,但它们往往难以如此精确地定位这些侧支,这在我们的有效药物设计能力方面留下了一个空白。
纽卡斯尔大学的研究人员开发了一种新方法来弥补这一差距,采用了一种结合了经典计算机与量子计算技术的方法。他们的目标是利用名为 AlphaFold 的强大工具预测出蛋白质结构,并以此为基础优化侧链的位置,以找到能量最低的最稳定排列。在蛋白质折叠的世界里,寻找这种完美排列是一个极其困难的谜题。侧支排列的可能方式增长得极其迅速,以至于一旦蛋白质变得足够大,即使是最快的超级计算机也无法检查每一种可能性。这被称为 NP 难问题,这类问题的特征是随着问题规模的增加,其难度会呈爆炸式增长。
为了解决这个问题,该团队构建了一个流水线,首先使用标准软件准备蛋白质数据,为每个侧链选择一组可控的可能形状。然后,他们将这个精炼后的问题交给一种被称为量子近似优化算法(QAOA)的量子算法。该算法旨在通过搜索海量可能性来找到最佳解决方案。在将量子计算机用于此类任务时,一个主要的障碍是它们天生会探索所有组合,包括许多物理上不可能存在的组合,例如单个侧链同时处于两个位置。研究人员通过设计一个特殊的起点和一套关于量子系统如何演化的特定规则解决了这个问题。他们从一个每个位置出现的概率都相等的初始状态开始,然后使用一种循环混合过程来打乱这些可能性,且从未允许系统脱离单一位置排列的有效范畴。这种巧妙的设计消除了对通常会减慢计算速度的复杂惩罚项的需求,使系统能够完全专注于寻找最低能量状态。
该团队在一种名为牛胰蛋白酶抑制剂的特定蛋白质上测试了他们的方法,涵盖了 AlphaFold 预测的高置信度和中等置信度区域。在原始预测已经非常强大的区域,量子方法基本与现有结果一致,偶尔能发现略好一些的排列。然而,在原始预测不太确定的区域,新方法展现出了显著的前景。在这些中等置信度区域,量子方法找到了更稳定的排列,能量改善平均超过 8 千卡/摩尔,峰值甚至超过 16 千卡/摩尔。这些结果表明,该方法在修正初始预测较弱区域的错误方面特别有效。
至关重要的是,研究人员不仅提出了这些改进,还开发了一种衡量量子计算机在问题规模增长时,为了可靠地找到最佳答案需要多少次“尝试”(或称“采样次数”)的方法。他们发现,虽然所需的尝试次数确实会增加,但其增长速率对于高性能计算而言仍处于可控范围内,远低于某些类型蛋白质在经典方法中所表现出的指数级爆炸增长。这项研究证实,这种混合流水线可以成功地重新排列侧链以降低蛋白质结构的能量,为提高药物研发的准确性提供了一种潜在工具。目前这项工作仍处于模拟阶段,是在强大的图形处理器而非物理量子硬件上运行的,但这证明了其数学框架是健全的,并已准备好在未来的真实量子设备上进行测试。通过将优化过程与初始预测质量解耦,该方法提供了一种可靠的方式,无论起始点多么理想,都能在给定的选项集中搜索到最佳可能的结构。
技术摘要:用于蛋白质侧链打包的量子近似优化算法
问题陈述
蛋白质侧链打包是蛋白质折叠中的一个关键子问题,它决定了氨基酸侧链(旋转异构体)相对于固定骨架的三维排列。这一过程对于基于结构的药物发现至关重要,因为结合位点是由这些侧链构象定义的。虽然 AlphaFold2 等工具可以可靠地预测蛋白质骨架,但其侧链定位与实验数据的偏差可能高达 20%。恢复固定骨架下的最低能量旋转异构体分配是一个 NP 难的组合优化问题。经典的启发式算法(如 Rosetta 的随机蒙特卡洛搜索)无法保证全局最优性。本文提出了一种混合量子-经典流水线来解决这一问题,通过将侧链能量最小化重新表述为可通过量子近似优化算法 (QAOA) 求解的二次无约束二进制优化 (QUBO) 问题。
方法论
所提出的流水线分为三个阶段运行:预处理、QAOA 优化和后处理。
预处理与固定骨架简化:
利用 PyRosetta,该流水线分析蛋白质子部分(例如,牛胰蛋白酶抑制剂 5PTI),以固定源自 AlphaFold2 的骨架坐标。它根据 Dunbrack 库生成离散的有效旋转异构体库。为了管理计算复杂度,通过基于单体能量的轮询选择对旋转异构体集进行剪枝,限制每个残基的候选数量 (R)。这使得任务简化为从剪枝后的集合中为每个残基选择恰好一个旋转异构体,以最小化总构象能量。
QUBO 公式化:
将配对能量函数(包含单体项和二体相互作用项)使用 Pauli-Z 算符编码进代价哈密顿量 (HC) 中。采用单热编码(one-hot encoding)方案,为每个有效的旋转异构体分配一个量子比特。这导致量子比特数量呈线性增长 (MN,其中 M 为残基数,N 为平均旋转异构体数),但在最坏情况下,代价哈密顿量的项呈二次方规模增长,尽管实际的稀疏性将其降低至 O(MN⋅d)。
保持约束的 Ansatz(拟设):
为了在不依赖代价函数中惩罚项的情况下强制执行“单热”约束(即每个残基选择恰好一个旋转异构体),作者引入了一种特定的 Ansatz:
- 初始状态: 系统初始化为一个 W 态,即每个残基子寄存器中所有单激发基态的等叠加态。这确保了系统起始于有效的汉明权重为 1 的子空间。
- 混合器哈密顿量: 使用循环 XY 环形混合器代替全连接图混合器(后者在两量子比特门上的扩展为 O(MN2))。这种拓扑结构将相互作用限制在闭环中相邻的旋转异构体之间。该拓扑结构保持了汉明权重(确保在演化过程中维持有效性),并将两量子比特门的扩展降低至 O(MN)。
- 优化策略: 采用热启动(warm-starting)方法,其中更深层电路 (p) 的参数使用较浅层电路的优化参数进行初始化,并对新层进行零填充并加入高斯噪声以逃离鞍点。
评估指标:
- ΔE: QAOA 结果与 AlphaFold 基准之间的能量差 (EQAOA−EAF)。结果被分类为胜出 (Wins, ΔE<−1.5 kcal/mol)、平局 (Ties, ∣ΔE∣≤1.5 kcal/mol) 或失败 (Losses, ΔE>1.5 kcal/mol)。
- S(N)(渐近采样规模指标): 定义了一个指标,用于估算恢复具有 99.99% 概率的全局最小能量构象 (GMEC) 所需的采样次数(shots)。该指标是针对实验解析的真值(针对小型子系统进行穷举搜索)计算的,旨在将优化器质量与 AlphaFold 基准的质量解耦。
关键结果
该流水线在 GPU 上通过经典的态矢量模拟在 5PTI 蛋白质上进行了评估。
- 高置信度区域 (pLDDT > 90): 在 AlphaFold 的骨架和侧链预测高度可靠的区域,QAOA 流水线的改进非常有限。在 5–14 个量子比特的运行中,胜出率在 15.6%,集中在特定的残基窗口(例如 60–63)。随着量子比特数增加到 18 和 22,胜出率降至零,结果主要变为平局。作者将其归因于“离散化惩罚”:将已经接近最优的连续 AlphaFold 构象强制纳入有限的离散库中,往往会导致更高的能量状态,这并非因为量子求解器失败,而是因为离散搜索空间比连续基准更具限制性。
- 中等置信度区域 (pLDDT ≈ 80): 在 AlphaFold 侧链放置不太可靠的区域,该流水线取得了显著改进。在 1,500 次运行(5–14 个量子比特)中,54% 为胜出,平均改善为 -8.114 kcal/mol,峰值为 -16.265 kcal/mol。作者澄清,这些收益反映了 AlphaFold 基准在这些区域的弱点,而非量子求解器本身具有内在优越性,因为 S(N) 证实了优化器无论基准如何,都能在候选集中找到最优选项。
- 采样规模 (S(N)): 所需采样次数的拟合增长率 (e0.31N) 在中等旋转异构体灵活性下低于经典的穷举搜索速率。该指标表明,所需的采样开销对特定的局部能量景观和残基选择敏感,而不仅仅取决于总量子比特数。
意义与主张
本文声称提出了一个有效的混合量子-经典流水线,成功解决了 NP 难的侧链打包问题。其主要贡献包括:
- 保持约束的 Ansatz: 一种结合了 W 态初始化和循环 XY 环形混合器的创新组合,在结构上强制执行单热有效性,从而消除了对惩罚项的需求,并将两量子比特门的扩展从 O(MN2) 降低至 O(MN)。
- 独立于基准的评估: 引入了 S(N) 指标,允许针对理论最优值 (GMEC) 评估 QAOA 性能,而不受起始 AlphaFold 结构质量的影响。这区分了求解器失效与连续问题离散化带来的固有局限性。
- 概念验证: 研究表明,量子优化可以降低与 AlphaFold 基准相比的构象能量,特别是在基准较弱的区域。
作者对更广泛的影响保持谨慎,指出在中等置信度区域观察到的能量改善可能是由于基准较弱导致的人工现象,而非证明了量子求解该问题的优势。他们强调,需要通过结合结合亲和力和结构稳定性进行下游验证,以确立该方法的药物研发实用性。此外,针对其他蛋白质的 S(N) 预算的普适性,以及硬件噪声对实际量子设备的影响,仍是悬而未决的问题。
每周获取最佳 quantum physics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。