Discretization-Aware Fine-Tuning for Quantum Machine Learning with Chemical Foundation Models
本文引入了离散化感知微调(Discretization-Aware Fine-Tuning, DAFT),这是一种通过使预训练化学基础模型进行适配,以最小化数据量化过程中的跨类碰撞,从而使量子机器学习模型能够在信息受限的分子属性预测任务中超越经典基准的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在构建实用量子计算机的竞赛中,科学家们往往痴迷于机器本身:它有多少个量子比特、能保持状态多久,以及它抵抗噪声的能力有多强。然而,对于许多实际任务而言,瓶颈并不在于硬件的效能,而在于向其输入信息的难度。量子计算机使用的是离散比特的语言,就像一系列要么开启、要么关闭的电灯开关。而现实世界的数据,例如药物分子的复杂化学结构,则存在于一个充满无限色彩与变化的连续且流动的世界中。试图将这种丰富且连续的数据强行塞入一个微小、僵硬的量子寄存器,就像试图将一加仑的水倒入一个针尖大小的小杯子;大部分信息都会溢出,剩下的部分往往也是原始数据的扭曲且无法辨认的版本。这个问题在化学领域尤为突出,研究人员希望利用量子机器来预测分子的行为,但目前的化学数据转化为量子代码的方法往往会丢失那些进行准确预测所需的关键细节。
一支研究团队现在直接针对这一翻译问题展开了攻坚,他们并非通过建造更大的机器,而是通过教导计算机在进入量子电路之前如何以不同的方式看待数据。在一项专注于预测药物分子是否能穿过血脑屏障(这是治疗神经系统疾病的关键步骤)的研究中,该团队证明了数据的准备方式与处理它的算法同样重要。他们发现,如果只是简单地将标准的化学数据喂给量子分类器,机器会表现得很吃力,因为不同的分子被压缩成了相同的数字代码,导致它们变得无法区分。通过引入一种专门考虑这种数字压缩过程的新型训练方法,他们能够重新塑造数据,使不同的分子即使在被简化为少量比特后仍能保持其独特性。结果显示,这种量子模型不仅能达到经典计算机的性能,在特定条件下甚至实现了超越,这证明了只要管理好信息瓶颈,即便是在当今有限的硬件上,实现量子优势也是可能的。
问题的核心在于如何将数据加载到量子计算机中。为了运行计算,分子必须被转换为符合机器内存容量的一串由零和一组成的字符串。在这项研究中,研究人员使用了一个强大的预训练人工智能模型,即“基础模型”(foundation model),该模型已经从数百万个分子中学习到了化学的通用语言。这个模型为每个分子生成了一个丰富的、高维度的描述,捕捉到了细微的结构细节。然而,为了将这种描述放入较小的量子寄存器中,研究人员必须对其进行剧烈的压缩,将一个复杂的数值向量转化为一段简短的二进制字符串。正是这个压缩步骤出了问题。由于压缩过于粗糙,许多不同的分子最终拥有了完全相同的二进制代码。用研究人员的话说,这些被称为“碰撞”(collisions)。如果两个具有不同性质的分子——一个能穿过血脑屏障,另一个不能——共享同一个代码,那么无论是量子计算机还是经典计算机都无法分辨它们。机器接收到了针对两个不同问题的相同输入,被迫进行猜测,从而导致准确率低下。
研究人员意识到,传统的模型训练方式是不够的。通常情况下,科学家训练模型是为了在平滑且连续的空间中分离不同的数据类别,并希望这种分离在数据被压缩后能自然延续。但研究表明,当压缩如此剧烈时,这种方法就会失效。一个模型可能在其内部数学逻辑中完美地分离了两个分子,但如果它们落在了一个在压缩过程中会被舍入掉的数字边界的两侧,它们仍然会发生碰撞。研究人员需要一种能够理解压缩过程本身的方法。他们开发了一种被称为“离散化感知微调”(discretization-aware fine-tuning)的技术。这涉及一个两步走的训练过程:首先,他们对模型进行“预热”,以确保它能大致区分这两类分子;接着,在第二个更为关键的阶段,他们加入了一个特殊的惩罚项。这个惩罚项不仅仅关注模型判断的正误,它还会计算两个不同的分子在压缩后落入同一个数字箱(digital bin)的概率。如果模型学会了以尊重数字边界的方式将这些分子推开,惩罚项就会减少。这迫使模型学习一种能够确保最重要的化学特征在被简化为少量比特后依然得以保留的表达方式。
当他们测试这种新方法时,差异非常显著。如果没有这种特殊的训练,量子计算机面对的是一个混乱的输入,成千上万对不同的分子发生了碰撞。机器的准确率很低,其表现甚至不如在相同压缩数据上运行的简单经典计算机。人们常吹捧的量子优势在此时完全消失了,因为输入数据过于损坏。然而,一旦研究人员应用了离散化感知微调,碰撞的数量就大幅下降,从数千次降至接近于零。分子现在被分配了能够保留其差异性的唯一代码。有了这些干净的输入,量子计算机的表现大幅飙升。其准确率提升了超过十二个百分点,这是一个巨大的飞跃,使其从一个挣扎的工具转变为一个高效的分类器。
然而,最显著的发现是这种改进如何影响量子机器相对于经典机器的表现。当研究人员将量子电路与标准逻辑回归模型(一种简单且成熟的经典算法)进行对比时,两者都被喂入了完全相同的压缩位字符串。在没有采用这种新训练方法的情况下,经典模型轻松获胜,比量子电路高出六个百分点。量子机器受到了混乱数据的阻碍。但当应用了新的训练方法后,情况发生了逆转。虽然由于数据变得更干净,两个模型都有所提升,但量子机器的进步幅度远大于经典模型。量子电路的准确率提升了超过十二个百分点,而经典模型仅提升了约三个百分点。在十个量子比特的水平上,量子模型的准确率达到了88.3%,击败了经典模型的85.5%。这并非偶然,该结果在多次随机试验和不同的统计检查中均保持一致。
为什么量子机器从更干净的数据中获益更多?研究人员解释说,这两类计算机处理信息的方式有着本质的区别。在这种特定的设置下,经典模型的作用类似于一个线性排序器:它观察比特并画出一条直线来分隔类别。它可以随着噪声的减少而变得更好,但受限于其线性本质。相比之下,量子计算机利用一种称为“纠缠”的过程将量子比特连接在一起。这使得它能够检测到比特之间复杂的、高阶的模式与相互作用,而简单的线性模型无法察觉这些模式。当数据杂乱无章时,量子机器无法找到这些模式。但一旦训练方法清除了碰撞并呈现了结构化的数据,量子机器就能充分利用其寻找隐藏相关性的能力。缺乏这种观察复杂交互能力的经典模型,无法像量子机器那样有效地利用干净的数据。
研究结论指出,要让量子机器学习在现实世界中取得成功,特别是在数据复杂且硬件受限的化学领域,我们不能仅仅专注于构建更好的电路。我们还必须设计更好的方式,将数据喂入其中。由当前小型量子寄存器造成的“信息瓶颈”必须在流水线的最开始阶段得到解决,即通过塑造数据表示来适应机器的约束。研究人员展示了通过将连续的化学描述与量子比特的离散特性相对齐,可以释放出真正的优势。这项工作表明,实现化学领域实用化量子计算的路径,并不一定非要等待大规模、无误差的机器出现。相反,它需要一种更聪明的方法来将现实世界转化为量子语言,确保信号在压缩过程中得以存续,从而让机器能够发挥其所长。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。