← 最新论文
⚛️ quantum physics

"Train classical, deploy quantum" requires rethinking generalization

本文表明,使用矩匹配损失(如 MMD2^2)进行经典训练的量子生成模型,其泛化能力往往不如基于似然训练的模型,这暗示了“经典训练、量子部署”的范式需要新的方法,以直接针对泛化能力,而非仅仅依赖于作为代理指标的收敛训练损失。

原作者: Snehal Raj, Natansh Mathur, Alejandro Perdomo-Ortiz

发布于 2026-09-01
📖 1 分钟阅读🧠 深度阅读

原作者: Snehal Raj, Natansh Mathur, Alejandro Perdomo-Ortiz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代科学繁忙的世界中,研究人员正越来越多地转向模仿亚原子世界奇特概率规则的计算机,以解决那些让传统机器束手无策的问题。这些量子计算机不仅仅是更快地处理数字;它们能够自然地生成新数据,创造出看起来像现实世界现象的数字模式,从新分子的形状到遗传密码的结构。为了使这些机器发挥作用,科学家们经常使用一种被称为“经典训练,量子部署”的策略。这种方法涉及在标准且强大的计算机上训练模型,因为在那里的计算成本低廉且容易,然后将训练好的模型交给量子设备来产生最终结果。人们希望量子机器能够生成复杂的、真实的样本,而这是经典计算机自身永远无法独立生产的。然而,一个关键的问题仍然存在:仅仅因为一个模型在计算机上成功完成了训练,它是否真的理解了数据的底层规则,还是仅仅记住了展示给它的示例?

一个研究小组试图通过对各种生成模型进行测试来回答这个问题。他们将包括经典设计和专为量子硬件构建的设计在内的十三种不同模型,与两类截然不同的数据进行了对比。第一个数据集是一个涉及比特串的数学谜题,其中一和零的数量必须完美平衡,这一约束适用于从十六到三十个比特的系统。第二个数据集取自现实世界的生物学,由来自特定生物组的数千个观察到的遗传序列组成。研究人员使用一种专注于匹配特定统计平均值的常用方法来训练这些模型,这种技术被广泛认为是一个模型学习正确的可靠标志。随后,他们让模型自由运行,生成数千个新样本,以观察模型是否能产生符合原始集合真实分布的有效且未见的数据。

结果揭示了模型在训练期间的表现与其在实际应用中的表现之间存在令人惊讶的脱节。研究人员发现,旨在匹配统计平均值的模型往往会收敛到这样一种状态:它们的训练得分非常出色,却无法生成新的、有效的数据。在数学谜题中,这些模型产生的字符串几乎全部是无效的,尽管拥有近乎完美的训练得分,却未能遵守游戏的基本规则。相比之下,使用另一种侧重于数据似然性的方法进行训练的模型,则始终能产生高质量、有效的样本。此前被信任为成功可靠指标的统计训练得分,结果被证明是预测模型能否真正泛化到新情况的糟糕指标。

这种失败不仅仅是一个小故障;它是训练方法本身的一个根本性局限。研究人员通过理论证明,一个模型可以完美匹配训练过程中使用的统计平均值,但仍仅覆盖可能有效结果中极小、呈指数级缩小的部分。两个完全不同的分布在通过这些特定平均值进行观察时可能看起来完全相同,但其中一个可能覆盖了整个有效数据的景观,而另一个则局限于一个单一且狭窄的角落。在他们的模拟中,他们构建了一个特定的例子,该模型完美匹配了每一个要求的统计平均值,但仅覆盖了 7% 的有效空间,实际上未能学习到数据的更广泛结构。这证明了低训练得分并不保证模型已经学习了规则;它只保证了模型已经匹配了训练过程所寻找的特定数值。

研究还表明,数据的类型至关重要。当研究人员将相同的训练方法应用于基因组数据集时,基于统计平均值训练的模型再次难以产生有效的遗传序列,而基于似然性的模型表现得更好。有趣的是,一种特定的量子模型确实能够产生有效数据,但这仅仅是因为其内部设计在物理上阻止了它生成无效字符串,而不是因为训练过程教会了它这样做。这强调了如果没有对输出进行直接检查,仅依赖训练得分是危险的。研究人员得出结论,目前这种在经典计算机上训练并部署在量子计算机上的策略需要进行重大反思。科学家们不能再假设低训练损失意味着模型已经准备就绪,而是必须直接测量模型生成新、有效样本的能力。未来的路径可能涉及改变训练目标以直接针对泛化能力,或者设计从一开始就具备必要约束的模型,从而确保量子优势是真实的,而不仅仅是一个拟合良好的得分所制造的幻象。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →