← 最新论文
🤖 machine learning

Quantum Models with Multi-Stage Training for Compositional Concept Generalization

本文提出了一种用于多模态量子机器学习的多阶段训练框架,该框架利用张量和变分量子电路将名词和关系表示进行分离,证明了在 CLEVR 数据集上具有显著提升的组合泛化能力,且其可训练参数量远少于经典基准模型。

原作者: Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类智能拥有一种卓越的能力,能够将简单、习得的概念重新组合成全新的情境。一个理解什么是“汽车”以及“黄色”含义的人,能够瞬间识别出一辆从未见过的黄色的车,并将对危险性的认知应用于这种新颖的组合。这种被称为“组合泛化”(compositional generalization)的能力,让我们得以在不断遇到熟悉部分的新颖排列的世界中穿行。然而,对于人工智能而言,这项技能仍然是一个顽固的障碍。虽然现代系统擅长识别训练期间见过的模式,但当被要求将这些相同的模式应用于新的组合(例如将特定物体置于新的空间关系中)时,它们往往会陷入困境。这种局限性表明,目前的模型更多是在记忆示例,而非真正理解事物如何组合在一起的底层规则。

来自伦敦大学学院和阿姆斯特丹大学的研究人员探索了一条解决这一问题的不同路径,转向了量子力学那奇特而强大的逻辑。在为 IEEE 量子周会议提交的工作中,他们提出,量子计算机处理信息的方式可能自然地与人类组合概念的方式相契合。通过构建一个将“学习物体”与“学习物体间关系”相分离的模型,他们创建了一个能够比传统方法更有效地泛化到未见场景的系统,同时仅使用了极小部分的计算能力。

该团队专注于一项任务:计算机必须观察两个几何形状的图像,并从两个选项中选择正确的描述性关系。例如,给定一张“立方体在圆锥左侧”的图像,系统必须区分正确的短语“立方体 左 圆锥”,而不是干扰项“立方体 右 圆锥”。为了教导机器,研究人员使用了一个包含球体、圆柱体和圆锥体在各种位置的图像数据集。挑战在于,让系统在某些组合(如圆锥在立方体右侧)上进行训练,然后在它从未见过的组合(如圆锥在立方体左侧)上进行测试。这种设置迫使模型将“左”和“右”的学习视为可以应用于任何形状的独立规则,而不是仅仅记忆特定的图片。

研究人员没有一次性训练整个系统,而是采用了模仿课程教学的两阶段法。在第一阶段,模型学习识别单个物体。它被展示单个形状的图像(如一个孤立的球体或一个单独的立方体),并被教导将其与名称进行匹配。一旦模型掌握了这些基础构建模块,研究人员就冻结了它对这些形状外观的记忆。在第二阶段,研究人员引入了关系任务。此时,模型被展示带有两个形状的图像,并必须仅学习它们如何相互关联,同时利用已经记忆的、稳定的物体定义。这种设计确保了系统不会在每次看到新关系时都试图重新学习什么是“立方体”,从而迫使它将关系视为应用于固定物体的独立变换。

为了实现这一点,团队使用了一个将语言和意义转化为数学结构(称为张量)的框架,这些结构可以直接映射到量子电路上。他们测试了将图像数据输入这些量子电路的不同方式。一种被称为“振幅编码”(amplitude encoding)的方法试图保留原始图像数据的精确几何结构;另一种被称为“角度编码”(angle encoding)的方法则以一种引入非线性变化的方式转换数据,有效地重塑信息,使不同关系之间的差异更加清晰。他们还实验了一种“拼贴”(collage)方法,即通过物理组合两个独立形状的量子电路来表示单个关系图像。

他们的模拟结果非常具有启发性。当研究人员将这种多阶段量子模型与标准的经典系统进行比较时,效率上的差异非常显著。经典基准模型需要超过 1 亿个可训练参数来尝试完成任务,但它无法实现泛化,在未见组合上的准确率仅为 50%——本质上是在瞎猜。相比之下,量子模型仅使用 426 个可训练参数就实现了强大的泛化能力。他们最成功的版本(结合了拼贴方法和角度编码)在未见测试案例中的准确率达到了 72% 以上。这一表现明显优于试图同时学习所有内容的单阶段量子模型,证明了将物体学习与关系学习分离是至关重要的。

研究人员发现,模型的成功很大程度上取决于数据的编码方式。引入非线性变换的角度编码法被证明优于振幅编码法。这表明,通过标准工具处理的原始图像数据并未清晰地分离出任务所需的空间关系。量子编码过程本身有助于重构信息,使“左”与“右”的区别对模型更加可见。虽然振幅编码保留了数据的原始形状,但也保留了不同空间排列之间令人困惑的相似性,使得它们更难区分。

这些完全源于计算机模拟的发现表明,结构化的量子表示为教授机器理解组合性提供了一条充满前景的途径。通过强制执行物体与其关系之间的清晰分离,并利用量子电路将数据重塑为更具可分性的形式,该模型实现了经典系统在投入更多资源的情况下仍难以达到的泛化水平。这项工作并不声称解决了人工智能问题,但它证明了,当与量子计算的独特属性相结合时,一种特定的、结构化的学习方法(即先学习原语,然后再进行组合)是非常有效的。作者指出,未来的工作需要在真实的量子硬件上测试这些想法,并探索这些方法是否能扩展到更复杂的场景和更丰富的词汇表,但目前的成果为一种全新的机器学习思维方式提供了引人注目的概念验证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →