想象一个计算机不再仅仅是处理数字,而是与现实本身的织面共舞的世界。这就是量子计算的领域,这个领域利用亚原子粒子的奇异、反直觉规则,来解决传统超级计算机需要耗费永恒时间才能解决的问题。这项技术最令人兴奋的应用之一是“生成式人工智能”,即计算机学习创造新事物(如艺术或音乐),而不仅仅是分析已有的事物。为了实现这一点,科学家们使用了一种聪明的游戏,叫做“生成对抗网络”(GAN)。把它想象成一个伪造者和一个侦探:伪造者试图创造出完美的假图像,以至于侦探无法将其与真实照片区分开来。随着他们一遍又一遍地玩这个游戏,伪造者在创作艺术方面变得极其出色。现在,想象给这个伪造者赋予一种量子超能力。这就是“量子生成对抗网络”(Quantum GANs)的目标——利用量子计算机来生成图像。但问题在于:目前的量子计算机既微小又脆弱,而以前制作图像的方法就像是试图用一把单薄的小画笔去绘制一幅巨大的壁画,如果你试图一次性画太多像素,这把画笔就会被堵塞。
CoQui 出现并改变了游戏规则。它不再强迫量子计算机同时处理图像的所有像素,而是将图像视为一个神奇的、连续的地貌。想象你拥有一把神奇的画笔,只需通过询问“坐标 (x, y) 处的颜色是什么?”就能瞬间得知画布上任何一点的颜色。你不需要一次性画完整个画面;你只需要逐一访问每一个点,并向画笔询问它的颜色。这就是 CoQui 所做的。它将图像生成重新表述为一个“基于坐标条件的”任务。CoQui 并不是将量子态的“振幅”(一个技术术语,指粒子处于某种状态的概率)直接映射到像素亮度,而是向量子计算机输入一个特定的位置(坐标)和一个秘密代码(潜变量)。然后,量子计算机就像一个复杂的计算器,为那个特定的位置吐出精确的亮度。
论文指出,这种方法解决了以往量子图像生成器的两个主要难题。首先,旧的方法要求量子比特(qubits)的数量随着图像的增大而增长,就像需要一个越来越大的桶来盛放更多的水一样。CoQui 打破了这种联系;你可以生成高分辨率的图像,而不需要庞大的量子计算机。其次,旧的方法让像素在概率质量上进行“竞争”,这意味着如果一个像素变得太亮,另一个就必须变得太暗。CoQui 让每个像素可以独立测量,因此它们不必相互竞争。研究人员在标准图像数据集(MNIST 和 Fashion-MNIST)的计算机模拟中测试了这个想法。他们发现,与以往需要 192 个量子比特或复杂的分块组装的方法相比,Coqui 能够创建更清晰、更锐利的图像,同时使用显著更少的资源——具体来说,仅需 5 个量子比特(一个用于颜色,四个用于特征)和一个量子电路。
该团队还设计了一种特殊的“量子电路”架构,它充当一个智能过滤器,允许图像的特征以一种非常结构化的方式控制颜色输出。在他们的模拟中,这种设计帮助模型更好地学习,并产生模糊度更低、细节更多的图像。虽然结果令人期待,但作者谨慎地指出,这些是在经典计算机上运行的模拟,而非在真实的、带有噪声的量子硬件上的测试。他们建议,这种基于坐标的方法为量子图像生成提供了一条更灵活、更高效的路径,可能允许未来的量子设备在不需要数百万个量子比特的情况下创造复杂的图像。这是迈向未来的一步:在那时,一个微小的量子芯片就可以通过逐个像素地描绘,完成一幅杰作。
技术摘要:CoQui —— 一种基于坐标条件的量子隐式生成对抗网络
问题陈述
现有的用于图像生成的量子生成对抗网络(QGAN)主要依赖于一种将像素强度直接映射到量子态振幅的范式。作者指出该方法存在两个关键局限性:
- 可扩展性问题: 通过计算基索引或地址比特来编码像素位置,会导致所需的量子态维度或量子比特数随图像分辨率线性增长。
- 像素耦合与控制: 现有方法通过一个或少数几个归一化的量子态共同解码多个像素。这迫使像素在概率质量上相互竞争,使得精确控制单个像素值变得困难。这通常导致生成的图像与真实数据分布相比,整体亮度较低且振幅分布不均。
此外,许多现有方法仅使用量子电路来建模压缩后的经典表示,而非直接进行像素级的生成。
方法论:CoQui 框架
为了解决这些局限性,本文提出了 CoQui(坐标条件量子隐式 GAN),将图像生成重新表述为一个坐标条件隐式函数学习问题。CoQui 不是将振幅映射到像素,而是学习一个从空间坐标到信号值的连续映射。
1. 核心架构
该框架的运作方式如下:
- 输入: 生成器接收空间坐标 c=(x,y) 和潜变量 z 作为输入。
- 经典嵌入: 一个经典神经网络 Γ 处理 c 的位置编码与潜变量 z 的拼接结果。它输出定义参数化量子电路(PQC)旋转角度的参数。
- 量子生成器: PQC 在特定的坐标位置评估图像。
- 量子比特分配: 电路使用 Nq=Nf+1 个量子比特。其中一个量子比特(q0)作为用于像素读取的颜色量子比特,其余 Nf 个量子比特作为特征量子比特,用于编码隐式空间特征。
- 电路结构: 电路由 L 个重复层组成,包含:
- 颜色量子比特亮度初始化: 一个可训练的 RY 旋转,用于设置初始平均亮度。
- 缩放数据重上传(Scaled Data Re-uploading): 层级特定的缩放和偏置参数调节输入角度,允许每一层强调或衰减坐标-潜变量信号。
- 局部旋转与纠缠: 特征量子比特进行局部旋转和环形拓扑 CNOT 纠缠,以模拟相关性。
- 特征向颜色写入: 受控-RY 门将信息从特征量子比特转移到颜色量子比特,使颜色输出显式地依赖于特征表示。
- 颜色残差更新: 颜色量子比特上的额外可训练旋转允许在各层之间对像素强度进行精细化处理。
- 像素读取: 像素强度并非源自态振幅,而是直接通过颜色量子比特上 Pauli-Z 可观测量的期望值进行读取:G(c,z)=(1−⟨Z0⟩)/2。
- 图像合成: 通过在所有空间坐标 (i/W,j/H) 处查询生成器来生成完整的图像。
2. 训练目标
CoQui 使用带有梯度惩罚的 Wasserstein GAN 目标函数(WGAN-GP)进行训练,并采用经典判别器(评论家)来区分真实图像与生成图像。
主要贡献
本文概述了三项主要贡献:
- 坐标条件范式: CoQui 通过将生成视为从坐标到像素强度的连续映射,实现了量子比特数量与图像分辨率的解耦。这消除了振幅映射方法中固有的像素间概率质量竞争问题。
- 具有结构偏置的量子电路: 作者设计了一个具有结构归纳偏置的专用 PQC。通过利用特征量子比特受控地调制专门的颜色量子比特,该模型增强了其进行条件像素生成的能力,并提高了表达能力。
- 经验性能: 系统性的模拟表明,CoQui 在使用显著更少的量子比特时,在视觉质量和定量性能方面均优于振幅映射基准(PQWGAN 和 Jäger 等人的量子 Wasserstein QGAN)。同时,它也表现出与具有相似参数规模的经典基准相当的性能。
实验结果
实验在 MNIST 和 Fashion-MNIST 数据集(28x28 分辨率)上使用 JAX 框架的模拟环境进行。
- 资源效率: CoQui 仅使用 5 个量子比特(1 个颜色 + 4 个特征)和单个量子电路即可生成完整图像。相比之下,振幅映射基准需要更多的资源(例如,完成相同任务,PQWGAN 需要 192 个量子比特和 32 个电路)。
- 定量性能:
- 在 10 类 MNIST 中的 4 类和 10 类 Fashion-MNIST 中的 7 类中,CoQui 取得了最优或并列最优的 Fréchet Inception Distance (FID) 分数(对比经典 INR-GAN)。
- 在全 10 类数据集上,CoQui 在视觉质量和 FID 分数方面均优于 PQWGAN 和标准设置下的量子 Wasserstein QGAN。
- 与产生模糊样本的振幅映射方法相比,CoQui 展示了更好的低级视觉统计特性(亮度以及 Sobel 边缘一致性)。
- 消融研究:
- 电路架构: 所提出的结构化电路(特征-颜色调制)在 FID、JSD 和边缘统计方面均优于硬件高效型拟设(hardware-efficient ansatz)。
- 组件作用: 去除缩放数据重上传对性能的影响最为显著(FID 从 ~40 增加到 ~56),凸显了层级输入缩放的重要性。
- 容量: 将特征量子比特增加到 4 个以上或将电路深度增加到 20 层以上会产生收益递减或性能下降,这表明中浅深度的电路足以胜任此任务。
意义与主张
本文声称 CoQui 代表了端到端量子图像生成迈出的重要一步。通过从振幅映射转向坐标条件隐式学习,该方法解决了 QGAN 的根本可扩展性瓶颈,从而能够在不按比例增加量子比特数的情况下生成高分辨率图像。
作者强调,其方法为建模图像分布提供了一条更灵活的路径,能够在不受全局概率归一化约束的情况下,实现对单个像素值的精确控制。虽然目前的评估局限于在没有硬件噪声的灰度基准数据集上的经典模拟,但该工作为未来在真实量子设备上的部署奠定了基础,并具有向更高分辨率和彩色图像生成扩展的潜力。
每周获取最佳 quantum physics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。