在快速发展的人工智能领域,一种用于创建图像的强大新工具已经出现:扩散模型。想象一个过程,一张清晰的照片被慢慢变成静态噪声,就像电视失去信号一样,直到只剩下随机的噪声。科学家们已经学会了如何逆转这个过程,教计算机从这些静态噪声开始,逐渐剥离噪声以显现出连贯的图像。这项技术已成为现代图像生成的基石,帮助创建从艺术渲染到用于研究的合成医学数据等各种内容。然而,运行这些复杂的模拟需要巨大的计算能力,往往会使传统机器达到极限。与此同时,另一个计算领域正在兴起,它利用量子力学的奇特规则来解决标准计算机无法解决的问题。量子计算机使用被称为量子比特(qubits)的微小信息单元,这些单元可以同时存在于多种状态中,为繁重的计算提供了潜在的捷径。挑战在于,目前的量子机器仍处于早期、多噪声阶段,难以用于处理高分辨率医学扫描等大规模任务。
一支研究团队现在通过创建一个混合系统桥接了这两个世界,该系统使用一台真实的量子计算机来处理图像生成过程中混乱的部分,而由传统计算机负责清理工作。他们的工作证明,利用现有的不完美的量子设备来模拟前向扩散过程(即图像被噪声破坏的步骤)是可能的,且无需尚未问世的纠错技术。研究人员并没有对抗量子机器的自然噪声,而是将其转化为一种特性,利用机器固有的不稳定性来帮助将图像数据散射成随机状态。随后,他们训练了一个经典的神经网络(一种人工智能),让其学习如何逆转这种特定的量子噪声并重建原始图像。该团队在三种不同类型的医学数据上测试了这种方法:小型彩色血细胞图像、大型人类大脑灰度扫描图以及三维肋骨骨折体积数据。
结果显示,即使在处理复杂的、三维的医学体积数据时,这种混合方法也具有与纯经典方法相竞争的实力。对于大脑扫描和肋骨骨折数据,量子辅助模型生成的图像在结构上与真实扫描非常相似,达到了最佳传统模型的质量水平。事实上,对于三维肋骨骨折体积数据,混合模型生成的数据在统计上比经典版本更接近原始分布。研究人员发现,量子过程在保留图像结构细节(如脑室形状或骨折纹理)方面表现得尤为出色。这表明,量子噪声传播信息的一种独特方式,在某些场景下可能比标准方法更有助于创建更真实的医学图像。
这项研究依赖于一种名为离散时间量子行走(discrete-time quantum walk)的特定量子算法,它就像一个在可能性链条上移动的随机行走者。在这种设置中,医学图像的每个像素都被分配给一个量子行走者进行移动,其位置代表该像素的亮度或颜色。研究人员在一部拥有 133 个量子比特的真实量子计算机上运行了这一过程,选择了一组相互连接的量子比特作为行走者和一个决定其方向的“硬币”。由于机器存在噪声,行走者并不会完美地移动;它会抖动和漂移,而这恰恰是扩散模型将清晰图像转化为噪声所需要的。团队处理了具有多达 64 个不同强度等级的图像,以及由数千个微小 3D 像素组成的体积数据。他们发现,通过仔细管理量子硬件并利用经典计算机进行学习,他们可以生成看起来并表现得像真实患者数据一样的全新合成医学图像。
虽然该系统展现出了巨大的潜力,但研究人员指出,其性能因图像类型的不同而有所差异。对于分辨率较低的小型血细胞图像,其结构相似度略低于使用不同设置的其他研究所达到的水平。然而,作者解释说,这可能是由于他们特定数据集的分辨率较低且色彩等级较少导致的,而非量子方法本身的失败。这项研究作为一个概念验证,表明当前的、不完美的量子计算机可以成为医学成像任务中有用的工具。它表明,我们不需要等待完美的、无误差的量子机器出现,就可以开始探索它们在医疗保健领域的潜力。通过将当今量子硬件的原始、多噪声的力量与经典的精确学习相结合,科学家现在能够以以往被认为无法触及的方式来处理现实世界的医学数据。
技术摘要:用于医学图像分析的量子扩散模型
问题陈述
生成式人工智能,特别是扩散模型(Diffusion Models, DMs),在医学图像分析(包括合成数据生成和重建)领域已取得了最先进的性能。然而,现有的用于图像分析的量子机器学习(QML)方法受到当前噪声中规模量子(NISQ)设备限制的严重制约。大多数先前的尝试显著限制了数据的维度,或者依赖于混合框架,其中仅将后向(去噪)过程进行量子增强,而将前向扩散过程留给经典计算。此外,以往将量子扩散模型(QDMs)应用于医学影像的研究,仅利用增强了量子层的经典 U-Net 架构进行后向过程,未能利用量子硬件的内在特性来驱动前向动力学。
方法论
作者提出了一种可扩展的混合量子扩散模型,该模型独特地将前向扩散过程分配给真实的量子设备,并将后向去噪过程分配给经典学习模型。
量子前向过程:
- 该方法采用在真实 NISQ 设备(具体为 IBM
ibm_torino 处理器)上执行的离散时间量子行走(DTQW)。
- 输入图像像素(或体素)被离散化为强度级(0,…,2Nq−1)并映射到量子态。
- 系统利用“环链”马尔可夫过程拓扑结构,量子行走者沿强度级链进行移动。“硬币”量子比特(处于叠加态)决定了行走的移动方向。
- 至关重要的是,作者将 NISQ 设备的内在量子噪声视为一种必要的资源。虽然纯幺正动力学会阻止收敛到均匀分布,但硬件自然的退相干和噪声促进了向所需均匀先验分布(p(xT))的转变。
- 前向动力学通过应用于幺正演化 Ut 的量子通道 E 进行模拟,形式化为 ρt=E(Utρ0Ut†)。
- 为了处理大型图像,该过程进行了并行化处理:每个像素/通道进行独立的 DTQW。与之前的工作相比,作者将强度级从 8 增加到了 64,并利用 Qiskit 优化层级来减少门计数。
经典后向过程:
- 训练一个 U-Net 架构来逆转扩散过程,从噪声状态 xt 预测清洁数据 xt−1。
- 作者提出了两种特定的架构:
- 用于灰度图和 RGB 图像的 2D U-Net,其特征是在编码器层中具有时间嵌入和浅层瓶颈。
- 用于体积数据的 3D U-Net,其特征是在编码器和解码器层中均具有时间嵌入、更深的瓶颈,并使用 SiLU 激活函数以保证梯度稳定性。
- 训练过程涉及最小化参考噪声像素值与 U-Net 重建值之间的损失函数。对于 BraTS2020 数据集,使用结合了交叉熵(Cross-Entropy)和 KL 散度(Kullback-Leibler divergence)的混合损失,以更好地匹配像素值分布。
数据集与评估:
- 该模型在三个不同的医学数据集上进行了测试:BloodMNIST(3,329 张 RGB 图像,64×64)、BraTS2020(484 张灰度 MRI 切片,190×190)和 FractureMNIST3D(1,370 个 3D CT 体积,28×28×28)。
- 性能通过三种指标进行评估:KL 散度(分布对齐)、Fréchet Inception Distance (FID)(生成质量)和结构相似性指数(SSIM)(结构保真度)。
- 实验既通过 QDM 的经典模拟进行,也通过在带有误差缓解技术的真实量子设备上进行实验实现。
核心贡献
- 新颖架构: 与以往仅将量子层用于后向传递的 QDM 不同,这项工作实现了一个量子前向过程,利用设备的内在噪声来驱动扩散向均匀分布演化。
- 向现实世界数据的可扩展性: 该方法成功处理了中等规模的真实医学数据,包括 RGB 图像和 3D 体积数据,克服了典型的基于 NISQ 的 QML 的维度限制。
- 方法论改进: 该研究较作者之前的工作 [50] 引入了显著改进,包括增加了强度级(高达 64)、探索了不同的量子噪声拓扑以及具有定制时间嵌入的高级 U-Net 架构。
- 基准测试: 论文提供了一个针对其经典对应物(离散状态空间 DM)的严格比较,证明了这种混合方法具有竞争力的性能。
结果
- 性能指标: 混合量子模型的表现出与经典基准相当的竞争力。
- 在 FractureMNIST3D 上,量子模型的 KL 散度和 FID 得分低于经典模型,而 SSIM 相等。
- 在所有三个数据集上,量子模型始终获得比经典对应物更高的 SSIM 值,这表明量子前向过程可能有助于在生成的数据中保留结构特征。
- 对于 BloodMNIST 和 BraTS2020,量子模型显示出较高的 FID 分数。作者将其归因于 FID 指标依赖于在通用高质量数据上预训练的网络,这对于具有特定量化和分辨率约束的专业医学数据集可能并非最优。
- 视觉分析: 定性结果(PCA 和 KDE 图)表明,该模型成功学习了数据分布模式。对于 BloodMNIST,它捕捉到了多个模态;对于 BraTS2020,尽管是单模态分布,它也避免了模型崩溃。视觉样本展示了生成的解剖学上合理的结构,包括血细胞、脑室和肿瘤块。
意义与主张
作者将这项工作定位为当前 NISQ 设备在医疗领域适用性的概念验证。他们声称,通过将“有害”的量子噪声转化为生成过程的功能组件,其方法规避了对纠错码的需求。
论文谦虚地指出,虽然该模型仍处于早期阶段,且结果与现有的经典或混合方法相当(而非大幅超越),但能够使用真实量子硬件处理复杂的、多维的医学数据(RGB 和 3D 体积),是迈出的重要一步。该工作旨在为使用量子计算机的医学应用研究做出贡献,特别是在无需实现完全容错的情况下,测试当前 NISQ 设备处理关键且资源密集型问题的能力。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。