Improved denoising diffusion probabilistic models with efficient non-diagonal covariance modeling
本文介绍了 Kronecker-DCT (K-DCT) 模型,这是一种新颖的非对角协方差近似方法,它利用 Kronecker 分解和离散余弦变换来高效地捕捉自然图像的相关性,从而在保持极低计算开销的同时,显著提高去噪扩散概率模型 (DDPMs) 的质量和似然度,并减少采样步数。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一台通过学习来创作艺术的机器,它不是从零开始绘画,而是从一张布满静态噪声的画布开始,通过缓慢而细致地去除这些噪声,直到一幅清晰的图像显现出来。这就是被称为“去噪扩散模型”(denoising diffusion models)的一类人工智能模型的核心思想。它们已成为生成高质量图像(从逼真的面孔到风景)的标准工具,因为它们生成的图像既清晰又具有多样性。然而,这里有一个问题:去除噪声的过程本质上是缓慢的。为了得到一张好的图片,计算机必须进行数千个微小且谨慎的步骤,一次剥离一点点静态噪声。如果它试图通过采取更大的步长来加速过程,图像往往会变得模糊或扭曲,因为机器失去了对图像各部分之间关系的把握。
长期以来,研究人员一直试图通过一种简化假设来解决这个速度问题:他们假设图像在任何给定时刻的不确定性可以通过观察每个像素的独立情况来描述。这有点像试图仅通过观察一个特定位置的温度来描述天气,而忽略了该处风力如何影响相邻位置的降雨。虽然这种方法在采取微小步长时效果尚可,但当研究人员试图采取实际应用所需的更大、更快的步长时,这种方法就会失效。自然图像的现实情况要复杂得多;一个像素的颜色与其邻近像素有着深刻的联系,而且图像的红、绿、蓝通道之间也以复杂的方式相互影响。发表在《机器学习研究汇刊》(Transactions on Machine-Learning Research)上的一项新研究表明,通过承认这些复杂的联系,我们可以显著提高这些图像生成器的速度,而不牺牲质量。
研究团队来自包括剑桥大学和伦敦国王学院在内的机构,他们致力于构建一张更好的连接图谱。他们的研究重点是“后验协方差”(posterior covariance),这是一个技术术语,本质上描述了一个图像部分的确定性如何取决于另一部分的确定性。在旧的、较简单的模型中,这张图谱被绘制成一个只有对角线有意义的网格,这意味着一个像素的未来与其邻居是相互独立的。新团队认为,这种观点是一种极大的过度简化,忽略了自然图像的真实结构,而自然图像在像素和色彩通道之间表现出强烈的非对角相关性。他们还注意到,这些图像具有特定的频率模式,即细节以一种可预测的方式逐渐消退,类似于一个音乐和弦具有特定的音符结构。
为了在不减慢计算机速度的情况下捕捉这种复杂性,该团队开发了一种名为 K-DCT 的新数学模型。这个名字源于两个核心概念的结合。首先,他们认识到颜色之间的关系(如红、绿、蓝)与空间位置之间的关系(如左、右、上、下)大致是相互独立的。这使得他们能够将这个庞大而复杂的问题分解为两个较小且易于处理的部分。其次,他们意识到图像的空间关系通过直接观察像素并不是最好的方式,而是应该将图像视为一组“波”的集合,并使用一种称为“离散余弦变换”(Discrete Cosine Transform)的技术。这种方法将图像分解为其基本频率,就像棱镜将白光分解成彩虹一样。通过在频率域中进行工作,研究人员可以用一组非常精简的数字来描述像素之间复杂的连接网络。
其结果是一个既具有高表达能力又极其高效的模型。虽然对高分辨率图像进行完整的连接描述需要大量的内存和计算能力,但 K-DCT 模型能够在几乎不比图像本身占用更多空间的情况下完成同样的工作。研究人员在几个著名的图像数据集上测试了这种方法,包括包含日常物品的小图像数据集 CIFAR-10,以及以名人肖像为特征的 CelebA。他们还在像 ImageNet 和 LSUN 这样更大、更复杂的数据集上进行了测试。在每种情况下,他们都将自己的新方法与现有的最佳技术(这些技术依赖于较简单的对角假设)进行了对比。
研究结果清晰且一致。当研究人员强制模型以更少的步骤生成图像时(模拟速度至关重要的场景),新的 K-DCT 模型产生了显著更好的结果。生成的图像更加锐利、细节更丰富,并且在统计学上更接近于它们所训练的真实数据。从技术角度来看,这些模型实现了更低的误差率和更好的似然得分,这意味着计算机对其创造的内容更有信心。或许最重要的一点是,生成过程的速度并未受到影响。新模型所需的额外计算非常高效,即使在高分辨率图像上也几乎没有增加处理时间。这表明,快速生成图像的瓶颈不在于计算机的原始算力,而在于不确定性的建模方式。
团队还探讨了为什么这种方法如此有效。他们发现,去噪图像中像素之间的连接并不会迅速消失;相反,它们遵循一种跨越多个数量级的缓慢且可预测的衰减过程。试图忽略这些长程连接或用几种基本模式来近似这些连接的简单模型无法捕捉到这种细微差别。相比之下,K-DCT 模型自然地适应了这种结构。有趣的是,该模型即使在像 CelebA 这样图像不具备数学理论所假设的完美对称性或平移不变性的数据集上,也表现得异常出色。这表明该模型足以应对现实世界的缺陷,即使在底层模式并非完全规则的情况下,也能捕捉到数据的本质“完整”结构。
虽然这项研究并不声称解决了人工智能的所有问题,但它为图像生成中一个特定且持久的障碍——速度与质量之间的权衡——提供了一个引人注目的解决方案。通过不再假设像素是孤立存在的,而是拥抱它们深度互联的现实,研究人员展示了我们可以加速这些机器的创作过程。这项工作意味着,高效图像生成的未来不在于构建更大的计算机,而在于构建能够理解其试图创造的图像之真实且复杂本质的更智能的模型。K-DCT 模型证明了,对统计结构的更准确理解可以带来性能上的实质性提升,使高质量的图像生成在不需要硬件飞跃的前提下,变得更快且更易于获取。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。