← 最新论文
💻 computer science

HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models

本文介绍了 HQ-DM,一种新颖的量化感知训练框架,该框架利用单次哈达玛变换(Single Hadamard Transformation)来有效缓解激活离群值并防止权重离群值放大,从而为扩散模型实现高性能低比特量化(W4A4 和 W4A3),并在图像生成质量上较现有最先进方法有显著提升。

原作者: Shizhuo Mao, Hongtao Zou, Qihu Xie, Song Chen, Yi Kang

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Shizhuo Mao, Hongtao Zou, Qihu Xie, Song Chen, Yi Kang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一位数字艺术家创作一幅杰作,但你没有给她一个配备高清画笔的完整工作室,而是递给她一本微小的、低分辨率的速写本。这就是“扩散模型”(diffusion models)面临的挑战——这是一种通过将随机的静态噪声逐步转化为清晰图像来创造惊艳图像的人工智能。这就像一位雕塑家从一块巨大的大理石开始,一遍又一遍地凿掉微小的碎片,直到一座雕像显现出来。问题在于,这个过程极其沉重;它需要庞大的计算机和大量的内存,使得在手机或笔记本电脑等日常设备上运行变得非常困难。

为了解决这个问题,科学家们使用了一种叫做“量化”(quantization)的小技巧。想象一下将一张高清晰度照片缩小成像素化的版本,从而占用更少的空间。在人工智能的世界里,这意味着将模型的超精确数字(使用大量内存)转换为更小、更简单的数字(使用更少的比特)。然而,这里有一个陷阱:当你把这些数字缩得太小时,人工智能会被“离群值”(outliers)搞糊涂。这些离群值是数据中罕见的、极端的数值,就像黑暗天空中一颗孤零零、极其明亮的星。如果你试图把这颗星放入一个小的、低分辨率的网格中,它会扭曲整个画面,导致人工智能生成的图像变得模糊或怪异。大问题在于:我们如何在缩小模型的同时,又不丢失那些让艺术品看起来如此出色的细节?

正是在这里,一项名为 HQ-DM 的新研究提出了一个聪明的解决方案。研究人员发现,在扩散模型中造成麻烦的“离群值”就像是在派对门口挡住大家的顽固宾客。以前的方法试图把这些宾客挤进去或者挪动家具,但这往往会让房间变得更乱。HQ-DM 团队发现了一个更好的方法:他们使用了一种数学工具——单次哈达玛变换(Single Hadamard Transformation)。你可以把它看作是一种神奇的“洗牌”技术。与其试图把那颗明亮的星强行塞进一个小盒子,不如把整个天空旋转起来,让星星的光芒均匀地散布在整个画布上。突然之间,不再有任何一个点过于明亮而难以处理,人工智能可以轻松地缩小数字而不会损失图像质量。

这种方法的特别之处在于它是如何处理“权重”(weights,即模型的记忆)与“激活值”(activations,即流经模型的数据)的。旧的方法试图对两者都进行洗牌,但这往往会产生新的亮点,使情况变得更糟。HQ-DM 更聪明:它只在数据被缩小之前对其进行的“激活值”进行洗牌,保持记忆不动。这就像是在不移动客厅家具的情况下,重新排列走廊里的宾客。因此,该方法能够完美适配那些专为快速、简单数学运算设计的标准计算机芯片,从而让人工智能运行得更快。

这种“洗牌”技巧带来的结果令人印象深刻。当研究人员在 ImageNet 数据集(一个包含 256×256 像素图像的集合)上,针对流行的图像生成器 LDM-4 进行测试时,他们发现他们的模型可以在缩减到非常小的尺寸时仍不丢失其艺术感。具体来说,当他们使用一种非常激进的设置,即将记忆和数据都缩小到仅 4 比特(W4A4)时,他们的模型比之前的最佳方法在图像质量得分(Inception Score)上提升了 12.8%。更令人震惊的是,当他们将数据压低到仅 3 比特(W4A3)——这是一个大多数方法都会彻底失败的水平——他们的模型得分竟然惊人地提升了 467.73%

论文还表明,这种方法是非常高效的。训练模型并不会花费太多时间,并且由于它能很好地兼容标准计算机硬件,它的运行速度比之前尝试类似低比特量化的方法快了约 1.10 到 1.14 倍。研究人员在包括“Transformer”(另一种 AI 架构)在内的不同类型的模型上进行了测试,发现这种“洗牌”技巧在这些模型上也同样奏效。简而言之,HQ-DM 表明,通过在缩小数据之前对其进行重新排列,我们可以让强大的 AI 艺术生成器变得足够小,以便在我们的日常设备上运行,同时又不牺牲它们所创造的图像之美。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →