想象一下,你有一张模糊、低分辨率的猫的照片,想要把它变成一张晶莹剔透、高清的杰作。这就是**图像超分辨率(ISR)**的工作。
长期以来,计算机完成这项工作要么是通过猜测缺失的细节(这有时会创造出虚假的特征,比如长出六只眼睛的猫),要么是通过逐步“去噪”图像,而这个过程非常缓慢。
最近,一种名为**视觉自回归(VAR)**模型的新方法变得流行起来。你可以把这些模型想象成一位不会一次性画完整个画布的画家。相反,他们分层绘制图像:先画草图,再画中等细节的版本,最后完成高清杰作。每一层都建立在前一层的基础上。
然而,你分享的这篇论文指出了这些“画家”目前工作方式存在的两个大问题,并引入了一种巧妙的解决方法。
旧方法的两个问题
1. “全有或全无”的梯子
想象画家有一架梯子,梯级代表不同的大小:小草图、中草图和最终的大画作。
- 问题: 在以前的方法中,梯子坏了。你只能爬到最顶端的梯级(最终的 4 倍大小)。如果你试图停在中间的梯级(2 倍大小),图像看起来就会像垃圾或扭曲的一团糟。中间的“梯级”实际上并不存在为有效的图像;它们只是到达顶端所需的数学步骤。
- 论文的解决方案(分层图像标记化): 作者构建了一架真实、坚固的梯子。他们教会模型先画小草图,再画中草图,最后画大画作,确保每一个步骤看起来都像真实、连贯的图像。现在,你可以在任何尺寸(1 倍、2 倍或 4 倍)停止过程,并获得完美的图像。他们称之为分层图像标记化(HIT)。
2. 需要庞大的图书馆
- 问题: 为了获得良好的结果,以前的模型需要非常庞大(像一本拥有数十亿页的巨型百科全书),或者需要一个巨大的、专门标记的“好与坏”示例库,以学习清晰图像的样子。
- 论文的解决方案(DPO 正则化): 作者为模型引入了一位新的“教练”,称为直接偏好优化(DPO)。与其需要庞大的示例库,这位教练只需告诉模型:“嘿,高分辨率版本比模糊版本更好。确保你偏好清晰的细节。”
- 这使得一个小得多的模型(仅 3.1 亿参数,而其他模型使用 10 亿参数)能够利用标准的日常训练数据进行有效学习。
结果:更聪明、更小的画家
通过结合这两个想法,作者创建了一个新系统,该系统:
- 适用于任何尺寸: 它可以将小图像放大 2 倍、4 倍,甚至 8 倍,一次性完成,而图像不会在中间步骤中分崩离析。
- 高效: 它比竞争对手更小、更快。当其他模型像笨重缓慢的坦克时,这辆车则像一辆灵活的运动型跑车,却依然能赢得比赛。
- 需要更少数据: 它不需要秘密的庞大数据集就能表现良好;使用标准的公开数据就能发挥出色。
类比总结
可以将旧方法想象成试图建造摩天大楼,但只被允许打地基,然后瞬间跳到屋顶。如果你试图在半途停下,你得到的只是一堆瓦砾。
这篇论文引入了一种方法,即先建一楼,再建二楼,然后建三楼。每一层都是一个完整、可用的公寓。你可以停在二楼,拥有一个不错的居住空间,或者一直走到顶层。他们通过聘请一位更小、更聪明的工头做到了这一点,这位工头确切知道应该偏好哪些楼层平面图,而无需一个像城市一样庞大的蓝图库。
简而言之: 他们使图像放大变得灵活(适用于任何尺寸)、高效(使用更小的模型)且更智能(使用新的训练技巧),同时保持了顶级的质量。
技术摘要:用于多尺度图像超分辨率的层次化图像标记化
问题陈述
图像超分辨率(ISR)旨在从低分辨率(LR)输入生成高分辨率(HR)图像。尽管最近的视觉自回归(VAR)模型通过很好地契合“下一尺度预测”范式而展现出前景,但其在 ISR 中的应用面临两个关键局限:
- 无法生成中间尺度:现有的基于 VAR 的 ISR 方法(例如 VARSR)依赖于残差量化(RQ),其中残差被累积以重建最终固定分辨率的图像。中间残差并不能保证在较低尺度下具有语义意义的重建。因此,这些模型无法在单次前向传播中产生有效的中间输出(例如 2 倍上采样图像);它们被限制在预定义的固定尺度因子。
- 依赖大量资源:当前最先进的方法通常需要庞大的骨干模型(例如 10 亿 + 参数)或 extensive、精心标注的数据集(包括用于无分类器引导的负样本)才能达到有竞争力的性能。
方法论
作者提出了一种新颖的框架,将两个关键组件集成到 VAR 训练流程中,以解决上述不足:层次化图像标记化(HIT)和直接偏好优化(DPO)正则化。
1. 层次化图像标记化(HIT)
标准 RQVAE 通过将潜在特征分解为残差序列来对图像进行标记化,但这些残差本身并不与特定图像尺度对齐。所提出的 HIT 方法修改了这一过程:
- 顺序编码:不是先对全分辨率进行标记化然后下采样,而是将输入图像逐步下采样到目标尺度(例如 1×、2×、4×)。
- 标记重叠:标记化按顺序应用于这些下采样版本。关键在于,为较低尺度生成的标记在计算较高尺度的残差时被重用和共享。
- 微调:预训练 RQVAE 的词汇表和解码器使用针对每个目标尺度的特定尺度解码器和重建损失进行微调。这确保了词汇表在不同分辨率下具有语义一致性。
- 结果:这创造了一种“强归纳偏置”,模型学习到早期标记代表在多个尺度下有效的粗略语义结构,允许解码器从同一标记序列中重建出中间分辨率的有效图像(例如 128×128、256×256、512×512)。
2. DPO 正则化
为了在不依赖外部奖励模型或大规模负样本数据集的情况下提高图像质量,作者引入了一种基于直接偏好优化(DPO)的正则化项:
- 机制:模型被训练以最大化真实 HR 标记的对数似然,同时惩罚那些类似于 LR 输入简单双线性上采样的标记的似然。
- 公式:损失函数定义为 LDPO=−logσ(βlogp(zLR)p(zHR)),其中 p(zHR) 和 p(zLR) 分别是 HR 和 LR 标记序列的概率。
- 优势:这种方法利用模型自身区分 HR 和 LR 序列的能力,消除了对外部 VLM 或负样本收集的需求。
架构与训练
- 模型规模:与先前工作中使用的 10 亿 + 参数模型相比,作者使用了一个相对较小的 Transformer(3.1 亿参数,16 个块)。
- 训练数据:模型在标准 ISR 数据集(DIV2K、DIV8K、Flickr2k、OST 和 FFHQ 的子集)上进行训练,无需专有或大规模外部语料库。
- 条件输入:与使用 ControlNet 的 VARSR 不同,该方法直接使用上采样 LR 图像的 RQVAE 编码器特征作为条件信号。
主要贡献
- 首个多尺度基于 VAR 的 ISR:本文引入了首个能够解码中间尺度到图像空间同时保持跨尺度语义一致性的基于 VAR 的方法,实现了单次前向传播的多尺度输出。
- 通过 HIT 实现强归纳偏置:所提出的层次化图像标记化作为一种强归纳偏置,使得一个仅 3.1 亿参数的小型模型无需大型骨干网络即可实现最先进(SOTA)的结果。
- 通过 DPO 简化训练:引入基于 DPO 的正则化项简化了训练过程,移除了对大规模标注负样本或外部奖励模型的依赖,同时产生了更优越的清晰度和质量。
实验结果
所提出的方法(H-VAR)在合成(DIV2K-Val)和真实世界(RealSR、DRealSR)数据集上进行了评估,对比了基于 GAN、基于扩散和基于 AR 的基线方法。
- 多尺度能力:与无法在中间尺度(例如 256×256)产生连贯图像的基线方法(VARSR、Baseline)不同,H-VAR 成功从单次前向传播中重建了 1×、2× 和 4× 尺度的有效图像。
- 性能:
- 在 RealSR 上,H-VAR 实现了 25.55 的 PSNR 和 0.256 的 LPIPS,优于 VARSR(PSNR 24.61,LPIPS 0.350)及其他扩散/GAN 方法。
- 在 DRealSR 上,H-VAR 实现了 28.73 的 PSNR,超越了 VARSR(28.16)和 StableSR(27.87)。
- 效率:3.1 亿参数模型显著优于 10 亿参数的 VARSR 模型,同时需要更少的计算资源(在 DIV2K-Val 上推理时间为 0.25 秒,而 VARSR 为 0.93 秒)。
- 消融实验:移除 HIT 组件会导致性能显著下降,证实了其作为关键归纳偏置的作用。同样,移除 DPO 正则化会导致结果更模糊,PSNR/LPIPS 分数更低。
意义与主张
本文声称通过解决标准 RQVAE 公式中固有的“固定尺度”限制,推进了将 VAR 应用于 ISR 的范式。通过引入层次化图像标记化,作者证明了使用在标准数据集上训练的紧凑模型(3.1 亿参数)即可实现最先进超分辨率结果,无需庞大的专有数据或复杂的外部引导机制。这项工作强调,标记化本身的结构(HIT)是性能的强大驱动力,作为一种强归纳偏置,引导模型走向具有语义意义的多尺度表示。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。