这篇论文介绍了一个名为 QPT V2 的新人工智能模型,它的核心任务是给图片和视频“打分”。
想象一下,你发了一张自拍到朋友圈,或者剪辑了一段旅行视频。你想知道大家觉得这张照片“美不美”(审美评分),或者这段视频“清不清晰、有没有卡顿”(质量评分)。以前,电脑很难像人一样精准地给出这种主观评价,而 QPT V2 就是为了解决这个问题而诞生的“超级评委”。
下面我用几个生活中的比喻来拆解这篇论文的核心内容:
1. 核心难题:为什么电脑以前“打分”不准?
以前的电脑打分系统,就像是一个只读过几本教科书的学生。
- 数据太少:要训练一个能像人一样审美的 AI,需要成千上万张由真人打分的图片。但收集这些“真人打分”非常昂贵且耗时(就像要请几千人来给每一张照片打分)。
- 结果:因为“作业”做得不够多,这个学生遇到没见过的图片(比如新的滤镜、新的拍摄风格)时,就不知道该怎么打分了,表现得很笨拙。
2. 解决方案:QPT V2 的“特训”方法
作者没有直接让学生去背答案(打标签),而是让他先进行了一场高强度的“蒙眼复原”特训,这就是论文中提到的 MIM(掩码图像建模) 技术。
比喻:蒙眼拼图游戏
想象你面前有一幅完整的画,但有人把画布遮住了 75%(只露出一点点)。你的任务是根据露出的那一小部分,把被遮住的部分在脑海里“画”出来。
- 以前的做法:只给你看普通的风景照,遮住一部分让你猜。
- QPT V2 的做法:它升级了这个游戏,从三个维度进行了“魔鬼训练”:
3. QPT V2 的三大“升级秘籍”
秘籍一:选更难的“教材” (Data)
- 普通教材:以前的训练数据(如 ImageNet)就像低分辨率的旧报纸,或者背景里全是杂乱的草地,主角(人脸或物体)很小。
- QPT V2 的教材:它专门挑选了高清(HR) 且 主角突出(HFC) 的图片。
- 比喻:这就像是从“模糊的远景照”换成了"4K 高清特写”。因为图片更清晰、主体更明确,AI 在复原被遮住的部分时,必须仔细观察皮肤的纹理、光影的细节。这让它学会了如何捕捉“美”和“质感”。
秘籍二:制造更真实的“破坏” (Degradation)
- 普通破坏:以前的训练只是简单地把图片裁切一下,或者稍微变暗。
- QPT V2 的破坏:它模拟了现实生活中各种糟糕的拍摄环境。
- 比喻:它故意给图片加上“噪点”(像老电视雪花)、“模糊”(像手抖了)、“颜色失真”(像白平衡错了),甚至把图片从 RGB 颜色空间强行转换成灰度再转回来。
- 关键点:研究发现,颜色空间的转换(CST) 是最有效的训练方式。就像让一个习惯了看彩色照片的人,突然去猜黑白照片里的色彩分布,这能极大地锻炼他对“色彩美感”的敏感度。
秘籍三:用“多尺度”的眼睛看世界 (Model)
- 普通眼睛:以前的模型可能只盯着一个局部看,或者只看整体轮廓。
- QPT V2 的眼睛:它拥有一双既能看宏观构图,又能看微观细节的“火眼金睛”。
- 比喻:就像一位资深摄影师,既能一眼看出照片的构图是否平衡(宏观),又能看清花瓣上的露珠是否清晰(微观)。QPT V2 通过融合不同层级的特征,同时掌握了这两项技能。
4. 训练成果:它有多强?
经过这种“蒙眼复原”的特训后,QPT V2 去参加了 11 个不同的考试(涵盖了图片质量、视频质量、图片审美等任务)。
- 成绩:它在所有考试中都拿到了第一名(SOTA,State-of-the-Art)。
- 对比:
- 它比那些靠“死记硬背”(监督学习)的模型更聪明,因为它学会了举一反三。
- 它比那些靠“找不同”(对比学习)的模型更敏锐,因为它能看清像素级的细节。
- 甚至,它只用 60% 的考试题目 进行微调,就能达到别人用 100% 题目训练出来的效果,说明它真的“悟性”很高。
总结
QPT V2 就像是一个天赋异禀的艺术生。
它没有死记硬背成千上万张“满分试卷”(因为那些太少了),而是通过玩高难度的“蒙眼复原”游戏,在高清、多变、甚至被“破坏”过的图片中,自己悟出了什么是“清晰”、什么是“美”、什么是“构图”。
最终,它不仅能给照片和视频打分,还能像人类一样,敏锐地感知到那些细微的画质瑕疵和美学价值。这项技术未来可以帮视频平台自动筛选高清内容,或者帮摄影师自动修图,让视觉体验变得更好。
QPT V2: 基于掩码图像建模的视觉评分技术总结
1. 研究背景与问题 (Problem)
视觉评分 (Visual Scoring, VS) 旨在评估视觉内容(图像和视频)的质量(如图像质量评估 IQA、视频质量评估 VQA)和美学(图像美学评估 IAA)。这些任务的核心目标是模拟人类视觉系统 (HVS) 的感知。
当前基于学习的方法面临的主要挑战包括:
- 标注数据稀缺:获取与人类感知一致的平均意见得分 (MOS) 需要昂贵的主观实验,导致 VS 数据集规模远小于分类等其他视觉任务数据集(通常仅为后者的 1/10 到 1/100)。
- 泛化能力不足:现有方法在数据稀缺下往往表现次优,难以适应复杂的真实世界场景(如 UGC 和 AIGC 内容的爆发)。
- 现有预训练方法的局限:
- 传统的对比学习(Contrastive Learning)主要关注样本级别的区分,难以捕捉局部的失真和细粒度的视觉属性。
- 现有的掩码图像建模 (MIM) 研究多集中于高层语义任务,且通常使用低分辨率或前景覆盖度低的数据,缺乏对质量与美学相关因素(如纹理、细节、失真)的针对性优化。
2. 方法论 (Methodology)
作者提出了 QPT V2 (Quality- and aesthetics-aware PreTraining),这是首个基于掩码图像建模 (MIM) 的统一预训练框架,专门针对视觉评分任务进行了优化。该方法从数据、退化和模型三个维度对基础 MIM 进行了改进:
2.1 数据策略:高分辨率与高前景覆盖 (HR & HFC)
- 高分辨率 (HR):为了捕捉丰富的纹理和局部结构,预训练数据选自 SA-1B 数据集,平均分辨率约为 1600×2100,远高于 ImageNet。
- 高前景覆盖 (HFC):定义前景覆盖率为前景区域占整图的比例。由于前景包含更多语义和纹理信息,作者筛选了 SA-1B 中包含 50 个以上物体的图像(共 128 万张),确保模型对高低层视觉属性均敏感。
2.2 退化策略:质量与美学感知退化 (Quality- and Aesthetics-aware Degradation)
为了模拟真实世界的复杂场景,作者在重建目标上应用了多种退化策略:
- 退化类型:包括几何变换(缩放)、频率变换(模糊、锐化、高斯噪声)和颜色变换(颜色抖动、颜色空间转换 CST)。
- 关键发现:实验表明,颜色空间转换 (CST) 是最具质量与美学感知能力的退化方式,因为它暴露了模型在不同颜色空间下的互补信息。
- 组合策略:研究发现,简单的退化(如仅 CST)效果优于复杂的顺序或高级退化组合(后者在对比学习中有效,但在 MIM 中反而有害)。
2.3 模型架构:多尺度特征融合 (Multi-scale Model)
- 编码器选择:选用分层骨干网络 HiViT 作为编码器,相比纯 ViT,它能更好地利用图像归纳偏置学习多尺度特征。
- 特征融合模块:设计了一个仅在预训练阶段使用的特征融合模块。该模块将编码器不同阶段(Stage)输出的特征进行对齐(投影层)和融合(融合层),然后输入解码器。
- 这种设计使模型能够同时感知细粒度(低层细节)和粗粒度(高层语义)的质量与美学信息,模拟 HVS 的多尺度评估机制。
- 融合过程不影响微调阶段,保持了模型的通用性。
3. 主要贡献 (Key Contributions)
- 首创 MIM 统一框架:首次验证了掩码图像建模 (MIM) 在统一下游视觉评分任务(IQA, VQA, IAA)中的强大能力,打破了以往任务分离的局限。
- 提出 QPT V2 框架:从数据(HR & HFC)、退化(CST 等)和模型(多尺度融合)三个维度对 MIM 进行了针对性优化,提供了首个面向视觉评分的 MIM 预训练方案。
- 全面消融与验证:通过详尽的消融实验,揭示了数据分辨率、前景覆盖、退化类型及模型结构对视觉评分任务的具体影响,证明了各组件的有效性。
4. 实验结果 (Results)
QPT V2 在 11 个 下游基准测试中进行了评估,涵盖了合成/真实世界图像质量、视频质量及图像美学评估:
- IQA (图像质量评估):在 LIVE, TID2013, KADID, FLIVE, CLIVE, KonIQ10K 等数据集上,QPT V2 的表现优于或持平于当前最先进 (SOTA) 方法。特别是在真实世界失真数据集(FLIVE, CLIVE)上展现了卓越的感知能力。
- VQA (视频质量评估):在 LIVE-VQC, KoNViD-1k, LSVQ 等数据集上,QPT V2 超越了所有传统手工特征方法和大多数数据驱动方法,在跨数据集泛化测试中表现尤为突出(例如在 LIVE-VQC 上 SRCC 提升 0.4%)。
- IAA (图像美学评估):在 AVA 数据集上,QPT V2 取得了 SRCC 0.865 和 PLCC 0.875 的 SOTA 结果,显著超越了之前的最佳方法(如 Q-Align, LIQE 等)。
- 数据效率:即使仅使用 60% 的微调数据,QPT V2 也能达到与利用文本辅助知识的方法(如 LIQE, VILA)相当的性能,证明了其强大的迁移学习能力。
- 对比其他预训练范式:QPT V2 在相同骨干网络下,性能显著优于监督训练、从头训练 (Train-from-scratch) 以及基于对比学习 (MoCo, QPT) 的预训练方法。
5. 意义与影响 (Significance)
- 解决数据瓶颈:QPT V2 提供了一种无需大量标注数据即可训练高性能视觉评分模型的新范式,有效缓解了 VS 领域标注数据稀缺的痛点。
- 统一任务视角:证明了质量评估和美学评估在底层特征学习上的共通性,通过 MIM 实现了单一框架解决多任务的目标。
- 指导未来研究:该工作揭示了 MIM 在像素级重建任务中对细粒度失真和视觉属性的感知潜力,为未来视觉任务(特别是涉及感知质量的任务)的预训练策略提供了新的设计思路(如关注 HR/HFC 数据、特定的退化策略和多尺度融合)。
- 开源贡献:代码和模型已开源,推动了社区在视觉评分领域的进一步发展。
总结:QPT V2 通过精心设计的预训练策略,成功将掩码图像建模从高层语义理解扩展到细粒度的感知质量与美学评估,在多个基准测试中刷新了 SOTA,是视觉评分领域的一项重要进展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。