← 最新论文
💻 computer science

QPT V2: Masked Image Modeling Advances Visual Scoring

该论文提出了基于掩码图像建模(MIM)的 QPT V2 预训练框架,通过定制预训练数据、引入退化增强及改进模型结构,实现了统一的视觉质量与美学评估,并在 11 个下游基准测试中展现出超越现有最先进方法的优越性能。

原作者: Qizhi Xie, Kun Yuan, Yunpeng Qu, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Qizhi Xie, Kun Yuan, Yunpeng Qu, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 QPT V2 的新人工智能模型,它的核心任务是给图片和视频“打分”

想象一下,你发了一张自拍到朋友圈,或者剪辑了一段旅行视频。你想知道大家觉得这张照片“美不美”(审美评分),或者这段视频“清不清晰、有没有卡顿”(质量评分)。以前,电脑很难像人一样精准地给出这种主观评价,而 QPT V2 就是为了解决这个问题而诞生的“超级评委”。

下面我用几个生活中的比喻来拆解这篇论文的核心内容:

1. 核心难题:为什么电脑以前“打分”不准?

以前的电脑打分系统,就像是一个只读过几本教科书的学生

  • 数据太少:要训练一个能像人一样审美的 AI,需要成千上万张由真人打分的图片。但收集这些“真人打分”非常昂贵且耗时(就像要请几千人来给每一张照片打分)。
  • 结果:因为“作业”做得不够多,这个学生遇到没见过的图片(比如新的滤镜、新的拍摄风格)时,就不知道该怎么打分了,表现得很笨拙。

2. 解决方案:QPT V2 的“特训”方法

作者没有直接让学生去背答案(打标签),而是让他先进行了一场高强度的“蒙眼复原”特训,这就是论文中提到的 MIM(掩码图像建模) 技术。

比喻:蒙眼拼图游戏

想象你面前有一幅完整的画,但有人把画布遮住了 75%(只露出一点点)。你的任务是根据露出的那一小部分,把被遮住的部分在脑海里“画”出来

  • 以前的做法:只给你看普通的风景照,遮住一部分让你猜。
  • QPT V2 的做法:它升级了这个游戏,从三个维度进行了“魔鬼训练”:

3. QPT V2 的三大“升级秘籍”

秘籍一:选更难的“教材” (Data)

  • 普通教材:以前的训练数据(如 ImageNet)就像低分辨率的旧报纸,或者背景里全是杂乱的草地,主角(人脸或物体)很小。
  • QPT V2 的教材:它专门挑选了高清(HR)主角突出(HFC) 的图片。
    • 比喻:这就像是从“模糊的远景照”换成了"4K 高清特写”。因为图片更清晰、主体更明确,AI 在复原被遮住的部分时,必须仔细观察皮肤的纹理、光影的细节。这让它学会了如何捕捉“美”和“质感”。

秘籍二:制造更真实的“破坏” (Degradation)

  • 普通破坏:以前的训练只是简单地把图片裁切一下,或者稍微变暗。
  • QPT V2 的破坏:它模拟了现实生活中各种糟糕的拍摄环境
    • 比喻:它故意给图片加上“噪点”(像老电视雪花)、“模糊”(像手抖了)、“颜色失真”(像白平衡错了),甚至把图片从 RGB 颜色空间强行转换成灰度再转回来。
    • 关键点:研究发现,颜色空间的转换(CST) 是最有效的训练方式。就像让一个习惯了看彩色照片的人,突然去猜黑白照片里的色彩分布,这能极大地锻炼他对“色彩美感”的敏感度。

秘籍三:用“多尺度”的眼睛看世界 (Model)

  • 普通眼睛:以前的模型可能只盯着一个局部看,或者只看整体轮廓。
  • QPT V2 的眼睛:它拥有一双既能看宏观构图,又能看微观细节的“火眼金睛”。
    • 比喻:就像一位资深摄影师,既能一眼看出照片的构图是否平衡(宏观),又能看清花瓣上的露珠是否清晰(微观)。QPT V2 通过融合不同层级的特征,同时掌握了这两项技能。

4. 训练成果:它有多强?

经过这种“蒙眼复原”的特训后,QPT V2 去参加了 11 个不同的考试(涵盖了图片质量、视频质量、图片审美等任务)。

  • 成绩:它在所有考试中都拿到了第一名(SOTA,State-of-the-Art)
  • 对比
    • 它比那些靠“死记硬背”(监督学习)的模型更聪明,因为它学会了举一反三。
    • 它比那些靠“找不同”(对比学习)的模型更敏锐,因为它能看清像素级的细节。
    • 甚至,它只用 60% 的考试题目 进行微调,就能达到别人用 100% 题目训练出来的效果,说明它真的“悟性”很高。

总结

QPT V2 就像是一个天赋异禀的艺术生
它没有死记硬背成千上万张“满分试卷”(因为那些太少了),而是通过玩高难度的“蒙眼复原”游戏,在高清、多变、甚至被“破坏”过的图片中,自己悟出了什么是“清晰”、什么是“美”、什么是“构图”。

最终,它不仅能给照片和视频打分,还能像人类一样,敏锐地感知到那些细微的画质瑕疵和美学价值。这项技术未来可以帮视频平台自动筛选高清内容,或者帮摄影师自动修图,让视觉体验变得更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →