PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment
PreResQ-R1 是一种新颖的强化学习框架,它通过解耦响应与偏好目标,将绝对分值回归与相对排序统一起来,在图像和视频质量评估方面实现了最先进的性能,并具备强大的泛化能力和符合人类逻辑的推理能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当我们观察一张照片或一段视频时,大脑会瞬间判断其质量。我们会注意到颜色是否暗淡、边缘是否模糊,或者图像是否看起来有颗粒感。这种本能的判断就是研究人员所称的视觉质量评估。几十年来,计算机一直难以复制这种人类的能力。早期的尝试依赖于测量像素误差的僵化数学公式,但这些方法往往无法匹配人类对美感和清晰度的实际感知。近年来,强大的被称为“大语言多模态模型”的人工智能模型被训练用来观察并描述图像。然而,当这些模型被要求分配一个具体的质量分数时,它们往往表现得并不一致。如果你要求同一个模型两次评价同一张图片,它可能会给出两个截然不同的数字,或者其推理过程与其最终得分相矛盾。这种不稳定性使得这些系统很难在现实应用中获得信任,例如改进智能手机摄像头或确保流媒体视频的质量。
上海交通大学的一个研究团队开发了一种新方法来解决这个问题,创建了一个名为 PreResQ-R1 的系统。研究人员并没有强迫人工智能仅仅去猜测一个数字或盲目地遵循排名,而是教会了模型将两项不同的任务分开:稳定自身的推理逻辑,并使其偏好与人类判断保持一致。研究人员发现,以往系统的这种不稳定性源于模型倾向于为同一张图像生成迥异的解释。为了解决这个问题,他们设计了一种训练过程,奖励模型在内部逻辑上保持一致,同时确保其最终得分符合人类可能的判断。该系统将图像的评估分解为五个特定部分:色彩的生动程度、噪点或颗粒感的可见度、细节的锐利度、主体清晰度以及背景清晰度。通过在组合之前分别评估这五个方面,模型学会了构建一个更可靠且更详细的质量图景。
研究人员在各种图像和视频上测试了这种新方法,包括那些具有自然失真(如模糊或弱光)的图像,以及由其他人工智能工具生成的图像。他们发现,该系统显著优于现有方法。在涉及静态图像的测试中,新模型比之前的最佳方法在准确率上提升了 5.60%。对于挑战更大的视频质量评估(因为系统必须判断运动和时间),其准确率提升了 2.53%。至关重要的是,该模型不仅产生了更好的数字,还产生了更好的解释。当看到一张风景模糊的照片时,模型能正确识别出叶子脱焦以及背景缺乏细节,而不是仅仅给出一个关于图像“很差”的笼统评论。这种能够提供结构化、基于证据的评分理由的能力,使该系统更具可信度。
这项工作的成功依赖于一种模拟学习过程的两阶段训练策略。首先,模型被鼓励探索观察图像的多种不同方式,生成广泛的可能分数和理由。在此阶段,系统会对过于分散或不一致的答案进行惩罚,从而温和地引导模型走向稳定的思维方式。一旦模型找到了可靠的内部节奏,第二阶段则侧重于微调其偏好。在这里,系统将自己的判断与人类评分进行对比,学习调整分数以使其与人类感知保持一致。这种将“清晰思考”与“正确评分”分离的方法,使模型能够处理图像质量具有主观性或失真情况复杂的困难案例。研究人员还将此方法扩展到了视频领域,通过分析时间上的运动流和单个帧内的细节来进行分析,而无需重建视频中的每一个动作。
这项研究的影响不仅在于获得更高的分数。通过创建一个能够以符合人类感知的方式解释其推理过程的系统,这项技术为更稳健的数字媒体应用打开了大门。它表明,让人工智能理解视觉质量的关键不仅仅是喂给它更多的数据,而是要教它在做出最终判断之前,先在自身的推理上保持一致。这项研究证明,当一个模型被训练去稳定其内部逻辑,并随后将该逻辑与人类偏好对齐时,它可以达到以前无法企及的可靠水平。这种方法为开发能够自动增强图像、策划视频内容并确保我们屏幕上所见真正符合预期质量的工具,提供了一条充满希望的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。