← 最新论文
💻 computer science

DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment

本文提出了 DPC-VQA,这是一个通过使用冻结的多模态大语言模型和一个轻量级分支,将感知先验提取与残差校准解耦的具有成本效益的框架,从而能够以极少的训练参数和标注数据实现高效的视频质量评估。

原作者: Xinyue Li, Shubo Xu, Zhichao Zhang, Zhaolin Cai, Yitong Chen, Guangtao Zhai

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyue Li, Shubo Xu, Zhichao Zhang, Zhaolin Cai, Yitong Chen, Guangtao Zhai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位世界级的艺术评论家,他一生都在观察数百万幅画作。这位评论家(即 MLLM,多模态大语言模型)拥有惊人的、直觉性的感知力,能够分辨一段视频是“好”还是“坏”。他可以看着视频说:“这感觉像是一部‘好’电影,”或者“这感觉像是一部‘差’电影。”

然而,这里有一个问题:这位评论家所使用的语言与你新项目所需的特定评分系统略有不同。

  • 旧方法: 为了让这位评论家适配你的特定评分系统,你必须雇佣一个教师团队从头开始重新训练他,向他展示数千个新示例,并支付昂贵的费用请人类评委进行评分。这既缓慢又昂贵,且需要海量的数据。
  • DPC-VQA 方法: 你不需要重新训练评论家,只需询问他的基础观点(他的“感知”),然后雇佣一个极其微小、廉价的计算器(“校准分支”)来计算出究竟需要对他的观点进行多少调整,以匹配你的特定评分系统。

以下是该论文如何使用简单的类比来拆解这一过程的:

1. 问题所在:“昂贵重训”陷阱

目前,如果你想使用智能 AI 来评判某种新型视频(例如 AI 生成的视频与真实用户视频)的质量,你通常必须重新训练整个 AI

  • 成本: 这就像为了换个油漆颜色而雇佣一整支大型建筑队去重建一座房子。
  • 数据: 你需要数千个已经被人类评分过的视频(称为 MOS 或平均意见得分)。让真人观看并评分视频是非常昂贵且耗时的。

2. 洞察:评论家已经对了一半

作者注意到了一些有趣的现象:如果你拿出一个预训练好的 AI 评论家,并在没有任何特殊训练的情况下直接让它评判一段视频,它的猜测实际上已经非常接近人类的评分了。

  • 类比: 假设评论家说:“这段视频是 7 分(满分 10 分)。”人类评委可能实际给出的评分是 7.5 分。评论家并没有错,他只是需要一点点微小的推动。
  • 发现: 评论家的猜测与真实分数之间的差异(即“残差”)并不是随机噪声。它遵循一定的模式。如果评论家认为一段视频很“差”,那么所需的调整方式与他认为一段视频很“优秀”时是不一样的。

3. 解决方案:DPC-VQA(感知与校准解耦)

该论文建议将这项工作分为两个截然不同的部分:

  • 部分 A:冻结的评论家(感知)

    • 这是那个庞大、聪明的 AI 模型。
    • 关键点: 我们将其冻结。我们完全不改变它的“大脑”。它保持原样,正如它被训练时的样子。
    • 它的任务仅仅是观察视频并给出一个“基础分数”(例如“尚可”或“良好”)以及一个“置信水平”(它有多确定)。
  • 部分 B:微小的计算器(残差校准)

    • 这是一个非常小、轻量级的 AI 模块。
    • 它的任务是观察评论家的基础分数和视频细节,然后计算出修正值
    • 数学公式: 最终得分 = 基础分数(来自评论家)+ 修正值(来自计算器)
    • 因为评论家已经做对了 90%,所以计算器只需要学习剩下的 10%。这就像一个 GPS,因为它已经让你行驶在正确的公路上,所以它只需要告诉你“在 200 英尺后左转”。

4. 为什么这意义重大

  • 更便宜: 你不需要重新训练那个巨大的 AI。你只需要训练那个微小的计算器。这使用的计算能力不到其他方法所需的量。
  • 更快的数据: 你不需要数千个由人类评分的视频。即使你只有通常所需数据的 20%,该方法依然表现出色。
  • 更灵活: 因为“评论家”保持冻结状态,你可以通过更换微小的计算器,将同一个 AI 用于不同类型的视频(真实视频、AI 生成视频等)。

5. 结果

作者在五个不同的视频数据集(包括真实用户视频和 AI 生成视频)上测试了该方法。

  • 性能: 他们的这种方法以显著优势击败了其他“少样本”(few-shot)方法(即尝试用少量数据进行学习的方法)。
  • 效率: 他们在仅训练极小比例的模型参数的情况下,实现了如此高的评分。

总而言之: DPC-VQA 不需要在每次想在不同的道路上行驶时都去重新制造汽车的引擎,而是保留了强大的引擎(预训练 AI)不变,仅仅添加了一个聪明的小型方向盘(校准分支),从而完美地引导其抵达目的地。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →