想象一下,你拥有一位世界级的艺术评论家,他一生都在观察数百万幅画作。这位评论家(即 MLLM,多模态大语言模型)拥有惊人的、直觉性的感知力,能够分辨一段视频是“好”还是“坏”。他可以看着视频说:“这感觉像是一部‘好’电影,”或者“这感觉像是一部‘差’电影。”
然而,这里有一个问题:这位评论家所使用的语言与你新项目所需的特定评分系统略有不同。
- 旧方法: 为了让这位评论家适配你的特定评分系统,你必须雇佣一个教师团队从头开始重新训练他,向他展示数千个新示例,并支付昂贵的费用请人类评委进行评分。这既缓慢又昂贵,且需要海量的数据。
- DPC-VQA 方法: 你不需要重新训练评论家,只需询问他的基础观点(他的“感知”),然后雇佣一个极其微小、廉价的计算器(“校准分支”)来计算出究竟需要对他的观点进行多少调整,以匹配你的特定评分系统。
以下是该论文如何使用简单的类比来拆解这一过程的:
1. 问题所在:“昂贵重训”陷阱
目前,如果你想使用智能 AI 来评判某种新型视频(例如 AI 生成的视频与真实用户视频)的质量,你通常必须重新训练整个 AI。
- 成本: 这就像为了换个油漆颜色而雇佣一整支大型建筑队去重建一座房子。
- 数据: 你需要数千个已经被人类评分过的视频(称为 MOS 或平均意见得分)。让真人观看并评分视频是非常昂贵且耗时的。
2. 洞察:评论家已经对了一半
作者注意到了一些有趣的现象:如果你拿出一个预训练好的 AI 评论家,并在没有任何特殊训练的情况下直接让它评判一段视频,它的猜测实际上已经非常接近人类的评分了。
- 类比: 假设评论家说:“这段视频是 7 分(满分 10 分)。”人类评委可能实际给出的评分是 7.5 分。评论家并没有错,他只是需要一点点微小的推动。
- 发现: 评论家的猜测与真实分数之间的差异(即“残差”)并不是随机噪声。它遵循一定的模式。如果评论家认为一段视频很“差”,那么所需的调整方式与他认为一段视频很“优秀”时是不一样的。
3. 解决方案:DPC-VQA(感知与校准解耦)
该论文建议将这项工作分为两个截然不同的部分:
部分 A:冻结的评论家(感知)
- 这是那个庞大、聪明的 AI 模型。
- 关键点: 我们将其冻结。我们完全不改变它的“大脑”。它保持原样,正如它被训练时的样子。
- 它的任务仅仅是观察视频并给出一个“基础分数”(例如“尚可”或“良好”)以及一个“置信水平”(它有多确定)。
部分 B:微小的计算器(残差校准)
- 这是一个非常小、轻量级的 AI 模块。
- 它的任务是观察评论家的基础分数和视频细节,然后计算出修正值。
- 数学公式:
最终得分 = 基础分数(来自评论家)+ 修正值(来自计算器)
- 因为评论家已经做对了 90%,所以计算器只需要学习剩下的 10%。这就像一个 GPS,因为它已经让你行驶在正确的公路上,所以它只需要告诉你“在 200 英尺后左转”。
4. 为什么这意义重大
- 更便宜: 你不需要重新训练那个巨大的 AI。你只需要训练那个微小的计算器。这使用的计算能力不到其他方法所需的量。
- 更快的数据: 你不需要数千个由人类评分的视频。即使你只有通常所需数据的 20%,该方法依然表现出色。
- 更灵活: 因为“评论家”保持冻结状态,你可以通过更换微小的计算器,将同一个 AI 用于不同类型的视频(真实视频、AI 生成视频等)。
5. 结果
作者在五个不同的视频数据集(包括真实用户视频和 AI 生成视频)上测试了该方法。
- 性能: 他们的这种方法以显著优势击败了其他“少样本”(few-shot)方法(即尝试用少量数据进行学习的方法)。
- 效率: 他们在仅训练极小比例的模型参数的情况下,实现了如此高的评分。
总而言之: DPC-VQA 不需要在每次想在不同的道路上行驶时都去重新制造汽车的引擎,而是保留了强大的引擎(预训练 AI)不变,仅仅添加了一个聪明的小型方向盘(校准分支),从而完美地引导其抵达目的地。
技术摘要:DPC-VQA
问题陈述
多模态大语言模型(MLLMs)在视频质量评估(VQA)方面展现出了极具前景的能力,但其在实际部署中面临着显著障碍。将这些大规模模型适配到新的视频领域或评分协议时,通常需要昂贵的端到端重训练和大规模平均意见得分(MOS)标注,而由于需要重复的人类主观评价,收集这些标注的成本极高。现有的基于 MLLM 的 VQA 方法在跨数据集适配方面往往表现不佳,因为它们要么需要针对特定场景进行微调,要么无法将其输出与目标基准测试的特定 MOS 量表对齐。此外,目前的少样本(few-shot)VQA 方法通常将表示学习与数据集特定的校准过程混淆在一起,限制了其泛化效率。
方法论:DPC-VQA
作者提出了 DPC-VQA(用于视频质量评估的感知与校准解耦框架),该框架将质量感知任务与得分校准任务分离。其核心假设是:预训练的 MLLM 已经编码了一个有用的通用感知先验;挑战不在于重新学习质量感知,而在于如何高效地将这一先验校准到目标 MOS 空间。
该框架由两个主要部分组成:
冻结的质量感知(基础先验):
- 一个冻结的 MLLM(实验中具体使用 Qwen3-VL-8B)处理输入视频帧及固定的质量提示词。
- 模型输出一个基础质量得分 (qb),该得分源自“质量词汇化器”(quality verbalizer)分布(例如,将“差”、“劣”、“中”、“良”、“优”等标记映射到标量锚点)。
- 模型还根据词汇化器分布的熵以及最后一层视觉隐藏状态 (Hvis) 输出一个置信度得分 (ub)。
- 至关重要的是,在训练期间 MLLM 的参数保持冻结,从而保留了预训练的感知知识。
轻量级残差校准:
- 一个可训练的分支预测一个残差修正 (Δ),用于将基础得分调整至目标 MOS 空间。
- 输入特征: 校准分支利用冻结的视觉标记 (Hvis)、从单独的预训练编码器(SlowFast)提取的辅助视频特征 (Haux)、基础得分 (qb) 以及置信度得分 (ub)。
- 机制:
- 特征被投影到一个共享潜空间,并被拼接成一个增强的标记库(token bank)。
- 可学习的**校准查询(calibration queries)**对该标记库进行交叉注意力计算,以提取校准感知的标记。
- 这些标记通过特征维度的缩放和平移(rescaling and shifting)受基础条件 (qb,ub) 的调制。
- 每个调制后的标记预测一个局部残差提议(包括幅度和方向),随后通过重要性加权进行聚合,生成最终的残差 Δ。
- 最终预测: 预测得分为 y^=qb+Δ。
训练目标
训练仅限于轻量级校准分支。目标函数结合了:
- Smooth L1 Loss: 用于监督最终预测值与地面真值(ground-truth)MOS 的一致性。
- 残差正则化: 一个惩罚残差幅度(∑∣Δ∣)的项,以确保修正保持为有界的调整而非完全的重新估计,从而稳定训练并保留先验。
核心贡献
- 解耦框架: 提出了 DPC-VQA,它将质量感知(冻结的 MLLM)与得分校准(轻量级分支)解耦,避免了昂贵的端到端重训练。
- 残差校准机制: 一种新型的逐标记有界残差估计和自适应聚合策略,通过将修正过程以基础得分和置信度为条件,实现了细粒度的适配。
- 高效性: 与基于 MLLM 的 VQA 方法进行全量微调相比,该方法使用的可训练参数量不足 2%,并且在仅使用 20% 的 MOS 标签时依然有效。
实验结果
作者在五个基准数据集上评估了 DPC-VQA:三个用户生成内容(UGC)数据集(KoNViD-1k, YouTube-UGC, LIVE-VQC)和两个人工智能生成内容(AIGC)数据集(T2VQA, Human-AGVQA)。
- 少样本性能: 在 5 折少样本划分(仅使用 20% 的数据进行训练)下,DPC-VQA 在所有五个数据集上均取得了最佳性能。
- 在 UGC 数据集上,其 SRCC 增益分别超过了最佳少样本基准模型 0.032、0.036 和 0.026。
- 在 AIGC 数据集上,它表现出显著的提升(SRCC 增益为 0.106 和 0.114),尽管使用了极少的标注数据,但在性能上仍能与专门的监督式 AIGC 方法相媲美。
- 消融实验:
- 残差 vs. 直接回归: 残差公式的表现优于直接回归和得分条件回归,证实了学习一种修正比重新学习得分更为有效。
- 信息来源: 结合冻结的 MLLM 标记、辅助特征、基础得分和置信度可以获得最佳结果,其中冻结的 MLLM 作为主要的感知基础。
- 查询聚合: 可学习的校准查询优于均值池化和自注意力聚合。
- 数据效率: 该方法即使在训练比例低至 10–20% 时仍能保持卓越性能,展示了在低数据量环境下的强大鲁棒性。
- 参数效率: 可训练参数量约为 1.55 亿(约为完整 82 亿参数模型的 1.9%),显著降低了优化成本。
意义与主张
论文声称,将 MLLM 适配到 VQA 的主要瓶颈不在于预训练模型缺乏感知能力,而在于难以将其输出与特定的目标评分协议对齐。通过将 MLLM 视为固定的感知先验,并将适配形式化为一个轻量级的残差校准任务,DPC-VQA 为 VQA 的部署提供了一条更具实用性和可扩展性的路径。作者认为,这种方法将关注点从特定场景的重新学习转向了高效的校准,使得在 MOS 标注稀缺或昂贵的场景下实现高质量 VQA 变得可行。实验结果表明,未来的 VQA 系统可以受益于利用冻结的感知先验,而不是仅仅依赖于针对每个新领域的端到端训练。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。