Breaking Annotation Barriers: Generalized Video Quality Assessment via Ranking-based Self-Supervision
本文提出了一种自监督学习框架,该框架利用排序学习范式和迭代自改进策略,在大规模无标签网络视频上训练出一个通用的视频质量评估模型,该模型在不依赖劳动密集型人工标注的情况下实现了最先进的性能以及更优越的分布外泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《打破标注壁垒:基于排序的自监督通用视频质量评估》的通俗解读,辅以生动的类比。
核心难题:“人类裁判”的瓶颈
想象你运营着一个庞大的视频流媒体服务。在向数百万用户展示视频之前,你需要知道视频质量是好是坏。通常,这需要一支人类专家团队观看成千上万个视频并进行评分。
问题在于:这既缓慢、昂贵,又无法扩展。 你无法雇佣足够多的人类去观看每一个新视频,尤其是当 TikTok 和 YouTube 等平台上的内容呈爆炸式增长时。此外,人类专家擅长评判他们见过的内容,但面对未经训练的新类型视频(如高速游戏或 AI 生成内容)时,他们往往会感到困惑。
解决方案:教机器人“打网球”
研究人员决定不再让计算机给视频打出一个具体的分数(比如“满分 10 分中的 7.5 分”),而是教计算机玩视频网球。
在网球中,你不需要确切知道球速有多快就能知道谁赢得了这一分;你只需要知道哪位球员击球更好。同样,这篇论文教导计算机一次观看两个视频,然后简单地判断:“视频 A 比视频 B 好,还是视频 B 比视频 A 好?”
这被称为排序。对于计算机(以及人类)来说,比较两件事物比给单一事物赋予一个完美的数值要容易得多。
如何构建训练数据(“健身房”)
为了训练这台计算机,他们需要海量的练习比赛。但他们无法让人类裁判为每一场比赛标注。因此,他们利用两个巧妙的技巧来创建自己的“自动生成”练习数据:
- “裁判团”技巧:他们选取了五个现有的顶级视频质量模型(当前的“冠军”),让它们比较数百万对视频。如果这五位裁判一致认为视频 A 优于视频 B,他们就将该对标记为视频 A 的“胜利”。他们综合了这五个模型的意见,创造了一个非常可靠的“超级裁判”。
- “人为破坏”技巧:他们选取干净的视频,并故意以特定方式破坏它们(使其模糊、变暗、充满噪点或进行压缩)。由于他们确切知道施加了多少破坏,他们可以肯定原始版本优于被破坏的版本。这就创建了一个巨大的“显而易见”的比较库。
结果:他们构建了一个包含70 万对视频的数据集。这就像一个图书馆,里面存放着 70 万场网球比赛,所有比赛都自动标注,无需人类观看一场。
秘密武器:“自我提升”循环
这是他们方法中最具创意的部分。通常,你训练一次机器人然后停止。但这支团队做了不同的事:他们让机器人给自己的作业打分。
- 第一轮:他们利用由“裁判团”创建的 70 万对数据训练一个模型。
- 第二轮:一旦该模型训练完成,他们就将其转化为一个新的裁判。他们让这台新机器人重新评估部分视频对。因为机器人已经从第一轮中学习了,它可能会发现旧裁判忽略的细微差异。
- 第三轮:他们将旧标签与新、更智能的标签结合,训练出一个更优秀的模型。
这就像一个学生参加模拟测试,研究答案,然后再次参加测试以获得更高的分数。通过重复这种“自我提升”循环,模型在识别质量问题方面变得越来越聪明,甚至包括它从未见过的质量问题。
结果:通才,而非专才
大多数视频质量模型都是专才:它们擅长评判电影,却不擅长评判电子游戏。
这篇论文中构建的模型是一个通才。
- 零样本能力:当他们在从未见过的视频(如高帧率体育或 4K 游戏)上测试它时,其表现与昂贵的人类训练模型一样好,甚至更好。
- “分布外”胜利:用论文的语言来说,“分布外”(OOD)意味着“我们未训练过的奇怪内容”。他们的模型没有被这些奇怪内容搞糊涂;它轻松应对。
总结
可以将这篇论文视为一份食谱,教计算机如何在不雇佣任何人类观看视频的情况下评判视频质量。
- 停止索要分数;开始要求比较(视频 A 对比视频 B)。
- 利用现有的机器人裁判团和人为破坏的视频来创建一个庞大的训练库。
- 让机器人给自己的模拟测试打分,从而随时间推移变得更聪明。
结果是一个训练成本低廉、可扩展性无限的视频质量模型,它出奇地擅长评判任何类型的视频,从烹饪教程到高速赛车。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。