RAVEN-Eval: Rubric-Guided Automatic Evaluation for AI Video Generation Models Based on LMM Preference Judgement
本文介绍了 RAVEN-Eval,这是一个可扩展的、基于评分标准的自动化评估框架,它利用大语言多模态模型(LMM)的偏好判断,在最小化人工标注成本的同时,可靠地区分最先进 AI 视频生成模型之间细粒度的质量差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一家规模宏大、高科技电影制片厂的导演,这里的演员实际上是超级聪明的计算机。这些计算机被称为“AI视频生成器”,它们现在仅通过阅读你输入的一句话就能从零开始创造出整个场景。但问题在于,它们变得如此出色,以至于“相当不错”的视频与“令人惊叹”的视频之间的差异,就像两种蓝色色调之间的细微差别一样。在过去,你可以直接请一个人来看,然后说:“那个看起来更好。”但现在,每天都有成千上 عشر个视频被制作出来,雇佣足够多的人来观看所有视频将耗费巨额成本且极其耗时。此外,人类也会感到疲劳,并可能忽略微小的细节。这就是科学家们面临的问题:当这些超先进的计算机艺术家都在接近完美的水平上进行表演时,你该如何为它们评分?而且你又无法负担为每一个片段都聘请人类观看的费用。
这正是论文《RAVEN-Eval》发挥作用的地方。它就像是一个全新的、极其严格的裁判系统,旨在无需人类坐在那里观看每一个视频的情况下,对这些AI电影进行评判。研究人员意识到,与其问计算机“请给这个视频打1到10分”,这通常会造成困惑和不一致,不如问“这两个视频中哪一个更好?”这被称为“成对比较”(pairwise comparison),对于人类和计算机来说,这都更容易做出决定。但为了确保计算机裁判不会仅仅挑选最华丽的视频,团队为每一项任务都提供了一本特殊的规则手册,或者叫作“评分标准”(rubric)。这就像是给评委一份清单,上面写着:“如果提示词要求一个红色的球,那么球必须是红色的,”或者“如果提示词要求液压机压碎一只鸭子,那么鸭子应该是被挤压变形,而不是爆炸。”通过使用这些具体的规则,该系统可以识别出将顶尖AI模型与其他模型区分开来的那些细微、精细的差异。
由上海交通大学和上海人工智能实验室的研究人员领导的这项研究团队,构建了一个庞大的测试场,称为 RAVEN-Eval 基准测试(Benchmark)。他们并没有向AI投掷随机的提示词;而是精心策划了250个不同的任务,涵盖了从简单的文本生成视频请求到复杂的图像生成视频挑战(即AI必须填补场景缺失的中间部分)。他们生成了超过4500个视频,用以测试全球顶尖的20个AI视频模型。他们没有让AI盲目地自我评价,而是使用了一个由大语言多模态模型(LMMs)驱动的“评判”系统——这些本质上是能够理解图像和文本的“AI大脑”。这些AI评委被赋予了针对每项任务的具体规则手册,并被要求进行侧重对比。
结果非常引人入胜。研究人员发现,当他们给AI评委这些详细的、特定于任务的规则手册时,该系统变得极其擅长分辨顶尖模型之间的差异。事实上,他们的新系统与人类专家的意见一致性,比以往仅要求给出通用分数或使用固定清单的方法要高得多。他们甚至创建了两个排行榜:一个用于对20个AI视频模型进行排名(展示谁是目前的顶级艺术家),另一个用于对13个不同的AI评委本身进行排名(展示哪个AI大脑是最准确的裁判)。他们发明的最酷的技巧之一叫做“基于锚点的插入”(anchor-based insertion)。想象一下,你有一个由前20名跑者组成的排行榜,现在出现了一名新选手。与其让这名新选手与所有人进行比赛(这会耗费大量时间),你只需让他们与从顶尖、中层和底层中精心挑选出的几名“锚点”选手进行比赛。这能让你以更少的精力确定新选手在排名中的位置。
最终,这篇论文表明,这种利用AI来评判AI的、基于规则引导的方式是一种可扩展且可靠的路径。它证明了我们不需要完全依赖昂贵的人类标注员来跟上AI视频生成的快速步伐。通过使用智能的、基于规则的比较,我们可以建立一个值得信赖的系统,使其随着它所衡量的模型的进化而同步进化,确保随着这些数字艺术家的进步,我们欣赏和评定其作品的能力也能随之提升。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。