VGA-BenchV2: An Expanded Unified Benchmark and Multi-Model Framework for Evaluating Video Aesthetics and Generation Quality
本文介绍了 VGA-BenchV2,这是一个扩展的人类对齐基准测试和多模型框架,它通过显著扩大标注规模和评估维度,来共同评估视频生成的质量与美学,同时还建立了一个从评估到优化的流水线,以微调生成器从而提升美学对齐度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在过去的几年里,计算机已经学会了从简单的文字描述中创造动态图像。这项被称为“文本生成视频”的技术,已经从实验性的草图演变为能够制作出连贯、稳定且视觉效果惊人的场景的工具。艺术家、电影制作人和广告商正开始使用这些系统来构想新的世界,但一个根本性的问题仍然存在:我们如何知道生成的结果是否真的好?长期以来,科学家们通过检查技术细节来衡量这些视频,例如帧是否流动平滑,或者计算机是否字面上遵循了指令。然而,一段视频即使在技术上趋于完美,仍可能显得平淡、毫无生气或缺乏艺术感。缺失的一环是衡量人类观看视频体验的方法——即它的美感、情绪和情感共鸣。
来自蚂蚁集团、北京电影学院和北京通用人工智能研究院的研究团队通过一个名为 VGA-BenchV2 的新框架解决了这一挑战。他们的工作超越了简单的技术检查,创建了一个能够像人类一样理解并评估视频美学的系统。他们构建了一个包含超过 60,000 个视频的海量库,这些视频由 12 种不同的计算机模型生成,并使用 1,016 个精心编写的提示词来测试特定的视觉质量。为了教计算机如何评判这些视频,该团队征集了人类专家提供的超过 36,000 条新的评分和标签。这些人类反馈被用于训练一支混合人工智能评估团队:其中一个专门负责给出关于美感的连续评分,另外两个则充当视觉评论家,识别特定的艺术标签并检查视频是否符合逻辑。结果表明,该系统不仅能对视频的美观程度进行排名,还能利用这种判断力帮助计算机模型进行自我学习和改进。
这一新框架的核心是从被动测量向主动引导的转变。在过去,基准测试就像成绩单,只是简单地告诉学生合格或不合格。而 VGA-BenchV2 更像是一位导师,它不仅解释哪里需要改进,还帮助学生进行练习。研究人员将他们的评估分为两个主要类别:美学和生成质量。美学方面关注艺术元素,如光影、色彩和谐度、构图以及场景的整体氛围。生成方面则检查视频是否符合物理常识、角色动作是否自然,以及故事是否符合书面提示。通过将这些广泛的概念分解为 52 个具体的子类别,团队确保了评估的详细性和精确性,涵盖了从摄像机镜头类型到流体运动真实感的所有内容。
为了构建这个系统,团队首先准备了一组提示词,即给视频生成器提供的书面指令。这 1,016 个提示词旨在触发特定的视觉效果,确保生成的视频能够根据明确的标准进行公平评判。随后,他们收集了 12 种领先的视频生成模型的输出,形成了一个超过 60,000 个视频的资源池。关键步骤在于人类标注阶段。研究人员收集了大量的反馈,在现有数据的基础上增加了 36,000 条新的任务级标注。这包括超过 16,000 条关于美学质量的评分(人类在 0 到 10 的量表上为视频打分),以及超过 13,000 个关于美学标签的标注(人类识别特定的视觉属性,如光的颜色或镜头类型)。他们还添加了数千条关于生成质量的笔记,以确保视频的真实性和一致性。
凭借如此海量的带有标签的人类数据,团队训练了三个专门的 AI 评估器。第一个被称为 VAQA-Net,它学习预测视频美感的连续得分,有效地模仿了人类对构图和色调的感知。另外两个评估器,VTag-Net 和 VGQA-Net,是基于大型视觉语言模型的,这类模型是能够同时理解图像和文本的高级系统。这些模型被训练来充当评论家:一个负责识别特定的艺术标签(例如场景是使用柔光还是高对比度),另一个则回答关于视频真实性和一致性的详细问题。这种组合使得系统既能提供数值评分,又能提供关于视频为何优劣的详细且可解释的说明。
VGA-BenchV2 的真正力量在于其闭环连接了评估与改进的能力。一旦评估器被训练得能够匹配人类偏好,研究人员就将它们作为强化学习的奖励系统。在这个过程中,生成视频的计算机模型会被展示其自身的创作成果,并根据评估器预测的美学质量获得评分。如果得分高,模型就会被鼓励制作类似的视频;如果得分低,则会被引导改变其方法。在一项特定测试中,研究人员应用这种方法对名为 Wan2.1 的视频生成器进行了微调。结果显示,该模型的平均美学得分有所提高,生成的视频展现出更具吸引力的视觉构图和更高的整体质量。这证明了该框架不仅仅是在衡量性能,它还在积极驱动技术走向更好的艺术产出。
该研究还对当前视频生成领域的最前沿水平进行了全面的排名。通过将新的评估器应用于 12 种不同的模型,团队能够在所有 52 个维度上对它们进行比较。结果揭示了各模型在处理艺术控制与技术一致性方面的显著差异。一些模型擅长遵循复杂的提示词,而另一些模型则能产生更具视觉愉悦感的成果。数据表明,尽管许多模型在技术保真度方面有所进步,但在持续产生符合人类审美偏好的视频方面仍存在巨大差距。这凸显了该新框架的重要性,它提供了一种标准化的方法来衡量这些微妙但至关重要的品质。
最终,VGA-BenchV2 代表了使人工智能更加契合人类感官意识的重要一步。通过将大规模的人类判断数据集与复杂的混合评估系统相结合,研究人员创建了一个能够以以往无法实现的深度和细微差别来评估视频生成的工具。该框架弥合了技术能力与艺术表达之间的鸿沟,为未来的模型提供了一条路径,使其不仅学会生成像素,更学会创造能引起人们共鸣的艺术。随着视频生成技术的不断演进,此类工具对于确保我们所构建的机器不仅能创造真实的影像,还能创造美丽的内容,将变得至关重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。