← 最新论文
💻 computer science

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

本文介绍了 LongAV-Compass,这是一个系统性基准,旨在通过采用一个评估超过 20 个细粒度质量、一致性和连贯性维度的综合框架,统一基于文本、图像和视频条件模态的分钟级音视频生成评估。

原作者: Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Hao
发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Haotian Wang, Yuanxing Zhang, Pengfei Wan, Leye Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位电影导演。长期以来,电影行业只要求你制作5 秒钟的预告片。你可以让这些预告片看起来惊艳无比,而且有许多评委可以告诉你灯光是否到位,或者演员是否在恰当的时机露出了微笑。

但现在,行业要求你制作完整的 60 分钟电影。突然间,仅仅拍好一个场景已经不够了。你必须确保主角在最后一幕中的形象与第一幕时保持一致,故事从头到尾逻辑通顺,且音效与动作完美契合。

问题出在哪里?评委(评估工具)仍然只接受过评估 5 秒钟预告片的训练。它们不知道如何识别发生在第 40 分钟的剧情漏洞,或者当电影时长过长导致角色面部开始扭曲变形时该如何判断。

“LongAV-Compass”登场了。

这篇论文介绍了一种全新的、专门的“评委”,专为评估这些新的长分钟视频而设计。其工作原理简单分解如下:

1. 三种类型的导演(任务)

新的评委测试三种不同的电影制作方式:

  • 文本到电影(T2AV): 你给评委一个剧本(文本),它必须制作出整部电影。
  • 图片到电影(I2AV): 你给评委一张角色的单张照片,它必须让该角色动起来并演绎一个故事,同时保持其面部与照片完全一致。
  • 视频到电影(V2AV): 你给评委电影的前 15 秒,它必须在不改变风格或角色的情况下,完成剩余的故事。

2. “指南针”地图(基准)

研究人员构建了一个包含284 个具体测试案例的库。可以将这些案例想象成 284 个不同的“剧本”或“挑战”,范围从简单的视频博客到复杂的商业广告。

  • 它们按难度进行了组织:有些很简单(一个人说话),有些则很难(涉及多人的汽车追逐戏及特定的物理效果)。
  • 它们涵盖了不同的类型:如“品牌广告”(推销产品)或“内容创作者”(讲述有趣的故事)。

3. 评委如何评分(指标)

LongAV-Compass 不像以往那样只给出一个像"10 分制中的 8 分”这样的单一分数,而是像一位诊断医生。它在 20 多种不同的“生命体征”上对视频进行检查:

  • 故事是否发生了?(事件完成度):视频是否真正完成了剧本所要求的内容?
  • 演员是否保持一致?(身份一致性):主角的面部或服装是否在途中发生了奇怪的改变?
  • 故事是否流畅?(连贯性):视频是否在场景之间出现跳跃或冻结?
  • 声音是否匹配?(同步性):当视频中有一扇门被重重关上时,的关门声是否在同一时刻响起?
  • 整部电影是否可看?(整体呈现):如果你看完整个视频,它是否感觉像是一个完整、精致的产品?

4. 结果(谁通过了测试?)

研究人员使用这个新的“指南针”测试了11 种不同的 AI 视频生成器(包括大型商业公司和开源项目的混合体)。

  • 大赢家: 顶级商业模型(如"Seedance"和"Kling")总体表现最佳。它们能够保持角色的一致性,并讲述长达一分钟的连贯故事。
  • 挣扎者: 许多开源模型可以制作出几秒钟内漂亮的画面,但随着视频变长,故事分崩离析,角色改变面孔,或者音频变得怪异。
  • “产品”问题: 最难的测试是“品牌广告”(推销产品)。大多数 AI 在此处表现挣扎。它们无法可靠地按步骤展示产品的使用过程,而不搞乱逻辑或视觉效果。

5. 为什么这很重要

论文认为,我们不能再仅仅查看带有单一数字的“排行榜”了。一个 AI 可能擅长制作 5 秒钟的片段,但在 60 分钟的影片中却表现糟糕。

LongAV-Compass 是一个工具,能帮助我们确切地看到这些 AI 系统在哪里失败。它就像机械师的诊断电脑,会告诉你“引擎运行 10 分钟没问题,但刹车在 20 分钟后失效”,而不是仅仅说“这辆车坏了”。

简而言之: AI 视频的世界正从制作短片成长为制作完整的电影。这篇论文构建了第一把能够真正衡量这些电影质量的尺子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →