← 最新论文
💻 computer science

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

本文介绍了 VideoArgus,这是一个统一的、基于评分标准的框架,它能够生成针对特定样本且对输出盲视的评估标准,从而为多样化的视频生成与编辑任务提供基于证据的分数和诊断报告,并且与现有基准相比,在与人类判断的一致性方面取得了更优异的表现。

原作者: Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机可以构思电影的世界,只需将“一只骑着滑板的猫”这样简单的句子转化为动态画面。这就是**视频生成(video generation)**这一领域的激动人心的前沿——在这个领域,人工智能通过阅读指令来学习如何创作和编辑视频。但棘手的部分在于:我们如何知道计算机做得是否“好”?过去,科学家们尝试使用固定的清单来为这些 AI 电影评分,就像老师给每个学生都考同样的数学试卷,而不论他们被要求解决什么问题。如果提示词要求特定的气球数量,固定的测试可能会忽略这一点;如果提示词要求角色在整个片段中保持面部一致,标准的测试可能无法察觉面部是否发生了变化。因为这些 AI 电影如此具有创意且多样化,一种“一刀切”的评分系统往往无法捕捉到真正的魔力——或者说,真正的错误。

VideoArgus 应运而生,这是一种全新的 AI 视频评分方式,它感觉不像是一场僵化的考试,更像是一个聪明的、定制化的侦探故事。VideoArgus 不再为每个人使用单一、不变的规则手册,而是扮演一名出色的编辑,阅读每一个视频请求的具体指令,然后为那项特定的工作编写一份全新的、定制化的评分细则。它会观察提示词、图像和目标,然后说:“好吧,对于这个特定的视频,我们需要检查文本是否可读、猫是否还留在滑板上,以及背景是否闪烁。”随后,它会使用一组专门的工具和 AI “眼睛”来搜寻这些特定事物的证据,并根据视频原本应该达成的目标进行评分。这种方法表明,通过针对特定任务量身定制规则,我们可以更清晰地了解这些 AI 模型究竟表现如何,从而帮助我们在未来构建出更好的视频创作者。

“一刀切”式评分的问题

把评估 AI 视频生成想象成评判一场烹饪比赛,而每位参赛者都被要求做不同的菜肴。有人在做汤,有人在烤蛋糕,还有人在煎牛排。如果你使用一个固定的清单来考核所有人,且只问“热不热?”以及“味道好吗?”,你就会偏离重点。你不会知道蛋糕是否烤焦了,或者汤是否太咸了,因为清单的设计并未针对这些特定的食材。

长期以来,视频评估一直以此种方式运作。科学家们使用具有固定维度的基准测试——如“运动质量”或“文本对齐度”——并将它们应用于每一个视频,无论提示词要求什么。但视频生成是混乱且多变的。有时提示词要求特定的物体数量(如“五个红苹果”),有时要求保持角色的面部一致,有时则要求根据新指令编辑视频。固定的清单往往会遗漏这些特定实例的细节。这就像试图用同一把尺子去测量摩天大楼和蘑菇的高度;你可能会得到一个数字,但它无法告诉你这株蘑菇对于它的物种来说是否真的足够高。

VideoArgus:定制化侦探

该论文的作者引入了 VideoArgus,这是一个通过创建**特定于样本的评分细则(sample-specific rubric)**来改变游戏规则的框架。想象一下,在你观看电影之前,一位超级聪明的 AI 编辑先阅读了提示词和输入图像。然后,它为那个特定的请求编写了一份独特的“评分表”。这份表格不是通用的列表,而是一个详细的计划,上面写着:“对于这个视频,我需要检查标牌上的文字拼写是否正确、狗是否在绕圈跑,以及光照是否保持一致。”

至关重要的一点是,这份评分表是**输出盲(output-blind)*的。AI 在看到视频之前*就写好了规则。这防止了系统根据视频看起来有多好而调整其规则。它确保了由同一个提示词生成的每一个视频,都是根据完全相同的定制标准进行评判的。

一旦写好定制细则,VideoArgus 就会开始工作。它不仅仅是问一个通用的 AI:“这个视频好吗?”相反,它会将视频拆解成微小的部分。对于定制表上的每一条规则,它都会使用特定的工具来收集证据:

  • 如果规则涉及计数,它可能会使用一个计数工具。
  • 如果规则涉及文本,它会使用光学字符识别(OCR)工具来读取屏幕上的内容。
  • 如果规则涉及追踪角色,它会使用视觉工具逐帧追踪该角色。

系统随后将这些证据片段结合起来,给出分数和理由。这就像一名侦探,不仅是猜测凶手是谁,而是通过收集指纹、不在场证明和证人证词来构建一个坚实的案情。最终结果是一份详细的报告,它不仅告诉你视频得分多少,还告诉你为什么,指出它在何处成功或失败。

VideoArgus-Bench:大型测试厨房

为了证明这一理念的有效性,团队构建了 VideoArgus-Bench,这是一个包含 1,026 个不同视频挑战的大型集合。这些挑战涵盖了五种不同类型的视频任务:

  1. 文本生成视频 (T2V): 仅凭文字制作视频。
  2. 文本与图像生成视频 (TI2V): 通过文字和一张起始图片制作视频。
  3. 文本与主体生成视频 (TS2V): 制作一个特定角色(如人物或动物)保持一致的视频。
  4. 文本驱动的视频编辑 (TV2V): 根据文本指令修改现有视频。
  5. 文本与主体驱动的视频编辑 (TSV2V): 在编辑视频时保持特定主体的一致性。

他们利用 653 张独特的图像和 416 段独特的视频创建了这些挑战。对于这 1,026 个输入中的每一个,他们都生成了一个定制细则并将其“冻结”。这意味着规则是不可更改的,这确保了当他们测试不同的 AI 模型时,所有人都在遵循完全相同的定制规则。

他们的发现:更好的成绩,更清晰的答案

研究人员使用 VideoArgus-Bench 测试了 55 种不同的 AI 模型与任务组合。他们还创建了一个单独的“人类对齐(human alignment)”集,包含 1,260 段视频,由 15 名志愿者对视频进行评分,以观察计算机与真实人类的判断是否一致。

结果令人振奋。VideoArgus 与人类判断的一致性远高于旧有的固定清单法。

  • 更高的契合度: 在比较计算机对视频的排名与人类对视频的排名时,VideoArgus 显示出了更强的相关性(通过 Spearman 和 Kendall 相关系数衡量)。例如,在文本生成视频任务中,VideoArgus 的相关系数达到了 0.496,而旧方法仅为 0.162。这意味着 VideoArgus 能更准确地判断哪些视频是人类真正喜欢的。
  • 工具的力量: 他们发现,使用专门的工具(如用于文本的 OCR 或用于运动的追踪工具)会产生巨大影响。当他们移除这些工具而仅使用通用 AI 进行猜测时,得分就会下降。这表明,拥有合适的“工具”对于准确评分至关重要。
  • 一致性: 他们测试了如果使用不同的 AI 模型来编写细则或进行评分,结果是否会发生变化。视频模型的排名基本保持不变(相关系数在 0.900.93 之间),这表明该方法具有鲁棒性,并不依赖于某一个特定的 AI 模型是否完美。

变聪明的代价

一个有趣的发现是关于成本的问题。为每个视频编写定制细则需要一定的计算能力和资金(生成细则的平均成本约为每段视频 0.23 美元)。然而,由于这份细则在编写一次后,即可被重复用于解决该相同提示词的所有模型,因此成本被分摊了。一旦细则准备就绪,实际的视频评分可以在标准计算机上本地完成,这使得大规模测试非常高效。

总结

VideoArgus 表明,评估 AI 的未来不在于更大的通用清单,而在于更具针对性。通过为每一个视频请求创建定制的、基于证据的评分计划,我们可以获得更清晰、更真实的图像,了解这些 AI 模型究竟能做什么。这是一种从询问“它是否通过了测试?”到询问“它是否完全按照要求完成了任务?”并用证据加以证明的转变。这种方法帮助研究人员更深入地理解其模型的优势与不足,为未来更可靠、更强大的视频生成铺平道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →