← 最新论文
💻 computer science

WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models

WorldJen 引入了一个面向生成式视频模型的端到端多维基准,该基准以高分辨率视觉语言模型评分取代有缺陷的二元视觉问答,通过对抗性精心策划的提示词和稳健的三级评分体系,实现了与人类偏好排名的完美对齐。

原作者: Karthik Inbasekar, Guy Rom, Omer Shlomovits

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Karthik Inbasekar, Guy Rom, Omer Shlomovits

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一场规模宏大、 stakes 极高的烹饪比赛的首席评委。但你的任务不是品尝食物,而是观看由人工智能生成的视频。你的工作是决定哪位"AI 厨师”最出色。

长期以来,评委们使用了错误的工具。他们拿着尺子去衡量图像有多“像素级完美”(就像检查盐粒的大小是否合适),或者使用频率分析仪来查看颜色是否与参考照片匹配。但这些工具忽略了大局:这位厨师真的做了一顿饭吗?食材搭配合理吗?汤有没有溢出来?还是说,这位厨师只是制造了一团模糊的、数学上完美却完全不像食物的混乱?

其他最近的尝试试图让评委回答简单的“是或否”问题,例如“物理现象正确吗?”但人类(以及 AI 评委)倾向于回答“是”,除非视频完全崩坏。这使得区分“好”视频和“优秀”视频变得不可能。

现在,WORLDJEN 登场了。你可以将其视为一种全新的、超先进的评判系统,旨在解决这些问题。以下是其工作原理,分解为简单步骤:

1. 菜单:精心策划的提示词

研究人员没有让 AI“制作一个猫的视频”,而是创建了一份包含 3,754 个复杂“食谱”(提示词)的专属菜单。这些并非简单的请求;它们旨在同时测试 AI 的 16 项不同技能,例如:

  • 运动: 角色移动是否流畅,还是会抖动?
  • 物理: 如果扔出一个球,它是否会按照重力规律下落?
  • 逻辑: 如果一个人走到树后,他们是否会正确地消失并重新出现?
  • 美学: 光影和色彩是否优美?

2. 人类味觉测试(基准真值)

在信任任何计算机进行评判之前,研究人员需要一个“黄金标准”。他们聘请了 7 位人类专家观看 300 个视频(由 6 种不同的顶级 AI 模型生成),并投票选出更好的那个。

  • 结果: 人类专家达成了一致的“三级”排名。
    • 顶级: 两个模型(Veo 3.1 和 Kling)明显是最好的。
    • 中级: 三个模型表现良好,但在统计上彼此无法区分。
    • 底层: 一个模型明显落后于其他模型。
      这个人类排名是衡量其他一切结果的“真理”。

3. AI 评委(视觉语言模型)

现在,研究人员提出了一个问题:“一个 AI 评委(视觉语言模型)能否像人类一样胜任这份工作?”
他们并没有仅仅问 AI“这个好吗?”,而是让 AI 对每个视频填写一份李克特量表问卷(1 到 5 分的评分系统,就像 Yelp 评论一样)。

  • 技巧: AI 评委以完整的原生分辨率观看视频(而不是缩小成微小的缩略图)。它对每个视频提出 10 个关于具体细节的特定问题(例如:“角色的手是否闪烁了?”或“阴影移动是否正确?”)。
  • 评分: 它为每个问题打分,并将这些分数综合成最终排名。

4. 重大揭晓

当 AI 评委的排名与人类味觉测试的结果进行比较时,结果令人震惊:它们完美匹配。

  • AI 正确识别了顶级、中级和底层模型。
  • 它在模型排序上与人类 100% 达成一致。
  • 这证明 AI 评委可以成为昂贵的人类评委的可靠、廉价且快速的替代品。

5. 为什么它比旧方法(VBench)更好

该论文将 WORLDJEN 与现有的 VBench 系统进行了比较。

  • VBench 就像一位眯着眼睛透过钥匙孔(低分辨率)看视频的评委,只检查颜色是否大致正确。由于差异太小而难以察觉,它经常给所有人打“完美”分。
  • WORLDJEN 就像一位拿着放大镜审视整个视频的评委。它能发现 VBench 遗漏的物理现象中的微小裂痕和细微故障。
  • 结果: 与人类相比,VBench 未能正确对模型进行排名,而 WORLDJEN 则做到了。

6. “物理鸿沟”的发现

这个新系统最有趣的发现之一是存在“物理鸿沟”。
即使是世界上最好的 AI 模型,在理解基本物理方面仍然表现糟糕。

  • 比喻: 想象这些 AI 厨师非常擅长摆盘(让食物看起来漂亮)和布置餐桌(构图)。但如果你让他们真正去烹饪食物(让球弹跳或水流流动),他们往往会失败。
  • 论文发现,即使是顶级模型在“物理力学”和“惯性一致性”方面的得分也很低。它们看起来不错,但尚未完全遵守宇宙法则。

总结

WORLDJEN 是一种测试 AI 视频生成器的全新、更聪明的方法。它利用复杂的“食谱”来挑战 AI,由人类设定标准,然后证明一个聪明的 AI 评委可以像人类一样进行评分。它表明,虽然 AI 视频看起来令人惊叹,但它们在理解现实世界的物理运作方式方面仍然举步维艰。

该论文并未声称:

  • 它不声称该系统已准备好用于医疗诊断或临床用途。
  • 它不声称这将立即改变好莱坞明天的电影制作方式。
  • 它不声称 AI 评委在所有场景中都完美无缺,仅声称它们在这一组特定测试中与人类排名相符。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →