← 最新论文
💻 computer science

VideoVerse: Does Your T2V Generator Have World Model Capability to Synthesize Videos?

针对现有文本生成视频(T2V)基准在评估世界模型能力方面的不足,本文提出了名为 VideoVerse 的综合基准,通过构建包含事件级时间因果和世界知识的评估体系,系统性地揭示了当前 T2V 模型在合成视频时与世界模型能力之间的差距。

原作者: Zeqing Wang, Xinyu Wei, Bairui Li, Zhen Guo, Jinrui Zhang, Hongyang Wei, Keze Wang, Lei Zhang

发布于 2026-03-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeqing Wang, Xinyu Wei, Bairui Li, Zhen Guo, Jinrui Zhang, Hongyang Wei, Keze Wang, Lei Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 VideoVerse 的新工具,它的核心任务只有一个:给现在的“文字生成视频”AI 模型做一次“世界常识”大考。

为了让你轻松理解,我们可以把现在的 AI 视频生成模型想象成刚入行的“特效师学徒”,而 VideoVerse 就是他们必须通过的**“终极实习考核”**。

1. 为什么需要这场新考试?(旧考试的漏洞)

以前的考试(比如 VBench)主要考什么?

  • 考画面美不美: 就像看照片,问“这张图清晰吗?颜色好看吗?”
  • 考听不听话: 问“你让画一只猫,它画的是猫吗?”

现在的困境是:
现在的 AI 太聪明了,这些基础题大家都能拿满分。就像所有学徒都能画出漂亮的猫,但真正的区别在于:他们懂不懂“物理世界”和“生活常识”?

  • 旧考试的问题: 如果提示词写“把鸭子扔在地上,它弹跳起来”,AI 只要照着字面意思画出来就行。
  • VideoVerse 的考法(隐藏语义): 提示词只写“把鸭子扔在地上”,不写“它会弹跳”。
    • 合格的学徒(世界模型): 应该知道鸭子是橡胶做的,落地会弹起来,自动把“弹跳”画出来。
    • 不合格的学徒: 只画鸭子落地,然后静止不动,因为它没被明确告诉要弹。

2. VideoVerse 是怎么考试的?(三大核心考点)

VideoVerse 设计了 300 个精心准备的“考题”,每个题目都像是一个生活小剧场,考察 AI 是否真的“懂”这个世界。它把考试分成了静态动态两个维度:

🏠 静态考点:懂不懂“常识”和“规则”?

这就好比考你**“生活百科”**:

  • 自然法则(Natural Constraints): 比如“把浓硫酸倒在木头上”,AI 应该知道木头会变黑碳化,而不是变绿。
  • 生活常识(Common Sense): 比如提示词说“四川的代表动物”,AI 应该画大熊猫,而不是画一只老虎。
  • 空间感(3D Depth): 比如“树在桌子后面”,AI 得知道树会被桌子挡住一部分,而不是飘在空中。

🎬 动态考点:懂不懂“因果”和“物理”?

这就好比考你**“物理课”和“逻辑课”**:

  • 事件因果(Event Following): 提示词说“先倒小苏打,再倒醋,观察反应”。AI 必须按顺序发生:倒 A -> 倒 B -> 冒泡。如果它先冒泡再倒醋,或者顺序乱了,就是不及格。
  • 物理互动(Interaction): 比如“用剃须刀刮胡子”,AI 必须表现出胡子变短了。如果胡子刮了还是原样,说明它不懂“刮”这个动作的后果。
  • 材料属性(Material Properties): 比如“加热巧克力”,AI 应该表现出巧克力慢慢融化成液体,而不是保持固体形状。

3. 谁来当考官?(AI 考官 vs 人类)

以前是让人类专家一个个看视频打分,太慢了。
VideoVerse 请来了一个超级 AI 考官(Gemini 2.5 Pro)

  • 这个考官不仅眼睛尖(能看懂视频),而且脑子里装着整个世界的知识库。
  • 它会像人类一样提问:“视频里胡子变短了吗?”“树是不是在桌子后面?”
  • 为了验证这个 AI 考官靠不靠谱,作者还找了一群人类专家(都有大学学历)来一起打分。结果发现,AI 考官和人类专家的看法高度一致(90% 以上),说明这个考试非常公正。

4. 考试成绩单:谁赢了?

作者拿现在的顶尖模型(包括开源的如 Wan2.2、Hunyuan,和闭源的如 Sora-2、Veo-3)来考了考。

  • 基础分(画面美、听指令): 大家差不多,都能打 80-90 分。
  • 世界模型分(懂物理、懂因果): 差距巨大!
    • 闭源模型(Sora-2, Veo-3): 表现最好,像“优等生”,能理解很多隐含的物理规律,但离真正的“完美世界模拟”还有距离。
    • 开源模型: 表现稍弱,特别是在处理复杂的物理互动(比如胡子刮了没变短)和常识推理时,容易“翻车”。

一个有趣的发现:
视频长度并不是决定因素。有些模型能生成 10 秒视频,有些只能生成 5 秒,但在“懂不懂物理”这件事上,时长并没有带来优势。这说明现在的 AI 缺的不是时间,而是对世界运行规律的深层理解

5. 总结:这篇论文想告诉我们什么?

VideoVerse 就像一面“照妖镜”,它不再满足于看 AI 生成的视频“漂不漂亮”,而是问:“这个 AI 真的懂它画的东西吗?”

  • 如果 AI 只是**“鹦鹉学舌”(你让我画什么我就画什么),那它只是个绘图工具**。
  • 如果 AI 能**“举一反三”(你没说它也会自动发生),那它才真正具备了“世界模型”的能力,像一个真正的“虚拟世界导演”**。

目前的结论是:虽然 AI 进步神速,画面越来越美,但在**“像人一样理解世界”这件事上,它们还只是“聪明的孩子”,离“成熟的智者”**还有很长的路要走。VideoVerse 就是为它们指路的新地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →