← 最新论文
💻 computer science

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

本文介绍了 WBench,这是一个全面的多轮基准测试,旨在利用 289 个测试用例和经过验证的自动指标,从视频质量、场景遵循、交互遵循、一致性和物理合规性五个关键维度系统评估交互式视频世界模型,结果表明当前没有任何最先进的模型在所有领域均表现卓越。

原作者: Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在构建一个视频游戏引擎,但你不是在编写规则,而是在教一个 AI“梦想”出一个世界。你给它一张起始图片,然后说:“现在,向前走,跳过那块石头,突然一架直升机出现了。”接着,AI 会根据你的指令生成接下来的几秒视频。

问题是:我们如何知道这个 AI 是否真的擅长这件事?

目前,有许多不同的方法来测试这些 AI“世界模型”,但这就像只通过测试刹车、只测试速度或只测试车漆来评判一辆汽车一样。没有一个单一的、统一的测试能够一次性检查所有方面。

现在出现了 WBENCH。把 WBENCH 想象成这些交互式视频 AI 的终极 “驾照考试”

核心理念:“世界模拟器”测试

作者们创建了一个名为 WBENCH 的综合测试套件。他们不再仅仅要求 AI 生成漂亮的视频,而是将其置于一个虚拟的驾驶学校中,让它必须处理与用户的多轮对话。

以下是该测试的运作方式,分为五个简单的类别:

  1. 外观(视频质量): 视频看起来是否流畅美观,还是闪烁模糊?这就像检查车漆是否光亮、轮胎是否圆润。
  2. 记忆(设定遵循): 如果你告诉 AI“这是一座有红色机器人的雪山”,它能否在整个视频中保持雪和红色机器人的存在?还是机器人突然变蓝、雪融化了?这测试了 AI 是否记得它所创造世界的规则。
  3. 服从性(交互遵循): 如果你说“向左转”,镜头是否真的向左转?如果你说“机器人跳起来”,它是否真的跳起来了?这是“方向盘”测试。论文发现,有些 AI 擅长制作漂亮的画面,但在真正听从指令方面却表现糟糕。
  4. 稳定性(一致性): 如果镜头旋转一圈回到起点,世界看起来是否与之前完全一样?还是建筑物发生了位移,或者机器人消失了?这测试了 AI 是否对世界布局拥有稳定的“记忆”。
  5. 物理性(物理合规): 如果一个球落下,它是否会向下落?如果一辆车撞毁,它是否会变形?还是球会飘向天空,车会像幽灵一样穿过墙壁?这测试了 AI 是否理解现实世界(或幻想世界)的运作方式。

试驾:他们做了什么

研究人员构建了一个包含 289 个不同“场景”(如雪山、繁忙的城市或奇幻城堡)的数据集。对于每个场景,他们创建了一系列 1,058 条指令(轮次)。

他们测试了 20 种不同的 AI 模型(包括 Kling、Wan、Genie 3 等知名模型)。他们要求这些模型遵循如下指令:

  • “向前走。”
  • “跳起来。”
  • “将视角从角色身后切换到角色自己的眼睛。”
  • “让下雨。”

结果:没有完美的驾驶员

运行测试后,论文发现了一些令人惊讶的事情:

  • 尚不存在“超级 AI": 就像没有哪一辆车能同时是最快、最安全且最省油的一样,没有任何单一的 AI 模型通过了测试的每一个部分。 有些模型擅长制作漂亮的视频,但在遵循指令方面表现糟糕。另一些模型擅长导航,但在几秒钟后就忘记了世界原本的样子。
  • 导航很棘手: 移动镜头(行走或转向)实际上是一项与让视频看起来美观截然不同的技能。一个 AI 可以制作出美丽的电影,但当被要求移动镜头时却失败了。
  • “长跑”很难: 对话持续的时间越长(轮次越多),AI 犯错的概率就越大。这就像人类试图记住一个复杂的故事;过了一段时间,他们就开始混淆细节。
  • 开源正在追赶: 一些任何人都可以免费使用的模型,在特定任务上的表现与昂贵、闭源的模型一样好,甚至更好。

结论

WBENCH 是一把新的、标准化的尺子,用于衡量交互式视频 AI。它证明,虽然这些模型在制作电影方面越来越出色,但它们仍难以成为可靠的“世界模拟器”,无法在长时间内持续遵循指令、记住过去并遵守物理定律。

这篇论文并没有说这些模型已经准备好取代人类游戏设计师或驾驶自动驾驶汽车。相反,它指出:“这里正是它们失败的地方,因此开发者知道下一步该修复什么。” 它是一个诊断工具,旨在帮助下一代 AI 变得真正具有交互性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →