← 最新论文
🤖 AI

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

本文介绍了 WorldRoamBench,这是一个新颖的开放世界基准测试,旨在从动作、视觉、物理和记忆四个关键维度,严格评估交互式世界模型的长程稳定性,并揭示了当前的先进模型在连续交互环境中仍难以实现可靠、具备物理依据且符合记忆忠实度的性能。

原作者: Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yong Li, Baoquan Chen

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yong Li, Baoquan Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一款电子游戏,你可以通过按下键盘上的按键(W、A、S、D)来行走、转向和观察一个尚未存在的世界。这并不是一个预先制作好的地图,而是人工智能随着你的移动实时生成的场景。这被称为交互式世界模型(Interactive World Model)

这篇论文介绍了一个新的“成绩单”,叫做 WorldRoamBench,用来测试这些 AI 世界在长时间(10 到 60 秒)游玩时的表现,而不仅仅是短短几秒钟。

以下是该论文如何使用简单的类比来拆解测试内容的:

1. 问题所在:“短片段”陷阱

以往的测试只观察 AI 几秒钟。这就像是通过观察运动员系鞋带来评判一名马拉松选手。AI 在 5 秒钟内可能看起来很完美,但随后它可能会开始出现故障、忘记自己身处何处,或者穿墙而过。WorldRoamBench 强制要求 AI 跑完整个马拉松,以观察它是否会崩溃。

2. 四项测试(“成绩单”)

该基准测试从四个特定的技能维度对 AI 进行检查:

A. 动作跟随能力:“听话的宠物”

  • 测试内容: 你按下“前进”,AI 真的向前移动了吗?
  • 旧方法: 以往的测试观察的是“整体路径”。如果按下“前进”后 AI 走出了剧烈的之字形路径,但最终到达了正确的位置,它仍会获得高分。
  • 新方法: WorldRoamBench 会检查每一步。这就像是在检查狗是否在每次听到“坐下”指令时都真的坐下了,而不仅仅是看它最后是否停在了角落里。它揭示了 AI 是否在忽略你的按键指令,或者在改变方向的瞬间感到困惑。

B. 视觉质量:“褪色的照片”

  • 测试内容: 世界是否保持清晰美观,还是会变成一片模糊的混沌?
  • 旧方法: 它们计算平均质量。如果开头很漂亮,结尾很丑陋,平均值看起来可能仍然不错。
  • 新方法: 它们寻找**“序列中期崩溃”(Mid-Sequence Collapse)**。想象一张照片,开始时很清晰,中间变得模糊,然后不知为何在结尾又变清晰了。旧的测试会漏掉这种模糊的中间过程。这项测试能捕捉到那种 AI 瞬间“失控”导致的“故障性下滑”。

C. 交互物理特性:“现实检查”

  • 测试内容: 世界是否遵守物理定律?
  • 旧方法: 它们大多忽略这一点,或者检查得非常宽松。
  • 新方法: 它们测试三个具体方面:
    • 机制(Mechanics): 如果你撞向墙壁,你会停下来吗?还是会像幽灵一样穿墙而过?如果你掉落一个杯子,它会掉落吗?
    • 光学(Optics): 当你转身时,阴影是否正确移动?镜子里的反射看起来正确吗?
    • 3D 一致性(3D Consistency): 如果你走下一条长廊,墙壁是保持笔直,还是像哈哈镜一样扭曲变形?

D. 记忆力:“时间旅行者”

  • 测试内容: 如果你走开一段距离再走回来,看到的还是同一棵树吗?
  • 旧方法: 它们比较第一帧和最后一帧。但如果 AI 稍微偏离了路径,两帧就无法匹配,它们就会把这归咎于 AI 的记忆力问题,即便 AI 只是绕了一个略微不同的圈。
  • 新方法: 它们使用 “3D 点云”(房间的数字地图)。它们检查房间的形状是否得到了保留,无论摄像机站在什么位置。
    • 场景记忆(Scene Memory): 我之前看到的建筑还在那里吗?
    • 主体记忆(针对第三人称视角): 如果我在观察一个角色,这个角色看起来还是同一个人,还是变成了一个模糊的团块或另一种动物?

3. 结果:“没有完美的玩家”

作者测试了超过 10 个不同的 AI 模型(包括开源模型和来自 Google、阿里巴巴等大科技公司的模型)。

  • 重大发现: 没有任何一个模型能在所有方面都达到完美。
  • 有些模型非常擅长遵循你的指令,但在物理特性方面表现糟糕(它们会穿墙而过)。
  • 有些模型画面精美,但会忘记 10 秒前生成的内容。
  • 有些模型物理特性很好,但当要求它们快速转向时会感到困惑。

4. 为什么这很重要

该论文认为,要构建一个真正沉浸式的、无限的世界(如“元宇宙”或高级电子游戏),我们不能仅仅拥有漂亮的图像。世界需要是稳定的(不出现故障)、符合物理规律的(遵守重力)并且是有记忆的(记得它所见到的东西)。

World-RoamBench 是第一个同时严谨检查所有这些要素的工具,它向我们展示了当前的 AI 在哪些地方失败了,从而让开发者知道下一步该修复什么。这不仅仅是为了让 AI 在通用意义上变得更“聪明”,而是为了让它成为一个更可靠、更一致且具有物理基础的虚拟世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →