WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models
本文介绍了 WorldRoamBench,这是一个新颖的开放世界基准测试,旨在从动作、视觉、物理和记忆四个关键维度,严格评估交互式世界模型的长程稳定性,并揭示了当前的先进模型在连续交互环境中仍难以实现可靠、具备物理依据且符合记忆忠实度的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一款电子游戏,你可以通过按下键盘上的按键(W、A、S、D)来行走、转向和观察一个尚未存在的世界。这并不是一个预先制作好的地图,而是人工智能随着你的移动实时生成的场景。这被称为交互式世界模型(Interactive World Model)。
这篇论文介绍了一个新的“成绩单”,叫做 WorldRoamBench,用来测试这些 AI 世界在长时间(10 到 60 秒)游玩时的表现,而不仅仅是短短几秒钟。
以下是该论文如何使用简单的类比来拆解测试内容的:
1. 问题所在:“短片段”陷阱
以往的测试只观察 AI 几秒钟。这就像是通过观察运动员系鞋带来评判一名马拉松选手。AI 在 5 秒钟内可能看起来很完美,但随后它可能会开始出现故障、忘记自己身处何处,或者穿墙而过。WorldRoamBench 强制要求 AI 跑完整个马拉松,以观察它是否会崩溃。
2. 四项测试(“成绩单”)
该基准测试从四个特定的技能维度对 AI 进行检查:
A. 动作跟随能力:“听话的宠物”
- 测试内容: 你按下“前进”,AI 真的向前移动了吗?
- 旧方法: 以往的测试观察的是“整体路径”。如果按下“前进”后 AI 走出了剧烈的之字形路径,但最终到达了正确的位置,它仍会获得高分。
- 新方法: WorldRoamBench 会检查每一步。这就像是在检查狗是否在每次听到“坐下”指令时都真的坐下了,而不仅仅是看它最后是否停在了角落里。它揭示了 AI 是否在忽略你的按键指令,或者在改变方向的瞬间感到困惑。
B. 视觉质量:“褪色的照片”
- 测试内容: 世界是否保持清晰美观,还是会变成一片模糊的混沌?
- 旧方法: 它们计算平均质量。如果开头很漂亮,结尾很丑陋,平均值看起来可能仍然不错。
- 新方法: 它们寻找**“序列中期崩溃”(Mid-Sequence Collapse)**。想象一张照片,开始时很清晰,中间变得模糊,然后不知为何在结尾又变清晰了。旧的测试会漏掉这种模糊的中间过程。这项测试能捕捉到那种 AI 瞬间“失控”导致的“故障性下滑”。
C. 交互物理特性:“现实检查”
- 测试内容: 世界是否遵守物理定律?
- 旧方法: 它们大多忽略这一点,或者检查得非常宽松。
- 新方法: 它们测试三个具体方面:
- 机制(Mechanics): 如果你撞向墙壁,你会停下来吗?还是会像幽灵一样穿墙而过?如果你掉落一个杯子,它会掉落吗?
- 光学(Optics): 当你转身时,阴影是否正确移动?镜子里的反射看起来正确吗?
- 3D 一致性(3D Consistency): 如果你走下一条长廊,墙壁是保持笔直,还是像哈哈镜一样扭曲变形?
D. 记忆力:“时间旅行者”
- 测试内容: 如果你走开一段距离再走回来,看到的还是同一棵树吗?
- 旧方法: 它们比较第一帧和最后一帧。但如果 AI 稍微偏离了路径,两帧就无法匹配,它们就会把这归咎于 AI 的记忆力问题,即便 AI 只是绕了一个略微不同的圈。
- 新方法: 它们使用 “3D 点云”(房间的数字地图)。它们检查房间的形状是否得到了保留,无论摄像机站在什么位置。
- 场景记忆(Scene Memory): 我之前看到的建筑还在那里吗?
- 主体记忆(针对第三人称视角): 如果我在观察一个角色,这个角色看起来还是同一个人,还是变成了一个模糊的团块或另一种动物?
3. 结果:“没有完美的玩家”
作者测试了超过 10 个不同的 AI 模型(包括开源模型和来自 Google、阿里巴巴等大科技公司的模型)。
- 重大发现: 没有任何一个模型能在所有方面都达到完美。
- 有些模型非常擅长遵循你的指令,但在物理特性方面表现糟糕(它们会穿墙而过)。
- 有些模型画面精美,但会忘记 10 秒前生成的内容。
- 有些模型物理特性很好,但当要求它们快速转向时会感到困惑。
4. 为什么这很重要
该论文认为,要构建一个真正沉浸式的、无限的世界(如“元宇宙”或高级电子游戏),我们不能仅仅拥有漂亮的图像。世界需要是稳定的(不出现故障)、符合物理规律的(遵守重力)并且是有记忆的(记得它所见到的东西)。
World-RoamBench 是第一个同时严谨检查所有这些要素的工具,它向我们展示了当前的 AI 在哪些地方失败了,从而让开发者知道下一步该修复什么。这不仅仅是为了让 AI 在通用意义上变得更“聪明”,而是为了让它成为一个更可靠、更一致且具有物理基础的虚拟世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。