SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models
本文介绍了 SCOPE,这是一个新颖的框架,通过将条件模块集成到 Transformer 块中,在不依赖分割标签的情况下实现空间选择性的动作响应,从而增强第一人称射击游戏的世界模型,并伴随 CrossFPS 数据集的发布,实现了跨多款游戏标题的鲁棒零样本泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在观看一款第一人称射击(FPS)电子游戏,比如《使命召唤》或《光环》。在这些游戏中,你的角色不断移动、环顾四周并开火。
现在,想象一下试图让计算机根据你的控制器输入,预测游戏中接下来确切会发生什么。这就是论文中所称的“世界模型”。
问题:“漫射乱射”的错误
此前尝试让计算机掌握这项技能的方法,就像一位笨拙的画家:当被要求在画布上画一朵花时,却不小心将颜料泼洒到了整幅画面上。
从技术术语来说,旧模型以相同的方式处理屏幕的每一个部分。如果你按下“开火”按钮,模型会尝试更新整个屏幕,包括天空、远处的山脉以及你身后的墙壁。这导致视频出现 glitches(故障)、扭曲或冻结,因为计算机并不理解:当你射击时,只有枪支和 immediate 目标区域应该发生变化,而世界的其余部分应保持静止。
解决方案:SCOPE(“智能聚光灯”)
作者们创建了一个名为 SCOPE(在可玩环境中模拟跨游戏操作)的新系统。
将 SCOPE 想象为一个智能聚光灯,它确切地知道该照亮哪里。
- 范围之内(In-Scope): 当你射击、装弹或跳跃时,SCOPE 将聚光灯仅投射在武器及其正前方的区域。它明白:“好吧,爆炸发生在这里;让我们只动画化这一部分。”
- 范围之外(Out-of-Scope): 其他一切——天空、地板、远处的建筑物——都保持原样或平滑移动,就像摄像机平稳扫过一个稳定的房间一样。
神奇之处在于,SCOPE 不需要人类绘制地图来告诉它枪支在哪里。它通过观察视觉线索自行学习。它会意识到:“哦,这里有一把枪,所以如果玩家按下‘开火’,只有这个像素需要做出反应。”
训练数据:"CrossFPS"数据集
为了训练这个系统,研究人员不能只使用一款游戏。他们需要庞大的不同游戏库,以教会计算机射击的通用规则,而不仅仅是《使命召唤》的特定规则。
他们构建了 CrossFPS,这是一个包含来自 7 款不同游戏 的 69,000 个视频片段 的数据集。
- 他们剥离了“游戏化”的策略(例如总是朝同一个敌人射击),以便计算机学习游戏的物理规律(例如:“如果我向左移动摇杆,世界就向右移动”),而不是死记硬背特定的关卡。
- 他们将视频与精确的控制器动作(10 个不同的按钮和摇杆)同步,以便计算机能够完美地看到因果关系。
工作原理(“厨师”类比)
想象一位擅长制作标准餐点的主厨(主 AI 模型)。
- 旧方法: 副厨(动作输入)会大喊“加盐!”,主厨就会把盐倒进炉子上的每一口锅里,毁掉了汤、沙拉和牛排。
- SCOPE 方法: 副厨大喊“加盐!”,但厨房现在配备了智能配送系统。该系统看到哪口锅里是汤,便只将盐配送到那口锅里。沙拉和牛排保持原样。
在论文中,这个“智能配送系统”是一个插入 AI 大脑的特殊模块,它逐个处理每个像素,以决定:“我属于动作区域吗?是?那么我做出反应。否?那么我保持冷静。”
结果
当他们测试 SCOPE 时:
- 它处理了混乱: 它能够同时处理快速射击、跳跃和转向,而不会让视频变成模糊的一团。
- 它具有泛化能力: 他们向它展示了一款它从未见过的游戏(使用 AI 生成的新游戏世界图像),它仍然知道如何正确做出反应。它不需要重新训练;它只是将从 7 款游戏中学到的规则应用到了新游戏中。
- 它非常精准: 背景保持稳定,而动作恰好发生在它应该发生的地方。
总结
这篇论文提出了一种让 AI 理解电子游戏的新方法。SCOPE 不再将整个屏幕视为一个同时变化的巨大整体,而是教会 AI 成为一名精准的外科医生,仅在玩家动作发生的地方进行微小而准确的改变,同时保持世界其余部分的稳定。这使得跨不同类型游戏的逼真、交互式游戏模拟成为可能,而无需每次都从头开始教学。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。