← 最新论文
💻 computer science

SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

本文介绍了 SCOPE,这是一个新颖的框架,通过将条件模块集成到 Transformer 块中,在不依赖分割标签的情况下实现空间选择性的动作响应,从而增强第一人称射击游戏的世界模型,并伴随 CrossFPS 数据集的发布,实现了跨多款游戏标题的鲁棒零样本泛化能力。

原作者: Zizhao Tong, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Yeying Jin, Ling Shao

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zizhao Tong, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Yeying Jin, Ling Shao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在观看一款第一人称射击(FPS)电子游戏,比如《使命召唤》或《光环》。在这些游戏中,你的角色不断移动、环顾四周并开火。

现在,想象一下试图让计算机根据你的控制器输入,预测游戏中接下来确切会发生什么。这就是论文中所称的“世界模型”。

问题:“漫射乱射”的错误

此前尝试让计算机掌握这项技能的方法,就像一位笨拙的画家:当被要求在画布上画一朵花时,却不小心将颜料泼洒到了整幅画面上。

从技术术语来说,旧模型以相同的方式处理屏幕的每一个部分。如果你按下“开火”按钮,模型会尝试更新整个屏幕,包括天空、远处的山脉以及你身后的墙壁。这导致视频出现 glitches(故障)、扭曲或冻结,因为计算机并不理解:当你射击时,只有枪支和 immediate 目标区域应该发生变化,而世界的其余部分应保持静止。

解决方案:SCOPE(“智能聚光灯”)

作者们创建了一个名为 SCOPE(在可玩环境中模拟跨游戏操作)的新系统。

将 SCOPE 想象为一个智能聚光灯,它确切地知道该照亮哪里。

  • 范围之内(In-Scope): 当你射击、装弹或跳跃时,SCOPE 将聚光灯投射在武器及其正前方的区域。它明白:“好吧,爆炸发生在这里;让我们只动画化这一部分。”
  • 范围之外(Out-of-Scope): 其他一切——天空、地板、远处的建筑物——都保持原样或平滑移动,就像摄像机平稳扫过一个稳定的房间一样。

神奇之处在于,SCOPE 不需要人类绘制地图来告诉它枪支在哪里。它通过观察视觉线索自行学习。它会意识到:“哦,这里有一把枪,所以如果玩家按下‘开火’,只有这个像素需要做出反应。”

训练数据:"CrossFPS"数据集

为了训练这个系统,研究人员不能只使用一款游戏。他们需要庞大的不同游戏库,以教会计算机射击的通用规则,而不仅仅是《使命召唤》的特定规则。

他们构建了 CrossFPS,这是一个包含来自 7 款不同游戏69,000 个视频片段 的数据集。

  • 他们剥离了“游戏化”的策略(例如总是朝同一个敌人射击),以便计算机学习游戏的物理规律(例如:“如果我向左移动摇杆,世界就向右移动”),而不是死记硬背特定的关卡。
  • 他们将视频与精确的控制器动作(10 个不同的按钮和摇杆)同步,以便计算机能够完美地看到因果关系。

工作原理(“厨师”类比)

想象一位擅长制作标准餐点的主厨(主 AI 模型)。

  • 旧方法: 副厨(动作输入)会大喊“加盐!”,主厨就会把盐倒进炉子上的每一口锅里,毁掉了汤、沙拉和牛排。
  • SCOPE 方法: 副厨大喊“加盐!”,但厨房现在配备了智能配送系统。该系统看到哪口锅里是汤,便只将盐配送到那口锅里。沙拉和牛排保持原样。

在论文中,这个“智能配送系统”是一个插入 AI 大脑的特殊模块,它逐个处理每个像素,以决定:“我属于动作区域吗?是?那么我做出反应。否?那么我保持冷静。”

结果

当他们测试 SCOPE 时:

  1. 它处理了混乱: 它能够同时处理快速射击、跳跃和转向,而不会让视频变成模糊的一团。
  2. 它具有泛化能力: 他们向它展示了一款它从未见过的游戏(使用 AI 生成的新游戏世界图像),它仍然知道如何正确做出反应。它不需要重新训练;它只是将从 7 款游戏中学到的规则应用到了新游戏中。
  3. 它非常精准: 背景保持稳定,而动作恰好发生在它应该发生的地方。

总结

这篇论文提出了一种让 AI 理解电子游戏的新方法。SCOPE 不再将整个屏幕视为一个同时变化的巨大整体,而是教会 AI 成为一名精准的外科医生,仅在玩家动作发生的地方进行微小而准确的改变,同时保持世界其余部分的稳定。这使得跨不同类型游戏的逼真、交互式游戏模拟成为可能,而无需每次都从头开始教学。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →