← 最新论文
💻 computer science

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

本文介绍了 Game2World,这是一个包含用于 UI 资产提取的 G2WEngine 和用于无掩码 HUD 去除的 GameCleaner 模型的综合框架,该框架将原始游戏视频转化为高质量、无 UI 的训练数据,从而显著提升了世界模型的性能。

原作者: Wenxuan Shen, Dongna Jin, Dongping Chen

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxuan Shen, Dongna Jin, Dongping Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,尝试教会计算机理解物理世界的运动与变化。为了实现这一目标,研究人员需要大量的视频来展示物体如何相互作用、光影如何变化以及场景如何随时间演变。多年来,科学家们一直将电子游戏视为完美的资料来源。游戏提供了无穷无尽且多样化的环境,其中的每一个动作都有明确的后果,为视觉体验提供了丰富的库,而这些体验在现实世界中难以捕捉。然而,使用这些游戏的原始素材存在一个显著的问题。当一个人玩游戏时,屏幕上充满了数字叠加层:血条、地图、弹药计数器和聊天窗口。这些元素并不是游戏世界本身的一部分;它们是为玩家提供的屏幕空间装饰。如果计算机从充满这些叠加层的视频中学习,它就会产生混淆,将游戏的规则与界面的规则混为一谈。

一个研究团队开发了一个新系统来解决这个问题,有效地剥离了这些数字杂质,从而揭示出其下纯净的游戏世界。他们创建了一个框架,可以自动识别这些屏幕界面,将其从视频中移除,甚至填补缺失的背景,使场景看起来完整且自然。通过这样做,他们将数百万小时混乱的游戏录像转化成了干净、高质量的训练数据。他们的工作表明,当计算机从这些清理后的视频中学习时,它们在预测运动和视觉质量方面的表现会得到显著提升。这项突破表明,互联网上庞大且尚未被开发的各类游戏视频库,终于可以被用来构建更智能、更强大的人工智能系统。

该项目的核心是一个名为 G2WEngine 的新数据引擎。研究人员意识到,要教会计算机关于世界的事物,他们首先必须教会它什么“不是”世界。他们首先创建了一个详细的游戏界面分类系统,将从指南针、血条到聊天日志和弹出通知的所有内容都归入特定的类别。利用这个系统,该引擎扫描了来自数百个不同游戏的数千个真实游戏视频。它仔细提取出数字资产——即血条或地图的实际图像——并将它们转化为可重复使用的透明碎片。这使得系统能够理解这些界面看起来究竟是什么样的,以及它们通常出现在屏幕的什么位置。

一旦系统理解了界面,它就会反向操作以创建一个全新的大规模数据集。它获取干净的、无界面的游戏世界视频片段,然后人为地将提取出的界面重新添加上去,从而创造出完美的“处理前”与“处理后”的成对素材。这一过程生成了 96,000 对合成视频对,计算机在这些视频对中清楚地知道什么是干净的世界,什么是带有界面的版本。为了确保系统能在现实世界的数据上运行,他们还收集了超过 1,000 个来自真实互联网视频的片段,涵盖了 303 种不同的游戏。这种合成数据与真实数据的结合,提供了一个严苛的测试场,用以检验移除过程在压力下的表现。

随后,研究人员训练了一个专门的模型,并将其命名为 GameCleaner,用以执行移除任务。与以往需要用户手动绘制框选元素进行删除的方法不同,GameCleaner 可以自动完成工作。它利用对视觉语境的深度理解,来识别哪些部分是游戏世界,哪些是数字叠加层。当它移除一个血条或地图时,它不仅仅是抹去像素;它还会重建隐藏在它们背后的景象,确保背景保持一致且人物运动保持平滑。该模型在与其他视频编辑工具的对比测试中表现优异,成功地移除了界面,同时以极高的准确度保留了底层的场景。

这项工作的成果通过一项受控实验得到了验证,以观察清理后的数据是否真的产生了影响。研究人员训练了两个完全相同的视频生成模型:一个基于原始的、带有叠加层的游戏视频进行训练,另一个则基于新生成的、经过清理的版本进行训练。在清理数据上训练的模型表现得明显更好。它生成的视频具有更高的运动质量和更好的整体视觉保真度。具体而言,在清理数据上训练的模型在捕捉运动能力方面提升了 18.8%,在整体性能评分方面提升了 6.83%。这证明了数字叠加层不仅仅是视觉噪声;它们实际上干扰了学习过程,充当了阻碍计算机真正理解环境动态的“捷径”。

这项研究的影响不仅限于让视频看起来更干净。通过成功地将界面与世界解耦,研究人员为创建更好的“世界模型”开辟了一条可扩展的路径。这些模型是未来人工智能的基础,使其能够导航复杂的环境、模拟物理交互,甚至控制机器人。由于无需依赖昂贵的定制模拟器,处理海量互联网游戏视频的能力,意味着这些系统可用的训练数据池现在实际上是无限的。该团队已向公众开放了他们的数据集、代码和模型,邀请其他科学家在此基础上进行研究。他们的工作表明,借助正确的工具,互联网上那些混乱且充满界面的视频,可以被转化为一种纯净且结构化的资源,用于教导机器如何理解真实的运动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →