WorldMind: Decoupled Game World Model for State-Aware NPC Behavior
该论文介绍了 WorldMind,这是一个将游戏世界建模解耦为理解、决策、控制和生成层的框架,旨在实现具备状态感知能力的 NPC 行为,该框架由 BOSS-140K 数据集提供支持,并证明了其相比现有基准模型具有更优越的战术连贯性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在电子游戏的数字景观中,世界通常是为单个玩家旅程搭建的舞台。然而,最令人难忘的时刻往往并非源于玩家自身的行为,而是源于他们在旅途中遇到的角色所做出的反应。这些非玩家角色(NPC)是游戏世界的居民,其任务是让环境显得生动鲜活。几十年来,游戏设计师一直依赖僵化的脚本来驱动这些角色的移动和行动,从而创造出可预测且往往重复的行为。近年来,人工智能开始提供一种新的前进方式,利用可以生成整个游戏过程视频序列的模型。然而,一个显著的障碍仍然存在:在这些新的 AI 系统中,角色的行为往往只是生成视频的副产品,或者是被迫遵循来自系统外部的指令。这意味着角色无法真正“看到”周围不断变化的情况并决定如何即时做出反应。它们缺乏一个能将屏幕上发生的事情与下一步该做什么联系起来的思想。
来自腾讯和新加坡国立大学的研究团队通过引入一个名为 WorldMind 的新框架解决了这一差距。他们的工作代表了游戏世界建模方式的一种转变,从角色行为隐藏在视频生成过程中的系统转向了另一种模式。相反,他们构建了一个将理解游戏状态的行为与生成视频的行为明确分离的系统。想象一下这样一个游戏:计算机首先暂停以评估玩家与怪物之间的距离,检查怪物拥有哪些可用技能,然后有意识地决定一个特定的动作,之后再绘制下一帧视频。这就是 WorldMind 的核心。研究人员证明,通过将过程分解为不同的步骤——理解场景、对响应进行推理,然后生成视觉结果——他们可以创造出能够对不断演变的游戏状态做出反应的非玩家角色,其战术意识达到了生成式模型此前从未见过的水平。
这种新方法的基础在于一个模仿感知与行动循环的四层结构。第一层充当系统的“眼睛”,它获取目前生成的视频帧,并重建出一个关于当前情况的紧凑数字摘要。这个摘要包含了具体的细节,例如玩家与 Boss 之间的距离、他们相对而立的角度,以及 Boss 最近使用了哪些技能的历史记录。这是一个至关重要的步骤,因为在之前的模型中,AI 必须在尝试绘制视频的同时猜测这些细节,这往往导致困惑或无响应的行为。通过创建一个清晰、独立的各种状态摘要,该系统确保决策过程拥有坚实的实事基础。
一旦建立了这个紧凑的状态,它就会被传递到第二层,这里充当操作的“大脑”。在这里,一个大型语言模型(一种经过训练以理解和生成人类语言的人工智能)会阅读游戏状态的摘要以及 Boss 可用技能及其描述的列表。该模型随后会对情况进行推理,以规划下一步行动。它会问自己类似这样的问题:“玩家离得很近,所以需要进行拉近距离的攻击,”或者“玩家离得很远,所以我应该使用远程技能。”这一层不仅仅是在猜测;它是根据游戏的机制和场景的现状来制定战术计划。研究人员非常小心地确保这种推理是基于实际的游戏规则,而不是仅仅模仿训练数据中的模式。他们发现,当他们改变技能描述或游戏状态时,模型会相应地改变其决策,这证明了它是在真正理解机制,而非仅仅记忆结果。
第三层充当“翻译官”,将来自大脑的高层计划转换为视频生成器可以理解的一组指令。它获取选定的动作和玩家的移动,并将它们转化为一组带有时间顺序的自然语言提示词。例如,它可能会生成一个短语,如“玩家正在进行攻击,而 Boss 正在进行跳跃重击”。这确保了第四层也是最后一层——视觉生成层——能够接收到精确且在时间上对齐的指令。随后,视频生成器根据这些提示词创建下一段游戏片段。至关重要的是,它产生的帧并不是终点;它们会被反馈回第一层以重新开始循环。这创造了一个闭环,在这个环路中,世界不断被观察、分析和更新,使得非玩家角色能够对自身之前的行为后果做出实时反应。
为了训练和测试这个系统,研究人员面临着巨大的数据挑战。标准的视频游戏录像通常只捕捉玩家的行为和屏幕显示的内容,缺乏 AI 学习如何决策所需的内部游戏状态数据。为了解决这个问题,他们构建了一个自动化的流水线来收集一个庞大的新数据集,称为 BOSS-140K。该数据集包含超过 14 万个游戏片段,总计超过 200 小时,涵盖了三个不同游戏中针对 14 个不同 Boss 的战斗。与之前的数据集不同,这个数据集将视频素材与详细的、逐帧标注的内部游戏状态配对,包括精确的距离、技能冷却时间和玩家输入。他们使用了一个专门的智能体来自动进行游戏,确保在无需人工操作员手动控制每个动作的情况下,记录下多样化的交互。这种丰富且结构化的数据对于教导系统如何将视觉世界与底层规则联系起来至关重要。
当研究人员测试 WorldMind 时,结果显示非玩家角色的行为有了显著改善。在与现有方法的对比测试中(在这些方法中,角色要么在视频内部隐式行动,要么遵循外部命令),新系统在约 70% 的案例中更受评估者的青睐。由 WorldMind 生成的角色不仅在战术上更加得当,而且更具连贯性,能在整个战斗过程中保持一致的策略。它们可以适应玩家的移动,在需要时缩短距离或撤退以使用远程攻击,同时视频生成速度保持在每秒约 20 帧。这个速度足以支持实时交互,意味着系统可以在人类进行游戏时流畅运行。研究还证实,只要提供正确的内部状态信息,该系统就能将其理解泛化到训练期间未见过的游戏中,这表明该方法足够鲁棒,可以应用于本研究涉及的具体游戏之外。
这篇论文所展示的工作为交互式娱乐开辟了一条新路径,在这种路径下,管理游戏世界的 AI 不仅仅是视觉的生成者,更是游戏逻辑的参与者。通过将状态理解与视频生成解耦,研究人员创建了一个框架,使非玩家角色可以拥有某种形式的情境感知能力。它们不再受限于预设脚本或单一生成过程的限制。相反,它们可以观察世界,思考选项,并带着意图行动。虽然该系统目前专注于 Boss 战和特定游戏类型,但将状态理解与动作生成分离的底层原则,为未来创造更动态、更具响应性的数字世界提供了充满希望的方向。研究人员已经证明,当你给 AI 一个清晰的游戏状态视角和一种思考方式时,它所创造的角色便能真正“活起来”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。