← 最新论文
🤖 AI

Orchestrated Reality: From Role-Play to Living, Playable Game Worlds -- LLM-Driven World Simulation as a Parameterized-Action POMDP

本文提出了“编排现实”(Orchestrated Reality),这是一个由大语言模型驱动的框架,它将游戏世界形式化为参数化动作部分可观测马尔可夫决策过程(Parameterized-Action POMDPs),通过一个管理规范 JSON 状态的单例编排代理,利用“计划-差异-验证-应用”(Plan-Diff-Validate-Apply)流水线,从而弥合了自由叙事与严谨、持久的世界模拟之间的鸿沟。

原作者: Yuhang Huang, Chenmiao Li, Chaowei Fang

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhang Huang, Chenmiao Li, Chaowei Fang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一款文字冒险游戏,一个超级聪明的 AI 充当着地下城主(Dungeon Master)。在目前大多数 AI 游戏中,这个“地下城主”就像是一个讲故事的人,每隔五分钟就会忘掉剧情。如果你问:“铁匠在哪里?”AI 可能会说他今天在村子里,但五分钟后,它可能会说他在城堡里,或者说他根本不存在。这种感觉虽然在当下很真实,但背后的“世界”却是一团混乱的矛盾和遗忘的细节。

这篇论文提出了一种构建这些世界的新方法,称为**“编排现实”(Orchestrated Reality)。与其让 AI 在自由流动的对话中仅仅是“凭空捏造”,作者们将游戏世界视为一个严格组织的档案柜**,AI 必须不断地检查并更新它。

以下是使用简单类比进行的详细拆解:

1. 问题所在:“健忘的讲故事的人”

目前的 AI 游戏依赖于 AI 的短期记忆(其“上下文窗口”)。这就像一个讲故事的人试图仅通过看剧本的最后几页来记住一部 10 小时的电影。

  • 结果: 世界失去了形状。角色漂移,地点在毫无理由的情况下改变,游戏感显得非常脆弱。如果会话结束,这个世界实际上也随之消失了。

2. 解决方案:“首席图书管理员”(世界代理)

作者引入了一个名为**“世界代理”(World-Agent)的单一中央管理者。请不要将这个代理视为讲故事的人,而要将其视为一个拥有游戏“事实真相来源”的图书管理员**。

  • 世界是一个档案柜: 世界不再是一段文本,而是一个由 JSON 文件(结构化数据文件)组成的树状结构。每一个城镇、每一个角色、每一件物品和每一条规则都是一个具有严格格式的特定文件。
  • 只有图书管理员有权书写: 无论说话者是谁(玩家、NPC 或战斗裁判),他们都不能直接改变故事。他们必须向图书管理员提交请求。

3. 运作方式:“计划、检查、盖章”循环

每当游戏中发生事情时,系统都会经过一个严格的四步流程(称为 PDVA):

  1. 计划 (Plan): AI 查看当前的文件(状态)和玩家的行为(例如,“我走进酒馆”)。它起草一段故事并提议对文件进行更改(例如,“将玩家的位置文件从‘广场’移动到‘酒馆’”)。
  2. 差异 (Diff): 它创建一个“增量”(delta)——一份关于文件究竟需要做出哪些精确更改的小清单。
  3. 验证 (Validate - 守门员): 在更改被保存之前,一个严格的“守门员”会检查三件事:
    • 模式 (Schema): 更改是否符合文件格式?(例如,你不能把一个“金币”数字放在“姓名”字段里)。
    • 权限 (Permission): 该参与者是否有权更改此项?(例如,玩家可以移动自己,但不能更改国王的位置)。
    • 规则 (Rules): 这是否违反了游戏规则?(例如,你不能在没有钥匙的情况下穿过一扇锁着的门)。
  4. 应用 (Apply): 如果通过了守门员的检查,更改将被原子性提交(一次性保存)到文件中。随后,系统会为新的世界状态创建一个“指纹”(哈希值)。

4. “部分可观测性”的魔力

论文将游戏描述为一个 Parameterized-Action POMDP。用通俗的话说,这意味着:

  • 世界是真实的: 磁盘上的文件是实际的现实。
  • 玩家是盲目的: 玩家看不见这些文件。他们看到的只是基于这些文件由 AI 生成的叙事投影(一个故事)。
  • 类比: 想象一场木偶戏。世界代理是拉着线(JSON 文件)的操纵师。玩家只看到舞台上移动的木偶(故事)。操纵师完全知道每个木偶在哪里,即使玩家并不知道。如果玩家试图抓住一个木偶,操纵师会在允许木偶移动前先检查规则。

5. 为什么这很重要(“审计追踪”)

因为世界是以带有“指纹”(哈希值)的文件形式保存的,所以游戏是可审计的

  • 如果玩家说:“等等,铁匠昨天明明在这里!”系统可以查看文件历史记录,并准确证明发生了什么、何时发生以及为什么发生。
  • 这防止了 AI “欺骗”世界状态,因为 AI 无法在未通过验证检查的情况下更改文件。

6. 他们发现了什么(目前为止)

作者使用一小群测试者测试了这个框架,发现:

  • 世界感觉是活的: 即使没有人说话,世界也会根据规则(如时间流逝或事件发生)持续存在并变化。
  • 记忆是真实的: 角色之所以能记住事情,不是因为 AI “回想”了聊天记录,而是因为信息在每一回合都被重新注入到文件中。
  • 调试更容易: 创作者可以通过查看文件来了解 AI 做出某个决定的确切原因,而不是猜测 AI 在想什么。

他们尚未做到的事情

这篇论文是一个“进行中的工作”。他们构建了引擎并用少数人进行了测试,但他们尚未

  • 进行大规模研究,通过数百名玩家来证明它比标准游戏更好。
  • 完全实现一个数十个 NPC 同时行动的世界(他们计划下一步这样做)。
  • 证明这适用于每一种不同类型的 AI 模型。

总而言之: 论文认为,要使 AI 游戏真正具有可玩性和持久性,我们必须停止将世界视为一场对话,而要将其视为一个数据库。AI 变成了一个纪律严明的图书管理员,负责更新数据库,而不是一个会忘掉剧情的混乱的讲故事的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →