← 最新论文
💬 NLP

PatchWorld: Gradient-Free Optimization of Executable World Models

PatchWorld 引入了一种无梯度框架,通过基于反例引导的代码修复,将离线轨迹转化为可检查、可执行的 Python 世界模型,在文本智能体环境中实现了最先进的规划性能,并揭示了观测保真度与决策效用之间的权衡。

原作者: Jiaxin Bai, Yue Guo, Yifei Dong, Jiaxuan Xiong, Tianshi Zheng, Yixia Li, Tianqing Fang, Yufei Li, Yisen Gao, Haoyu Huang, Zhongwei Xie, Hong Ting Tsang, Zihao Wang, Lihui Liu, Jeff Pan, Yangqiu Song

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaxin Bai, Yue Guo, Yifei Dong, Jiaxuan Xiong, Tianshi Zheng, Yixia Li, Tianqing Fang, Yufei Li, Yisen Gao, Haoyu Huang, Zhongwei Xie, Hong Ting Tsang, Zihao Wang, Lihui Liu, Jeff Pan, Yangqiu Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一款基于文本的冒险游戏,你无法看到游戏的内部代码或世界的隐藏状态。你只能看到游戏在你做出动作后给出的文本描述。例如,你输入“打开抽屉”,游戏回复:“你看到一个红苹果。”你不知道苹果为什么会出现,也不知道抽屉现在是否空了,或者游戏背后的逻辑在想什么。

这篇论文介绍了 PatchWorld,这是一种教 AI 构建这些隐藏世界“规则书”的新方法,它不是通过猜测,而是通过编写并修复实际的计算机代码。

以下是它的工作原理,使用简单的类比进行说明:

1. 问题所在:“黑盒”之谜

通常,AI 智能体试图通过预测下一句会出现什么来表现得像个“预言家”——它们根据之前见过的模式来猜测下一句话。但在一个具有隐藏状态(比如抽屉可能是锁着的,或者某个词是隐藏的)的游戏中,仅仅靠猜测往往会失败,因为 AI 并不理解世界的规则

作者们想知道:我们能否强迫 AI 编写一个真实的、可执行的 Python 程序,来充当游戏世界的“大脑”? 这个程序将追踪隐藏状态(例如“抽屉是打开的”),并预测下一个文本描述。

2. 解决方案:“代码修复”循环

PatchWorld 不仅仅是要求 AI 写一次代码然后听天由命。它使用了一个名为**反例引导修复(Counterexample-Guided Repair)**的过程。可以把它想象成一位严厉的编辑在指导一位新手作家:

  1. 起草: AI 根据过去的游戏日志(轨迹),编写第一份尝试模拟游戏世界的 Python 程序草案。
  2. 试驾: 研究人员将这个新程序运行在旧的游戏日志上。
  3. 寻找 Bug: 如果程序预测的文本错误(例如,日志显示抽屉已打开,但程序却说抽屉仍是关闭的),系统会将其标记为一个“反例”(特定的失败案例)。
  4. 修补: AI 会看到这个特定的失败案例,并被要求“修补”(修复)代码。
  5. 守门员: 只有当补丁在修复特定 Bug 的同时,没有破坏其他任何部分时,该补丁才会被接受。如果修复方案导致程序在其他地方表现变差,则会被拒绝。

这个循环不断重复,直到代码与记录的游戏历史完全匹配。

3. 两个版本:“艺术家”与“建筑师”

论文发现了一个有趣的现象:存在着两个目标之间的权衡,就像试图同时成为完美的画家和完美的工程师一样。

  • PatchWorld-Residual(艺术家): 这个版本为精确的文本细节添加了一个“记忆库”。如果游戏总是说“你看到一个红苹果”,这个版本就会记住这个精确的短语。

    • 结果: 它在预测游戏下一句会说什么的精确单词方面具有极高的准确性(高保真度)。
    • 缺点: 因为它过于关注记忆精确的单词,所以有时会对事物发生的原因感到困惑,这使得它在规划未来的行动时表现稍逊一筹。
  • PatchWorld-Simple(建筑师): 这个版本纯粹依赖于游戏的逻辑规则(例如,“如果你打开抽屉,其中的物品就会变得可见”)。它不记忆精确的短语;它理解机制。

    • 结果: 它是规划方面的佼佼者。它可以进行前瞻性思考,并找出获胜的最佳行动序列,即使它生成的文本不是对原始文本的逐字逐句复制。
    • 为什么它能赢: 在游戏中,你不需要 AI 完美地复述“你看到一个红苹果”,你只需要它知道苹果现在可以拿取了,这样你才能捡起它。

4. 重大发现:“帕累托前沿”(Pareto Frontier)

作者发现,你无法同时拥有这两个极致的目标。

  • 如果你想要一个完美的翻译者(预测下一句精确的句子),你需要“Residual”版本。
  • 如果你想要一个完美的策略家(规划如何获胜),你需要“Simple”版本。

他们称之为 帕累托前沿。这就像一条曲线,当你向右移动一步(更好的规划)时,就必须向下方移动一步(略微降低文本预测能力),反之亦然。

5. 为什么这很重要(根据论文所述)

  • 它是透明的: 与其他无法看到其思考方式的“黑盒”AI 模型不同,PatchWorld 生成的是实际的 Python 代码。你可以阅读代码,查看规则,甚至在它们出错时手动修复它们。
  • 它是高效的: 一旦代码写好,AI 就不再需要调用庞大的语言模型来执行动作。它只需运行那个小巧、快速的 Python 脚本即可。
  • 它支持离线学习: 该系统可以从过去的游戏日志中学习,而无需在学习过程中实时进行游戏。

总结

PatchWorld 是一个将一堆游戏日志转化为可修复、可执行规则书的工具。它证明了:虽然一个擅长记忆文本的模型在模仿游戏语感方面表现出色,但一个理解底层逻辑的模型在真正赢得游戏方面表现更好。最好的方法取决于你更看重文字本身,还是更看重策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →