← 最新论文
🤖 AI

Distilling Game Code World Model Generation into Lightweight Large Language Models

本文提出了一种可扩展的课后训练流程,结合监督微调与可验证奖励强化学习,将前沿模型生成游戏代码世界模型的能力蒸馏至一个轻量级的 30 亿参数大语言模型中,使其能够根据自然语言规则准确生成可执行的游戏环境。

原作者: Tyrone Serapio, Arjun Prakash, Haoyang Xu, Kevin Wang, Amy Greenwald

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Tyrone Serapio, Arjun Prakash, Haoyang Xu, Kevin Wang, Amy Greenwald

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要建造一个机器人,让它能够玩你向它描述的任意棋盘游戏,从国际象棋到扑克。为此,机器人需要一本“规则手册”,明确告知它游戏如何运作:棋子如何移动、什么算作胜利,以及玩家犯错时会发生什么。

在过去,为新游戏编写这些规则手册,就像每次都要雇佣一支专家工程师团队从头编写代码。这既缓慢又昂贵,并且需要非常智能(且极其昂贵)的计算机来厘清细节。

本文提出了一种新方法:训练一台小型、廉价的计算机自行编写规则手册。

以下是他们方法的分解,使用简单的类比进行说明:

1. 问题:“天才导师”与“学徒”

目前,如果你希望计算机生成游戏规则手册(作者称之为游戏代码世界模型),你必须向一位“天才导师”(如 GPT-4 或 Gemini 这样庞大且昂贵的 AI)提出请求。

  • 旧方法:你询问天才导师:“为这个新游戏编写规则。”如果它犯了错误,你就检查代码,指出错误,并让天才导师重试。你可能需要重复这个循环数十次。这就像雇佣一位世界级的厨师来制作一个简单的三明治,但你必须不断品尝并把它送回厨房,直到它完美为止。这虽然有效,但速度缓慢且代价高昂。

2. 解决方案:知识蒸馏

作者希望验证是否可以在不需要天才导师每次检查其工作的情况下,训练一个小型、轻量级的 AI(“学徒”)来胜任这项工作。他们将此过程称为**“蒸馏”**。

这就像一位主厨(大型 AI)教导一位初级厨师(小型 AI)如何烹饪。初级厨师不再每次切洋葱时都向主厨求助,而是主厨花时间训练初级厨师,直到初级厨师能够独立完美地烹制这道菜。

3. 训练过程:两步走

作者使用了一个两步训练流程,将小型 AI(Qwen2.5-3B)转变为游戏规则专家:

  • 步骤 1:监督微调(SFT)——“食谱书”
    他们向小型 AI 展示了 30 种不同的游戏(如井字棋、扑克和二十一点),以及这些游戏运作方式的正确代码。这就像给学徒一叠完美的食谱书,并说:“记住这些食谱。”

    • 结果:AI 在编写代码方面有了显著进步,减少了拼写错误或语法错误(如忘记逗号或括号)。
  • 步骤 2:带有可验证奖励的强化学习(RLVR)——“品尝测试”
    仅仅记住食谱是不够的;食物必须尝起来味道正确。作者构建了一个自动化的“品尝测试器”(一个验证框架)。

    • AI 尝试编写游戏规则手册。
    • “品尝测试器”运行代码。游戏会崩溃吗?规则合理吗?游戏是否正确结束?
    • 如果代码通过测试,AI 就会获得“奖励”(积分);如果失败,则受到惩罚。
    • AI 反复尝试,从这些奖励中学习,从而编写出真正有效的代码,而不仅仅是看起来正确的代码。

4. 结果:什么有效,什么无效

作者在他们从未见过的游戏(分布外游戏)上测试了训练有素的“学徒”。

  • 好消息:经过训练的小型 AI 在编写有效游戏代码方面有了显著提升。它学会了避免语法错误,并且比训练前更好地遵循了游戏规则的基本结构。这证明了你可以教会一个小模型胜任这项工作,而无需昂贵的“天才导师”检查每一行代码。
  • 坏消息:AI 在处理最复杂的游戏时仍然感到吃力,特别是那些涉及隐藏信息的游戏(如扑克,因为你不知道对手手中的牌)。
    • 比喻:学徒可以完美地制作烤奶酪三明治(简单游戏),甚至制作复杂的千层面(完全信息游戏)。但当被要求制作一道需要猜测对方想法的菜肴(不完全信息游戏)时,学徒会感到困惑,有时会放弃,或者写出一个简化且错误的版本。
    • 有趣的是,即使是“天才导师”(GPT-4)在这些复杂的隐藏信息游戏上也遇到了困难,这表明这是所有当前 AI 都面临的一个非常棘手的问题。

5. 核心结论

本文表明,我们可以将生成复杂游戏规则的能力从昂贵的大型 AI 模型中提取出来,并通过训练将其“蒸馏”到更小、更便宜的模型中。

  • 以前:你需要一台超级计算机和大量时间来生成游戏引擎。
  • 现在:你可以训练一个小型、高效的模型来做到这一点,前提是游戏不太复杂。

作者总结道,虽然这个小模型尚未完美(特别是在涉及隐藏秘密的棘手游戏中),但这是朝着让 AI 代理自动创建可游玩的数字世界变得简单且廉价迈出的重要一步。他们并未声称这适用于医疗诊断、金融交易或其他现实世界应用,仅适用于生成模拟游戏环境的代码。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →