← 最新论文
🤖 AI

PCGRLLM: Large Language Model-Driven Reward Design for Procedural Content Generation Reinforcement Learning

本文介绍了 PCGRLLM,这是一个由大语言模型驱动的框架,它利用反馈机制和基于推理的提示工程来自动设计程序化内容生成的奖励函数,实现了与人类相当的性能,并显著降低了对人工领域专业知识的依赖。

原作者: In-Chang Baek, Sung-Hyun Kim, Sam Earle, Zehua Jiang, Jin-Ha Noh, Julian Togelius, Kyung-Joong Kim

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: In-Chang Baek, Sung-Hyun Kim, Sam Earle, Zehua Jiang, Jin-Ha Noh, Julian Togelius, Kyung-Joong Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人构建一个视频游戏关卡,比如迷宫或地牢。这个机器人很聪明,但它不知道希望它构建什么。它需要一套指令,称为奖励函数,来告诉它:“如果你在这里放置一把钥匙,做得好”;或者“如果你把怪物放错了位置,做得不好”。

传统上,人类专家必须坐下来手动编写这些指令。这就像试图通过撰写一份关于物理学和心理学的 50 页手册来教狗捡东西。这耗时极长,而且如果你犯了一个微小的错误,机器人就会学错东西。

本文介绍了一个名为PCGRLLM的新系统,它利用“超级大脑”(即大型语言模型,LLM)为机器人编写这些指令,并自动改进它们。

以下是其工作原理,使用一个简单的类比:

角色阵容

  1. 架构师(LLM):一个非常聪明的人工智能,能够编写代码并理解故事。它的任务是为机器人编写“指令手册”(即奖励函数)。
  2. 建造者(RL 智能体):一个根据架构师的指令尝试构建游戏关卡的机器人。
  3. 检查员(反馈循环):一个检查建造者工作并向架构师反馈的过程,例如:“嘿,你漏掉了一个地方”或“你把怪物放得太远了”。

过程:三步之舞

第一步:初稿(精炼)
你给架构师一个故事,例如:“玩家需要找到一把钥匙,与一只蝙蝠怪物战斗,然后通过一扇门逃脱。”
架构师编写第一段代码,告诉建造者该做什么。但架构师可能会犯错,比如将找到钥匙的奖励设置得太小,导致建造者忽略它。

第二步:试运行(自对齐)
在建造者开始实际工作之前,系统会进行一次快速的“试驾”。它使用一个随机且笨拙的建造者版本运行代码,只是为了看看代码会产生什么样的数值。

  • 类比:想象架构师写了一份食谱,但烤箱温度被设定为“绝对零度”。系统检查食谱,发现数值很奇怪,于是说:“哇,让我们调整温度设置,这样蛋糕才能真正烤熟。”这确保了指令实际上是可用的。

第三步:批评(反馈)
现在,真正的建造者尝试制作关卡。它生成了一个地牢。系统查看结果并将其与你的原始故事进行比较。

  • 问题:故事说“与蝙蝠战斗”,但地牢里却有一只蜘蛛。
  • 修复:系统向架构师发送一条具体的备注:“你告诉建造者放置蝙蝠,但它放置了蜘蛛。你需要修改代码,使蝙蝠更具吸引力。”
    架构师阅读这条备注,重写代码,然后建造者再次尝试。这个循环不断重复,直到关卡看起来完全符合你讲述的故事。

秘诀:更好地“思考”

本文还测试了架构师“思考”问题的不同方式,类似于人类解决谜题的方式:

  • 思维链:架构师按直线、逐步地思考。(很好,但可能会陷入僵局。)
  • 思维树:架构师展开分支,同时尝试三种不同的想法,并选择最好的一个。如果一条路径是死胡同,它就回溯。
  • 思维图:架构师更加聪明。它审视自己过去最好的想法,并将它们混合在一起,创造出新的、更好的想法。这就像一位厨师查看上周的两道最佳菜肴,并将它们结合起来,制作出今天的杰作。

他们的发现

  • 反馈为王:当架构师获得关于出错之处的具体反馈时,系统效果要好得多。如果你只说“做得更好”,帮助不大。如果你说“蝙蝠不见了”,架构师就会修复它。
  • 有时超越人类:该系统在创建遵循复杂空间规则(例如“宝藏必须在一扇上锁的门后面”)的关卡方面变得非常出色。在这些棘手的情况下,人工智能的表现实际上与人类专家相当,甚至更好。
  • 局限性:该系统并不擅长对自己的工作进行评分。当人工智能试图在没有人类帮助的情况下评估其制作的关卡质量时,它有时会感到困惑并给出错误的评分,从而减缓了学习速度。它仍然需要人类(或非常严格的规则)作为最终裁决者。

结论

这篇论文表明,我们不需要成为游戏设计专家,就能告诉人工智能要构建什么样的游戏。我们只需告诉它一个故事,而这个新系统就会找出将这个故事变为现实所需的复杂数学和代码,不断检查自己的工作并修正错误,直到它做对为止。这就像拥有一位不知疲倦、超级聪明的编辑,不断重写指令,直到机器人构建出你想象的确切内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →