RuleSmith: Multi-Agent LLMs for Automated Game Balancing
原作者: Ziyao Zeng, Chen Liu, Tianyu Liu, Hao Wang, Xiatao Sun, Fengyu Yang, Xiaofeng Liu, Zhiwen Fan
原作者: Ziyao Zeng, Chen Liu, Tianyu Liu, Hao Wang, Xiatao Sun, Fengyu Yang, Xiaofeng Liu, Zhiwen Fan
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:RuleSmith —— 用于自动化游戏平衡的多智能体大语言模型
问题陈述
平衡非对称策略游戏是游戏设计和多智能体学习中的一个持久挑战。传统方法依赖于人类专家通过手动调优、启发式调整和主观测试进行迭代循环。这一过程缓慢、昂贵且难以扩展,尤其是在现代游戏具有组合动作空间、长程目标和丰富参数化规则系统的情况下。此外,该问题不仅限于娱乐领域,还延伸至经济模拟、政策设计和网络安全等领域,在这些领域中,评估微小的参数变化如何通过多步交互进行传播至关重要。虽然大语言模型(LLM)已展示出作为多智能体系统“零样本(zero-shot)”模拟器的能力,但利用它们来优化这些环境的规则仍是一个尚未被充分探索的领域。
方法论
作者引入了 RuleSmith,这是一个通过将游戏引擎、多智能体 LLM 自博弈(self-play)与多维规则空间上的贝叶斯优化相结合,从而实现游戏平衡自动化的框架。
1. 测试平台:CivMini
为了验证该框架,作者构建了 CivMini,这是一个受 4X 机制启发、经过简化且参数化的回合制非对称策略游戏。
- 阵营: 两个非对称阵营:帝国(Empire) 与 游牧者(Nomads)。
- 帝国: 特化经济型,拥有截然不同的农夫(仅资源采集)和士兵(仅战斗)单位。
- 游牧者: 拥有高机动性的全能骑兵单位,通过击杀敌方单位获取资源,这要求其采取侵略性玩法。
- 参数: 游戏暴露了 12 个可调参数 (θ),涵盖经济(初始资源、采集效率)、战斗(伤害、生命值)、生产(单位成本)以及计分(资源、战斗、幸存单位的权重)。
- 目标: 优化 θ 以最小化平衡损失函数 L(θ)=∣wE−0.5∣+∣wN−0.5∣+0.5⋅wD,其中 wE 和 wN 分别为胜率,wD 为平局率。
2. 作为评估器的 LLM 自博弈
RuleSmith 利用两个 LLM 智能体(每个阵营一个)根据自然语言规则书和结构化游戏状态进行游戏。
- 输入: 智能体接收回合索引、阵营摘要、敌人位置、策略指南以及合法动作列表。
- 输出: 智能体生成一个包含所有单位同时动作的结构化 JSON 对象。
- 可靠性机制:
- RAG(检索增强生成): 一个轻量级系统根据游戏上下文从规则书中检索相关规则,以减少幻觉。
- 结构化输出: 通过强制执行带有显式示例的 JSON 输出,减少解析错误和非法移动检测的负担。
- 评估: 对于给定的参数集 θ,运行 N 场自博弈游戏,以估计经验胜率和平衡指标。
3. 带有自适应采样的贝叶斯优化
直接搜索离散规则空间由于组合爆炸而变得难以处理。RuleSmith 在规则空间的连续松弛版本上采用 贝叶斯优化(BO)。
- 代理模型: 高斯过程对平衡损失 L(θ) 进行建模。
- 离散投影: 将优化器提出的连续候选解确定性地投影到有效的离散游戏配置中(例如,将生命值取整)。
- 基于采集函数的自适应采样: 为了应对 LLM 评估的高计算成本和噪声,框架动态分配评估预算 (Nt)。
- 具有高 期望改进(Expected Improvement, EI)(有前景的点)的候选方案将获得更多游戏次数 (Nmax),以进行准确评估。
- 具有低 EI 的探索性候选方案获得的次数较少 (Nmin)。
- 该策略将资源集中在关键配置上,同时保持高效的探索。
核心贡献
- 可执行的零样本自博弈: 证明了多智能体 LLM 仅依靠自然语言规则书和结构化状态,即可在可执行的非对称策略游戏中进行零样本自博弈,并产生合法且可验证的动作,无需训练。
- 自动化平衡流水线: 提出了一个集成多智能体 LLM 自博弈与贝叶斯优化及基于采集函数的自适应采样的通用框架。该流水线自动调整规则参数以实现平衡结果,并通过将更多预算分配给有前景的候选方案来提高采样效率。
- 全面的实证验证: 在不同模型规模(2B 和 8B 参数)和阵营配置下,在 CivMini 上验证了 RuleSmith。该系统始终能达到近乎平衡的结果(胜率在 50%±5% 范围内),并证明当模型容量匹配时,平衡后的参数在不同评估设置间具有迁移性。
实验结果
- 收敛性: RuleSmith 成功收敛至高度平衡的配置,即使从刻意不平衡的初始化状态开始,也能将胜率差异降低至 0%。
- 模型容量效应: 实验表明,增加其中一个阵营的模型规模会使其胜率分布向其倾斜。值得注意的是,当使用为较小模型优化的参数去评估一个较大的模型对抗较小的模型时,性能差距最为显著,这凸显了“更聪明”的智能体利用战略优势的能力。
- 消融研究:
- 优化方法: 与随机搜索和 (1+1)-进化策略进行对比,RuleSmith 的带有自适应采样的贝叶斯优化是唯一能一致收敛至近乎相等胜率(51%|49%)的方法。固定采样的 BO 及其他基准方法未能实现平衡。
- 游戏设计: 该框架在不同的地图大小(5×5 到 11×11)和回合限制下均保持了平衡的结果,展示了对空间和时间配置变化的鲁棒性。
- 可解释性: 发现的参数提供了关于生命值缩放、资源效率和生产节奏如何共同决定公平性的可解释性见解。系统找到了多种实现平衡的参数化方式,而非仅仅收敛于单一的规范设置。
意义与主张
论文声称 RuleSmith 代表了一种转变,即不再仅仅将 LLM 用作测试工具,而是将其作为优化复杂、受规则约束的多智能体环境的有效机制。通过将游戏本身视为参数化的非对称环境并直接优化规则空间,该框架提供了一种可扩展且具有可解释性的平衡方法。
作者认为,这种范式除了游戏设计之外,在政策设计、经济建模、网络安全和医疗决策等领域也具有广泛的应用前景,因为在这些领域中,基于规则的非对称交互是常态。他们强调,该框架旨在作为一种离线分析和设计时工具,旨在支持更安全、更透明且更系统的规则化系统设计,而非作为实时决策执行系统。该工作承认了局限性,指出在简化环境中的 LLM 自博弈可能无法完全捕捉人类行为,也无法在分布偏移下提供形式化保证。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。