← 最新论文
💬 NLP

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

该论文提出了 CAST,一种利用游戏求解器中的状态价值变化来为通过具有可验证奖励的强化学习训练 LLM 智能体生成稠密的回合级信用信号的方法,其在各种游戏环境中显著优于现有的基准方法。

原作者: Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi Gu, Xunliang Cai, Lan-Zhe Guo, Han-Jia Ye, Fuli Feng

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi Gu, Xunliang Cai, Lan-Zhe Guo, Han-Jia Ye, Fuli Feng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

“如果……会怎样?”的大型游戏

想象一下,你正在教一个非常聪明、非常热衷学习的机器人玩一种复杂的棋类游戏(如国际象棋)或电子游戏。这个机器人读遍了图书馆里的每一本书,能比几乎任何人都能更好地理解语言,但它从未真正“玩”过这类游戏。这就是**大语言模型(LLMs)**的世界:它们是超级聪明的计算机,可以聊天、写作和推理,但在需要为了实现某个目标而在不断变化的环境中做出系列决策时,往往会感到吃力。

为了教导这些机器人,科学家通常使用一种叫做**强化学习(Reinforcement Learning)**的方法。这就像是在训练一只狗。你给它一个指令,它做出反应,如果它在最后时刻做对了,你就给它一个巨大的奖励(零食);如果失败了,它什么也得不到。问题在于,在漫长而复杂的游戏中,“奖励”只会在最后时刻出现。如果机器人在三步之前犯了一个错误,它并不知道究竟是哪一步出了问题。它只知道整个游戏失败了。这就是所谓的“信用分配”(credit assignment)问题:即弄清楚究竟哪一个具体的步骤应该获得荣誉,或者该为失败承担责任。由于无法得知这一点,机器人只能靠猜,这使得学习过程变得极其缓慢且令人沮丧。

“求解器”老师:一种新的学习方式

本文介绍了一种巧妙的新技巧,叫做 CAST(来自求解器老师的信用分配),旨在帮助这些人工智能智能体学得更快、更聪明。研究人员意识到,虽然 AI 在努力摸索游戏规则,但其实已经有一个“完美玩家”就在身边了:一个游戏求解器(game solver)。求解器是一个专门设计的计算机程序,旨在完美地解决特定的游戏,就像解一道数学方程一样。它确切地知道从棋盘上的任何给定位置出发,需要多少步才能获胜。

作者的核心想法是,让这个完美的求解器充当回合级老师(turn-level teacher)。与其等到游戏结束才说“做得好”或“做得不好”,不如让求解器在 AI 做出每一步动作后都检查一次棋盘。它会询问:“这一步是让我们离胜利更近了,还是让我们离胜利更远了?”

以下是神奇之处是如何发生的:

  1. 计分卡: 求解器会计算棋盘的“剩余代价”(cost-to-go)数值。这个数值代表了距离胜利还剩多少步。如果 AI 做出的动作降低了这个数值(向胜利靠近),求解器就会给它一个正向的“优势”分数。如果动作让情况恶化,则会得到一个负分。
  2. 信号: 本文认为,这个分数实际上是一个秘密代码。从数学上讲,告诉 AI “最大化这个分数”等同于要求它模仿求解器的选择,但又不需要求解器写出一份完整的概率列表(那会太重且太慢)。这就像老师在耳边低语:“那步走得好”,而不是写一篇关于为什么走得好的长篇大论。
  3. 过滤器: 有时求解器的分数会非常极端——比如因为掉入陷阱而受到巨大的惩罚。为了防止 AI 被这些极端数值搞混,研究人员使用了一种特殊的数学“压缩器”(称为 asinh 变换),它可以平滑掉剧烈的波动,同时保持微小但重要的细节清晰可见。他们还对分数进行了归一化处理,以免 AI 被数字的大小所压倒。

研究发现

团队在三个经典游戏中测试了这种新方法:Sokoban(推箱子,将箱子推入目标点)、Minesweeper(扫雷,寻找安全的方格而不踩到地雷)以及 Rush Hour(华容道,通过滑动车辆开辟出一条路径)。他们将使用“求解器老师”训练的 AI 与仅根据最终胜负结果进行学习的其他 AI 模型进行了对比。

结果令人印象深刻。使用 CAST 训练的 AI 学习速度显著加快。在某些情况下,它达到相同技能水平所需的步骤比其他方法减少了 1.7 到 2.0 倍。更重要的是,它不仅仅是在练习的特定谜题上变得更好;它成为了一个更优秀的通用型玩家。当他们在 AI 从未见过的游戏或难度更高的同类游戏中进行测试时,经过 CAST 训练的 AI 始终优于所有其他训练模型,甚至击败了几个并未针对这些游戏进行训练的强大商业 AI 模型。

研究人员还检查了这种“求解器老师”是否过于缓慢或昂贵。他们发现,求解器检查棋盘所花费的时间微乎其微——不到 AI 玩游戏总时间的 0.01%。它运行得如此之快,以至于几乎没有增加额外的工作量。即使他们用一个并非完美(但仍然很出色)的“习得型”AI 取代了完美的求解器,该方法依然表现良好,这表明即使在不存在完美解决方案的情况下,这种方法仍然可以使用。

简而言之,本文表明,通过让完美的游戏求解器在每一步之后低语“走得好”或“走得坏”,我们可以教导通用人工智能智能体成为更优秀的决策者,从而以更少的尝试与错误来解决复杂且长期的难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →