← 最新论文
💻 computer science

Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory

本文研究了大语言模型在零和博弈等序列决策任务中的次优表现,并提出了一种带有经验记忆的智能体框架,该框架通过利用赛后反思和规则提取,在不修改模型权重的情况下提升策略性表现。

原作者: Jakub Rada (AI Center, Department of Computer Science, Faculty of Electrical Engineering, Czech Technical University in Prague), Viliam Lisý (AI Center, Department of Computer Science, Faculty of Elec
发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Jakub Rada (AI Center, Department of Computer Science, Faculty of Electrical Engineering, Czech Technical University in Prague), Viliam Lisý (AI Center, Department of Computer Science, Faculty of Electrical Engineering, Czech Technical University in Prague)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个才华横溢、博学多才的机器人玩游戏。你给了它一个包含人类历史上所有书籍的图书馆,它能背诵诗歌,解决复杂的数学问题,还能编写代码。但当你让它坐在一个像井字棋(Tic-Tac-Toe)这样简单的棋盘前时,它却开始犯一些愚蠢的错误。它做出一个表面看起来不错、但在五步之后会导致输掉游戏的动作。这就是**大语言模型(LLMs)**的世界:它们是能够交谈和推理的超级智能 AI,但有时在需要进行一系列决策——其中一个错误的举动就会毁掉全局——时,却显得力不从心。

研究人员正在探讨的一个核心问题是:为什么会发生这种情况? 是机器人在那一刻无法思考清楚步骤?还是因为它在试图回忆书中看到的某个游戏,但由于并不真正理解其逻辑,从而产生了“幻觉”?为了找出答案,科学家们使用了序列决策(sequential decision-making),这只是一个高级说法,意指“一系列选择的过程,其中一个选择的结果会改变下一个选择时的局面”。他们在**零和博弈(zero-sum games)**中测试这一点,比如国际象棋或跳棋,在这些游戏中,一方的胜利即为另一方的失败。这些游戏是完美的测试工具,因为它们的规则非常严格,我们可以利用数学方法精确地知道什么是“完美”的走法。如果一个机器人连井字棋都打不过一个完美的计算机程序,说明它的“大脑”出了问题。


推理瓶颈之谜

在这项研究中,来自布拉格捷克理工大学的研究人员决定“捅一捅这头熊”。他们选取了目前最智能的 AI 模型——从高效的小型模型到像 GPT-5.4 和 Gemini 3.1 Pro 这样的“前沿”巨头——并挑战它们玩简单的游戏:井字棋Nim 游戏(一种关于石堆的游戏)以及四子棋(Connect Four)

结果让 AI 显得有些尴尬。即使是最先进的模型,即便它们能解决竞赛级的数学问题,表现也并不理想。在井字棋这种人类小孩能在一下午内学会永不落败的游戏中,这些 AI 模型每百步会出现四到十二次失误。在四子棋中,这些“前沿”模型几乎输掉了每一局面对标准计算机对手的比赛,通常在原本可以持续四十步的对局中,不到十步就彻底崩溃。

研究人员想知道:AI 是不是把游戏给忘了? 也许它是在尝试回忆在其训练数据中看到的某种策略,但因为游戏看起来略有不同,它就感到困惑了。为了测试这一点,他们对 AI 使用了一个诡计。他们在底层保持游戏完全不变,但改变了表层的“皮肤”。他们把井字棋变成了“幻方”(Magic Square,通过挑选三个相加等于 15 的数字来获胜),或者给它讲了一个关于“过河”的故事。

转折点在于:AI 的表现并没有因此变好或变差。 即使游戏被伪装成数学谜题或故事,AI 依然会犯同样数量的错误。这表明问题不在于 AI 忘记了记忆中的策略,也不在于它无法理解规则;而是因为它在当下存在推理瓶颈(reasoning bottleneck)。这就像一个学生,他能背诵整本历史教科书并理解其中的逻辑,但当被要求当场解决一个简单的逻辑谜题时,却因为无法将当前情况与正确的下一步联系起来而僵住了。AI “已知”的内容与它在变化环境中的“所能”之间,存在着真实且顽固的差距。

解决方案:一本“反思性”笔记本

由于重新训练这些庞大的 AI 模型既昂贵又具有风险(可能会让它们忘记如何写代码或说话),研究人员提出了疑问:我们能否在不改变其大脑的情况下帮助 AI?

他们构建了一个名为 REAPER(带有周期性规则提取的反思性经验智能体)的新框架。不要把 REAPER 看作是一个新的大脑,而要把它看作是坐在 AI 旁边的一本聪明的笔记本和一个严厉的教练

它是这样运作的:

  1. 游戏阶段: AI 与对手进行游戏。
  2. 反思阶段: 游戏结束后,AI 不仅仅是看最终得分(胜/负)。相反,REAPER 系统强制它审视自己做的每一个动作。它会问:“这个动作在当时对棋盘有利吗?它帮我赢了,还是害了我?”
  3. 信用分配(Credit Assignment): 这是神奇之处。在普通的比赛中,如果你输了,你可能会认为所有的动作都是错的。但 REAPER 会说:“等等,尽管你最后输了,但你在中间其实走了一步好棋。”它会对好的动作给予肯定,对坏的动作给予责备,即使最终结果是失败。
  4. 规则手册: 每隔几局游戏,REAPER 会将这些反思整理成简单的自然语言规则。它不再仅仅记住“在特定位置 X 移动是好的”,而是学习到“如果对手威胁到角落,就进行阻挡”。
  5. 循环阶段: AI 再次进行游戏,但这一次,它会在做出动作之前阅读自己的规则笔记和过去的错误记录。

结果:更聪明,而非更强

研究人员使用一个较小的、高效的 AI 模型(GPT-5 nano)在井字棋上测试了这一方法。结果非常明确:

  • 基准线: 在没有笔记本的情况下,AI 表现糟糕,犯了很多错误。
  • “原始”尝试: 他们尝试了一个简单的笔记本版本,但它太混乱了,AI 不断出现格式错误。
  • REAPER 的成功: 配合完整的反思与规则提取系统,AI 的表现大幅提升。它开始能实现约 86.8% 的平局率(面对完美对手时的最佳结果),而改进后的基准线仅为 81.8%

至关重要的是,AI 不需要重新训练。它纯粹通过自身的经验进行学习,就像人类玩家通过研究过去的比赛来提高水平一样。研究人员发现,这种方法不仅让 AI 玩得更好,还让它变得更高效——因为它有了清晰的策略可循,所以决策时使用的词汇(token)更少了。

这意味着什么

这篇论文表明,AI 在游戏中的问题不在于它们不够聪明到无法理解规则,而在于它们难以将长链条的行为与最终结果联系起来。通过给它们提供一种反思错误并从特定游戏中提取通用规则的方法,我们可以将一个笨拙的玩家变成一个具有战略能力的玩家,而无需改动其代码中的任何一行。

研究人员谨慎地指出,这只是在简单游戏上的模拟。他们并不声称这解决了所有的 AI 问题,也不保证它在复杂的现实场景中能完美运行。但这证明了一个至关重要的观点:经验记忆与自我反思是强大的工具。 如果我们能教会 AI 回顾自己的所作所为、从中学习并写下教训,我们或许就能构建出不仅仅是在真空里“思考”,而是能真正从世界中学习的智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →