← 最新论文
💬 NLP

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

本文将“探索崩溃”(exploration collapse)识别为一种关键的失效模式,即大语言模型(LLM)智能体在强化学习过程中,在陌生环境中失去了发现新解的能力,并提出了 SPA 方法,该方法通过在优化奖励之前,先通过自我经验监督微调使智能体在状态和转移预测方面实现落地,从而提升性能。

原作者: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

发布于 2026-09-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个旨在像人类一样思考和行动的计算机程序,它能够解决谜题、在虚拟世界中导航,甚至可以使用网络浏览器来查找信息。这些被称为大型语言模型的程序,通过在互联网上的海量文本上进行训练,学习如何预测句子中下一个出现的词。当研究人员要求这些模型扮演“智能体”(agents)——即采取步骤来实现某个目标时,他们通常使用一种称为“强化学习”的方法。这是一个模型尝试不同动作,并根据其成功或失败获得反馈,进而逐渐学会重复那些能导致成功的动作的过程。这是一种强大的方法,可以教会机器去做那些它并未被明确编程执行的事情。然而,当这些智能体被置于全新的、陌生的情境中时,一个关键问题出现了。虽然它们可能学会了解决以前见过的特定谜题,但它们往往难以弄清楚如何探索一个完全新的环境,容易陷入一种狭隘的思维方式,从而阻碍它们找到最佳解决方案。

一个研究小组致力于研究为什么这些智能智能体在遇到未知情况时会失败。他们发现了一种他们称之为“探索崩溃”(exploration collapse)的特定现象。简单来说,当智能体在处理一项新任务时,它往往学会了寻找一条特定的成功路径,然后忽略所有其他可能性。它变得如此专注于那单一的路线,以至于失去了尝试不同方法的能力。研究人员通过观察两个不同的指标来衡量这一点:一个追踪智能体的“最佳猜测”是否奏效,另一个追踪它的“许多不同猜测”中是否有任何一个奏效。在熟悉的任务中,随着智能体的学习,这两个得分都会提高。但在新的、困难的环境中(例如一个需要将箱子推向特定目标的网格谜题),代表单个最佳猜测的得分略有上升,而代表尝试多种路径的得分实际上却下降了。智能体正在变得对一个错误的习惯更加自信,而不是变得更加灵活。发生这种情况是因为智能体并没有真正理解它所处的新世界的规则;它是在没有坚实基础的情况下进行猜测。

为了解决这个问题,研究人员开发了一种名为 SPA(Self-Experience Agent,自我经验智能体)的新型训练方法。他们并没有立即尝试教智能体如何获得奖励,而是先教它如何理解周围的世界。他们给智能体一个机会,让它在没有得分压力的情况下自主探索环境。在这个阶段,智能体被要求描述它所看到的内容,并预测如果它采取某种行动,接下来会发生什么。例如,如果智能体看到一个箱子在特定位置,并决定推动它,它必须首先陈述箱子的位置,然后预测它最终会停在哪里。研究人员随后利用来自环境的实际、正确的结果来纠正智能体的预测,这实际上是在教它该特定游戏的“物理定律”。这个过程在智能体的思维中创建了一种类似于内部地图或“世界模型”的东西,将其理解锚定在现实之中,而非模糊的猜测。

一旦智能体建立了这种对世界运作方式的内部理解,研究人员就开始了标准的训练过程,以教它如何获胜。结果是令人惊叹的。在测试一个名为“推箱子”(Sokoban)的益智游戏(智能体必须将箱子推向目标点)时,标准训练方法仅能让智能体取得约 25% 的成功率。使用这种新方法后,成功率跃升至接近 60%。在另一个涉及冰冻湖泊的谜题中,成功率从约 22% 提升到了 70% 以上。或许最令人惊讶的是,一个使用这种方法训练的极小型计算机模型,其表现竟然超越了一个使用旧有标准方法训练的更大、更强大的模型。这个小模型因为先学习了游戏的规则,因此能够比那个仅仅试图通过猜测来获取奖励的巨型模型更有效地应对复杂的谜题。

研究人员还测试了这种方法是否适用于其他类型的任务,例如逻辑谜题“数独”以及一个模拟家务劳动的环境。在每种情况下,这种先教智能体理解世界状态、再尝试获胜的方法都取得了更好的结果。他们发现,成功的关键不在于拥有更多的数据或更大的计算机,而在于学习发生的顺序。通过强制智能体首先学习环境的结构,它避免了陷入单一且脆弱策略的陷阱。智能体学会了保持多种选择的可能性,因为它理解了行为的后果,从而能够进行探索。这种方法表明,对于人工智能要实现真正的适应新环境和复杂情况的能力,它需要在尝试优化成功之前,建立起对现实的可靠理解。这项研究表明,当一个智能体植根于环境的实际机制时,它可以更有效地进行探索,并解决以前无法解决的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →