← 最新论文
🤖 machine learning

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

本文提出了 APEX,一种自主策略探索框架,该框架利用策略图和分叉发现机制来克服自进化大语言模型智能体中的探索崩溃问题,使其能够通过记忆和反思发现更优策略,而无需更新模型权重。

原作者: Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是 APEX 论文的通俗解释,通过日常类比拆解为简单概念。

问题:“舒适区”陷阱

想象你正在玩一款复杂的游戏(比如文字冒险游戏,你需要输入指令来探索世界)。你有一位智能 AI 助手在帮你。

起初,AI 会尝试许多不同的事情:开门、捡物品、与 NPC 对话。但过了一段时间,它找到了一条能获得不错分数的路径。它开始感到舒适。它意识到:“嘿,如果我只走这条特定的走廊并捡起那把钥匙,每次都能得分。”

于是,它停止尝试任何新事物。它陷入循环,一遍又一遍地重复同样的安全流程。

  • 问题所在:AI 的平均表现不错,但它已经停止寻找那个能带来双倍分数的“秘密宝藏室”,因为那藏在一扇它从未想过要尝试的门后。
  • 论文术语:这被称为探索崩溃(Exploration Collapse)。智能体停止探索,仅仅利用它已知的东西,从而错过了更好的策略。

解决方案:APEX(“探险家地图”)

作者提出了一种名为 APEX(自主策略探索)的系统。与其让 AI 随意漫游或死记硬背过去的错误,APEX 为 AI 提供了一张策略地图

不要把这张地图想象成建筑物的绘图,而要把它看作一个由规则连接的目标清单

  • 里程碑:这些是具体目标,比如“找到钥匙”或“打开宝箱”。
  • 依赖关系:地图知道,在你“找到钥匙”之前,无法“打开宝箱”。

这张地图充当了 AI 的共享大脑,精确追踪它已经尝试过什么,以及尚未尝试过什么。

APEX 如何工作:双引擎系统

APEX 使用两个主要机制来防止 AI 陷入停滞,它们像导游侦探一样协同工作。

1. 侦探:“分叉发现(Fork Discovery)”

想象你正在穿过博物馆。你看到一扇门微微开着,但你因为专注于眼前的画作而走了过去。

  • 发生了什么:AI 看到了那扇门,但没有打开它。
  • 分叉发现的工作:游戏结束后,“侦探”会查看回放。它会说:“等等,我们看到了那扇门!我们有机会打开它,但我们从未这样做过。让我们把‘打开门’作为新目标添加到我们的清单中。”
  • 结果:地图得以扩展。它主动发现 AI 忽略的方向,并将它们添加到计划中,确保 AI 不会错过隐藏的机会。

2. 导游:“策略选择(Policy Selection)”

现在地图有了目标列表,AI 需要决定接下来攻克哪一个。

  • 问题:如果 AI 只选择它知道能得分最高的目标,它就永远不会尝试那些新的、有风险的目标。
  • 策略选择的工作:这就像一位聪明的导游,在安全与冒险之间取得平衡。它使用一种数学技巧(称为汤普森采样 Thompson Sampling)来决定:“我们已经尝试了‘钥匙’目标 10 次,它很有效。但我们只尝试过‘门’目标一次。让我们再去试试那扇门,因为我们还不知道它是否是一座金矿!”
  • 结果:AI 被迫访问地图上“未探索”的部分,确保它不会陷入死胡同。

改进循环

每隔几局游戏,系统会暂停以更新其地图:

  1. 优化:修正错误。(例如:“我们以为需要一把剑才能打开门,但实际上,我们只需要一把钥匙。”)
  2. 传播:更新统计数据。(例如:“‘找到钥匙’这个目标实际上非常重要,因为它通向大宝藏。”)
  3. 发现:侦探发现新的门并将其添加到地图中。

为何有效(结果)

研究人员在两种类型的“游戏”上测试了该系统:

  1. 文字冒险(Jericho):复杂的故事情节,需要输入指令。
  2. 网络交互(WebArena):现实任务,如浏览网站购物或查找信息。

发现

  • 旧方法(如 Reflexion):这些智能体被困在舒适区。它们获得了不错的平均分数,但很少找到绝对最佳的解决方案。
  • APEX:因为它明确追踪它尚未尝试过的事情,所以它 consistently 找到了更好的策略。它不仅获得了更高的平均分,还找到了其他人错过的“秘密宝藏”。

总结类比

想象你正在寻找去上班的最佳路线。

  • 旧方法:你每天都走同一条路,因为它通常很快。你从不检查是否有新开通的捷径。
  • APEX 方法:你有一本笔记本(策略地图)。
    • 分叉发现是你看着地图说:“我昨天看到了一条新路,但我没走。我把它记下来,明天试试。”
    • 策略选择是你决定:“我已经走了主干道 20 次。今天让我们试试新路,看看它是否更快。”

通过保持一份关于已尝试和未尝试事项的有序列表,APEX 防止 AI 变得懒惰,并确保它不断发现解决问题的更好方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →