← 最新论文
🤖 AI

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents

该论文提出了一种结合子目标分解的在线规划框架与基于里程碑的密集奖励强化学习训练方法(MiRA),显著提升了大语言模型代理在长周期任务(如网页导航)中的规划能力与成功率,使其在开源模型上的表现超越了包括 GPT-4o 在内的现有最先进系统。

原作者: Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

发布于 2026-03-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文主要解决了一个大问题:让大语言模型(LLM)像人类一样,能够独立完成那些步骤很多、时间很长的复杂任务(比如在网页上找东西、填表单),而不是做着做着就“迷路”或“卡死”了。

想象一下,你让一个刚学会开车的人(现在的 AI 模型)去开长途车,从北京开到广州。

  • 现在的 AI 问题: 它可能刚开出几百公里,看到路边有个加油站,就忘了要去广州,开始研究怎么加油;或者在某个路口转圈,怎么也找不到正确的路,最后车没油了(任务失败)。
  • 论文的核心思想: 给这个司机(AI)配一个**“智能导航仪”,并且给司机安排“里程碑式”的奖励机制**。

下面我用三个生动的比喻来拆解这篇论文的两个核心贡献:

1. 核心痛点:为什么 AI 做长任务会“翻车”?

现在的 AI 就像一个**“记性不太好且容易走神”的实习生**。

  • 在线执行时(推理阶段): 当任务变长,它看着眼前的网页,容易忘记最初的目标。比如老板让它“找一家离 CMU 50 英里内最近的咖啡馆”,它可能搜着搜着,看到个“汉堡王”就点进去了,完全忘了还要找“咖啡馆”。它会在错误的路上越走越远,最后死循环(卡在原地转圈)。
  • 训练时(强化学习阶段): 如果只告诉它“最后成功了给 100 分,失败了 0 分”,它根本不知道中间哪一步做对了。就像你让实习生去修一台复杂的机器,只有修好才给奖金,修不好就扣钱。实习生在中间拆了 100 个螺丝,根本不知道哪个螺丝是关键的,最后只能靠运气瞎蒙。

2. 解决方案一:在线“智能导航仪” (Subgoal Decomposition)

比喻:把“爬珠峰”变成“登台阶”

论文提出了一种**“子目标分解”**的方法。

  • 以前: 直接给 AI 一个终极目标:“爬上海拔 8848 米的珠峰”。AI 看着山顶,不知道第一步该迈哪条腿,容易慌。
  • 现在(MiRA 框架): 利用一个更聪明的“大老师”(Google 的 Gemini 模型),把大目标拆解成一个个具体的**“路标” (Subgoals)**:
    1. 先穿上登山鞋。
    2. 走到大本营。
    3. 适应高海拔。
    4. 冲顶。

怎么工作?
AI 每走一步,都会停下来问自己(通过“自我反思”机制):

  • “我刚才走到大本营了吗?”(检查路标 1 是否完成)
  • “我现在该去适应高海拔了吗?”(规划下一步)
  • “我是不是在原地转圈了?”(发现卡死,立刻纠正)

效果: 这就像给 AI 装了一个实时导航。即使它偶尔走错,导航也会立刻发现:“嘿,你偏离路线了,快回到‘大本营’这个路标上来!”这让 AI 不容易迷路,大大减少了“卡死”的情况。

3. 解决方案二:训练时的“里程碑奖励” (MiRA - Milestoning your Reinforcement Learning)

比喻:把“期末考”变成“闯关游戏”

在训练 AI 时,传统的做法是**“期末考”:只有最后任务完全成功才给奖励。这太难了,AI 学不会。
论文提出了 MiRA 框架,把训练变成了
“打怪升级的闯关游戏”**。

  • 传统训练: 只有通关(比如成功买到票)才给金币。AI 试了 100 次,99 次失败,1 次成功,它根本不知道那 99 次里哪一步做对了。
  • MiRA 训练: 设置**“关卡奖励”**。
    • 打开了网页?给 1 分。
    • 找到了搜索框?给 2 分。
    • 输入了关键词?给 3 分。
    • 最后买到了票?给 100 分。

关键点:
论文设计了一个**“潜力评估员” (Potential Critic)。它就像一个“进度条”**。

  • 它不只看最后结果,而是实时计算:“你现在完成了任务的 30% 还是 60%?”
  • 只要 AI 往前走了一步(比如完成了子目标),它就立刻给奖励。
  • 这样,AI 就能清楚地知道:“哦!原来点击这个按钮是通往成功的关键一步!”

4. 最终成果:小模型逆袭大模型

这篇论文最厉害的地方在于,它让开源的小模型(Gemma-3-12B) 变得比谷歌自家的超级大模型(Gemini-2.5 Pro) 还要聪明。

  • 数据说话: 在复杂的网页导航测试中,原本只有 6.4% 成功率的小模型,用了这套方法后,成功率飙升到了 43.0%
  • 对比: 这个成绩甚至超过了 GPT-4o (13.9%) 和 GPT-4-Turbo (17.6%)。

为什么能赢?
因为大模型虽然聪明,但如果没有好的“导航”和“奖励机制”,它在长任务中也会走神。而小模型虽然底子弱,但通过**“拆解任务(导航)”“步步有奖励(闯关)”**,它学会了如何稳扎稳打,不再乱跑。

总结

这篇论文就像给 AI 装上了两样神器:

  1. 一副“千里眼”和“指南针”: 在做事的时候,时刻提醒它“你现在的目标是什么,你走到哪一步了”,防止它走神或迷路。
  2. 一套“即时反馈系统”: 在训练的时候,每完成一个小任务就给糖吃,让它知道怎么一步步走向成功,而不是等到最后才给糖。

通过这两招,AI 终于能像经验丰富的老手一样,从容地处理那些繁琐、漫长的数字世界任务了。这不仅是技术的进步,更是让 AI 从“聊天机器人”进化为真正的“数字员工”的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →