← 最新论文
💬 NLP

Milestone-Guided Policy Learning for Long-Horizon Language Agents

本文介绍了 BEACON,这是一个里程碑引导的策略学习框架,它通过在里程碑边界划分轨迹并应用双尺度优势估计,解决了长程语言智能体中的信用误分配和样本效率低下问题,并在 ALFWorld 等基准测试中实现了最先进的性能。

原作者: Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个机器人管家去打扫一间凌乱的屋子。这项任务漫长而复杂:“找到蓝色钥匙,打开储藏室,把猫抱出来,然后喂它。”

如果机器人在最后一步失败(比如它忘了喂猫),传统的训练方法会说:“你失败了!回去把你做过的所有事情都撤销。”这意味着机器人会因为它早期做得好的事情(比如找到钥匙和打开门)而受到惩罚。它会感到困惑,因为它在开始时做对了,却因最后的失误而得了“差评”。

本文介绍了一种名为BEACON的新训练方法,旨在解决这种困惑。以下是其工作原理,通过简单的类比来说明:

问题:“全有或全无”的评分

现有方法(如 GRPO)将机器人一整天的表现视为一次单一的测试。

  • 缺陷:如果机器人完美完成了 99% 的工作,却在最后一步绊倒,那么这一整天的表现都会被标记为失败。
  • 结果:机器人无法从那 99% 的出色工作中吸取任何教训。它也会感到困惑,因为有时它执行了相同的动作(比如“找到钥匙”)会收到“做得好”的信号,而有时却收到“做得差”的信号,仅仅因为后续的步骤出了错。这就像学生因为忘记在试卷顶部写名字,尽管解对了每一道方程,却在数学考试中得到 F 的成绩。

解决方案:BEACON(“检查点”系统)

BEACON 通过将长任务分解为更小的章节,即里程碑,从而改变了游戏规则。将这些里程碑想象成电子游戏中的检查点。

1. 将旅程分解为段落
BEACON 不再等到最后才给机器人评分,而是寻找自然的停顿点。

  • 示例:“你找到钥匙了吗?”(检查点 1)。“你打开门了吗?”(检查点 2)。
  • 一旦机器人到达一个检查点,游戏就会“重置”它关于如何到达那里的记忆。机器人找到钥匙时走了多么奇怪的路并不重要;重要的是它现在就在钥匙旁边。

2. 为部分进展给予认可
在旧系统中,如果机器人在最后失败,它一整天的表现都得零分。

  • BEACON 的妙计:如果机器人找到了钥匙但后来失败了,它仍然会因为找到钥匙而获得“部分学分”的奖励。
  • 比喻:想象一场接力赛。如果跑者在最后一圈掉了接力棒,旧系统会说整个团队都得零分。BEACON 则说:“第一棒跑得太棒了!他们完美地传递了接力棒。让我们给他们击掌并给点小奖励,即使最后一棒跑者掉了棒子。”这鼓励机器人继续努力到达下一个检查点。

3. “双尺度”教练
BEACON 使用两种类型的教练来提供反馈:

  • 全局教练:关注最终结果。猫被喂了吗?是/否。这使机器人专注于最终目标。
  • 分段教练:只关注当前章节。“你高效地打开门了吗?”这位教练只将机器人与那些到达了“打开门”阶段的其它机器人进行比较。
  • 这为何有帮助:它防止机器人因在它完成工作之后发生的事情而受到惩罚。如果机器人完美地打开了门,但组里的下一位机器人没能喂猫,第一位机器人不会因第二位机器人的失败而受责备。

结果:更聪明、更快速的学习者

作者在三个不同的“世界”中测试了这种方法:

  1. ALFWorld:一个基于文本的家务清洁游戏。
  2. WebShop:一个在线购物模拟。
  3. ScienceWorld:一个虚拟科学实验室。

发生了什么?

  • 旧方法:随着任务变长,机器人的表现变得更差。它们变得困惑并停止学习。
  • BEACON:机器人的表现越来越好,即使在非常长的任务中也是如此。
    • 在最难的家务清洁任务中,BEACON 的成功率为93%,而旧方法的成功率仅为54%
    • BEACON 使训练效率大大提高。旧方法会丢弃 76% 的练习运行(因为它们在最后失败),而 BEACON 通过奖励部分成功,在**82%**的运行中找到了有用的教训。

总结

BEACON 就像一位聪明的老师,不仅仅看期末考试成绩。相反,这位老师在每一步都检查你的作业。如果你前三章做对了,但最后一章搞砸了,老师会说:“前三章做得太棒了!让我们修正最后一章。”这防止了学生放弃,并帮助他们更快地学习复杂、漫长的任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →