Training Language Agents to Learn from Experience
本文介绍了上下文训练(ICT)框架及一个基于强化学习的流程,该流程使语言智能体能够从过往交互中提炼经验并转化为可复用的系统提示,从而在无需人工监督的情况下实现跨任务自我提升并泛化至未见环境。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但略显天真的机器人如何玩电子游戏。
问题:“一次性”失忆症
目前,这些被称为“语言智能体”的 AI 机器人擅长从错误中学习,但方式非常局限。如果它们在某一关游戏中失败,它们可以回顾并说:“哦,我撞错了墙”,然后立即重试。它们在那个特定关卡上会变得更擅长。
然而,一旦它们通过了那一关,就会忘记一切。如果你给它们一个略有不同的新关卡,它们表现得就像从未玩过这个游戏一样。它们必须从头开始重新学习教训。这就像一个学生为数学考试刻苦学习,得了 A,然后第二天走进物理课堂时,却表现得好像从未见过数字一样。它们无法将通用的教训(例如“始终检查周围环境”)“提炼”成可复用的规则手册。
解决方案:“教练”与“玩家”
本文作者引入了一个名为**上下文训练(In-context Training, ICT)**的新框架。这可以想象为一个两人团队:
- 玩家(执行者): 这是试图完成任务的机器人。它玩游戏、犯错,并收集事件发生的“回放”。
- 教练(反思者): 这是第二个 AI,它观看玩家的回放。教练的任务不是玩游戏,而是为玩家撰写新的操作手册(系统提示)。
这里的奥秘在于:教练不只是说“别撞那堵墙”。它会查看玩家刚刚尝试的一系列不同关卡,找出共同模式,并为玩家撰写一条通用规则,供玩家在未来未见过的关卡中使用。
训练:学习如何执教
最大的问题是:我们能否教会教练如何编写这些更好的手册?
研究人员没有使用人类教师或预先编写的示例。相反,他们使用了一个“试错”循环(强化学习):
- 教练编写一本手册。
- 玩家使用该手册尝试解决一批新的、未见过的谜题。
- 如果玩家表现良好,教练会收到“干得好”的信号;如果玩家失败,教练会收到“再试一次”的信号。
- 教练从这些反馈中学习,以便下次编写出更好的手册。
结果:从国际象棋到烹饪
该团队在两个截然不同的“电子游戏”(模拟环境)上测试了这种方法:
- ALFWorld: 一个基于文本的房屋环境,机器人需要找到物体、清洁它们,并将它们放置在特定位置(例如“冷却土豆并将其放入冰箱”)。
- MiniHack: 一个网格世界游戏,机器人需要导航迷宫、进食或使用魔法棒。
他们的发现:
- 教练变得更聪明了: 经过训练的教练在编写操作手册方面比未训练的教练出色得多。它们成功地教会了玩家如何解决从未见过的新类型谜题,仅仅通过观察不同类型谜题的示例。
- 跨游戏魔法: 令人惊讶的是,研究人员将一位仅在网格世界游戏(MiniHack)上训练过的教练,用来指导玩家在房屋游戏(ALFWorld)中的表现。尽管这两个游戏完全不同,但教练仍然成功编写出了一本手册,帮助玩家的表现优于完全没有接受过指导的机器人。它学会了学习的技能,而不仅仅是特定游戏的规则。
- 回合越多,结果越好: 教练练习编写手册的次数越多(经历的“元回合”越多),玩家的表现就越好,甚至超过了教练在训练期间所经历的练习回合数。
工具包:MetaGym
最后,作者发布了一个名为MetaGym的免费软件工具。这可以想象为研究人员使用的“乐高套装”。它允许任何人轻松构建自己的“教练对玩家”训练环境,以测试其 AI 是否能从经验中学习。
** nutshell**
这篇论文证明,AI 智能体可以被训练成不再做“失忆者”。通过使用一位观察玩家经历并为未来编写更好规则的教练,AI 可以学习适用于新挑战的通用教训,这些挑战是它们之前从未见过的。这之间的区别在于:是一个只死记硬背一张地图的机器人,还是一个学会了如何阅读任何地图的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。