Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge
本文介绍了 BREW,这是一个通过一种新颖的“扩展与收集”蒙特卡洛树搜索算法(Expand-and-Gather Monte Carlo Tree Search algorithm)和后验重标记(hindsight relabeling)技术,将过去的交互轨迹蒸馏为结构化的、可检索的自然语言配方知识库,从而增强基于大语言模型(LLM)智能体的框架,该框架在多个基准测试中显著提升了任务成功率和执行效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人助手,它会点击按钮、打开文件,还能和你聊天。它才华横溢,但有一个奇怪的记忆缺陷:每当你要求它做一件它以前做过的事情时,它表现得就像是第一次做一样。它会忘记“文件 > 导出为 PDF”是保存文档的“魔法咒语”,或者忘记在处理退货前需要检查用户 ID。它会从头开始重新发现解决方案,甚至经常犯昨天犯过的错误。
开发这篇论文的研究人员提出了 BREW,他们通过给机器人一本“食谱”而不是仅仅一个大脑来解决这个问题。
问题所在:患有失忆症的机器人
想象一下人类学习烹饪的过程。在做了几次炒蛋之后,你不会去记忆烹饪过程中的每一个秒刻。相反,你会内化一个食谱:“打蛋、加热平底锅、加入黄油、轻轻搅拌。”你知道什么时候使用这个食谱(早餐时间)、要做什么,以及需要注意什么(不要烧焦黄油)。
目前的机器人智能体就像是那些在每次做完饭后都会忘记食谱的厨师。它们每次都必须重新发明轮子。一些科学家尝试通过“训练”机器人的大脑(改变其内部权重)来修复这个问题,但这就像是通过重新排列面粉中的原子来烤蛋糕——这会让机器人的行为变成一个无法被检查或轻松修复的“黑盒”。另一些人则尝试给机器人一大堆原始笔记(记忆),但这些笔记要么太乱(只是点击记录的列表),要么太模糊(比如“要小心”)。
解决方案:BREW(基于经验学习的环境知识引导)
作者提出了 BREW,该系统将机器人的过往冒险转化为结构化的、易于阅读的食谱书。
它是这样运作的,分步骤如下:
- 经验(The Experience): 机器人尝试执行任务(如整理文件或预订航班)。有时它成功了,有时它失败了。
- 反思(The Reflection): 一个特殊的“反思者(Reflector)”智能体观察这些尝试。如果机器人失败了,反思者会问:“哪里出了问题?”如果成功了,它会问:“秘诀是什么?”
- “后视”技巧(The "Hindsight" Trick): 这是聪明之处。有时机器人失败是因为它试图执行错误的任务。该系统使用一种称为*后视重标记(Hindsight Relabeling)*的技术。它观察一次失败的尝试并说:“等等,如果目标实际上是这个*而不是那个*,那么机器人的动作就是完美的!”它将失败重新标记为针对略微不同目标的成功。这把“错误”转化为了“新的食谱”,使机器人能从中学习到的有用知识量翻倍。
- 食谱书(知识库): 系统将这些见解组织成一个整洁的自然语言食谱库。每个食谱都有一个标题(例如“压缩并解压文件”)、一个“何时使用”部分,以及一个带有要点的“如何执行”部分。它不是代码,而是任何人都能读懂的纯英文指令。
- 搜索(EG-MCTS): 编写一本完美的食谱书很难。如果你写的食谱太具体,它就无法帮助处理新任务;如果太模糊,机器人就会感到困惑。作者发明了一种智能搜索算法,称为扩展与收集蒙特卡洛树搜索(Expand-and-Gather Monte Carlo Tree Search, EG-MCTS)。想象一个侦探通过并行测试数千个变体来寻找最佳版本的食谱,保留效果最好的版本并丢弃其余的。这确保了最终的食谱书既准确又易于查找。
结果:食谱书有效吗?
研究人员在三个现实世界的挑战上测试了 BREW:
- OSWORLD: 一个测试,机器人必须控制计算机(点击菜单、移动文件)。
- -Bench: 一个测试,机器人扮演电信、零售和航空业的客户服务代理。
- SpreadsheetBench: 一个测试,机器人必须操作复杂的 Excel 表格。
结果非常理想。使用 BREW 时,机器人:
- 比没有食谱书的机器人多解决了 10–20% 的任务。
- 完成工作所用的步骤减少了 10–15%。
- 表现优于其他记忆系统,那些系统有时甚至会因为喂给机器人错误的信息而让机器人的表现变得更差。
例如,在计算机控制测试中,使用 BREW 的机器人成功率从 53.30% 提高到了 61.70%。在电子表格测试中,成功率从 44.30% 跳升至 48.50%。
这篇论文排除了哪些可能性
作者非常明确地说明了哪些方法是行不通的。他们反对仅仅将机器人过去动作的原始、混乱的日志倾倒进它的记忆中。他们发现,那些仅仅存储“瞬态轨迹片段”(即逐个点击的原始日志)的系统往往会干扰机器人,导致其表现甚至比完全没有记忆时还要差。他们还指出,仅仅通过“微调”机器人的大脑(改变其内部权重)会创建一个难以检查或更新的“黑盒”,而 BREW 的食谱书则是透明且可编辑的。
我们有多确定?
论文根据在这些特定基准测试上运行智能体的测量结果展示了这些发现。这些改进(如 10–20% 的增益)是实验中的测量值,而非猜测。作者认为这种方法是微调的一种强有力的替代方案,但他们也指出,系统的成功取决于训练数据的质量。他们并未声称这解决了所有机器人随处可见的所有问题,但他们展示了对于这些特定的、复杂的任务,拥有一个结构化的、人类可读的食谱书会带来显著且可衡量的差异。
简而言之,BREW 教会了机器人停止重复造轮子,转而开始使用一本它们能够真正阅读并理解的、结构良好的、人类友好的说明手册。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。