AdaMEM: Test-Time Adaptive Memory for Language Agents
该论文介绍了 AdaMEM,一种结合了长期轨迹存储与动态生成短期策略的测试时自适应记忆框架,旨在使语言智能体能够在不更新模型参数的情况下持续适应动态环境,并在 ALFWorld 和 WebShop 等基准测试中实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解决一个非常漫长且复杂的谜题,就像是在一个巨大的迷宫中穿行,或者是在一个规模宏大的网站上寻找特定的商品。你有一个聪明的助手(一个 AI 智能体)在协助你。
问题所在:“一劳永逸”的指南
目前的 AI 助手大多像是一个拿着一张静态地图开始旅行的游客。他们读完地图,记住地图,然后开始行走。
- 问题: 如果游客遇到了死胡同,或者地图说“左转”,但那里却有一堵墙,游客就会陷入困境。他们无法修改地图,因为地图在开始时就已经印好了。他们会不断尝试向左转进墙里,感到挫败,直到最终放弃。
- 论文术语: 这被称为“静态检索”(static retrieval)。AI 在开始时检索一次计划并始终坚持执行,即使情况发生了变化。
解决方案:ADAMEM(适应性旅行者)
作者提出了一种名为 ADAMEM 的新系统。与其给出一个静态地图,不如想象你的助手拥有两个特殊的工具:
- 巨型图书馆(长期记忆): 这是一个庞大的档案库,记录了其他人曾完成过的每一次成功的旅程。里面充满了原始的故事:“我去了这里,做了这件事,并且成功了。”
- 聪明教练(短期记忆): 这是神奇的部分。助手并不只是阅读整个图书馆,它会在旅程的每一步都停下来。它观察自己此时此刻所处的位置,检查图书馆中是否有类似的场景,然后询问“聪明教练”:“基于别人在这个精确位置所取得的成功,我下一步应该做什么?”
教练会写下一张微小的、新鲜的便条(即“策略”),专门针对这一时刻。它可能会说:“好吧,地图说向左走,但其他人在这个位置发现物品是在柜台上,而不是在橱柜里。让我们去检查一下柜台吧。”
它是如何运作的
- 第 1 步: 智能体处于一个十字路口。
- 第 2 步: 它询问图书馆:“有人来过这里吗?”
- 第 3 步: 图书馆找到了成功案例。
- 第 4 步: 智能体的“大脑”(LLM)阅读这些故事,并立即写出一条新的、定制化的指令用于下一步行动。
- 第 5 步: 智能体遵循这条新指令。
如果计划稍后失败了,智能体不会惊慌失措。它只需重复这个过程:检查图书馆,获取新的教练便条,然后尝试另一条路径。这就像是一个每当你错过路口时都会重新计算路线的 GPS,而不是一个只会告诉你“继续前进”直到你撞车为止的导航。
“训练”技巧(STEP-MFT)
论文还介绍了一种教导智能体成为更好“教练”的方法。
- 问题: 有时教练会写出模糊的建议,比如“小心点!”,这实际上并没有什么帮助。
- 解决方法: 作者创建了一种名为 STEP-MFT 的技术。他们教导智能体只从那些其建议“真正改变了结果”的时刻中学习。
- 类比: 想象一名学生正在为考试学习。如果他学习了一个章节后,无论读了什么内容,答案都是对或错,那么这个章节就没用。但如果他读到了一个具体的窍门,改变了自己的答案,并因此答对了,那么这就是有价值的教训。STEP-MFT 过滤掉了无聊的内容,只针对那些“改变局势”的建议对智能体进行训练。
实验结果
论文在三个不同的“游戏”上测试了它:
- ALFWorld: 一个虚拟房屋,智能体必须寻找并移动物体(例如把肥皂块放入垃圾桶)。
- WebShop: 一个虚构的在线商店,智能体需要寻找特定的产品。
- HotpotQA: 一个问答游戏,智能体需要通过搜索大量文档来回答一个难题。
他们的发现:
- 更高的成功率: ADAMEM 智能体解决任务的能力显著高于“静态地图”智能体(在某些情况下高出 13%)。
- 无需重新训练: 智能体在游戏过程中变得越来越聪明,而不需要从头开始重新学习。它只是更好地利用了它的记忆。
- 高效性: 通过将冗长的故事总结成简短、精悍的笔记,智能体不会被过量的信息所淹没(这会减慢其他智能体的速度)。
总结
ADAMEM 将一个僵化、固执的 AI 变成了一个灵活、学习型的旅行者。它不再盲目地遵循开始时制定的计划,而是不断检查自己的历史,从过去的成功中学习,并为紧接着的下一步编写一个更好的计划。这就像是游客与当地向导之间的区别:前者因为忽视路标而迷路,而后者则能根据当前的交通状况准确知道该往哪里走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。