CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents
CoEvo-Mem 是一个通过交替更新和基于轨迹的反馈,同时优化检索策略与记忆库演进的闭环框架,通过解决长程 LLM 智能体中记忆访问与精炼之间的根本相互依赖关系,在多种基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个聪明但健忘的机器人玩一款复杂的视频游戏。这个机器人的大脑(大语言模型)非常庞大,知道如何交谈和思考,但它一次只能持有极少量的信息,就像是在只能看到最后三块拼图碎片的情况下试图解决一个谜题。为了在长期内玩得出色,机器人需要一个过去经验的库来进行查阅。这就是**检索增强生成(RAG)**发挥作用的地方:这就像机器人在询问图书管理员:“嘿,我们以前见过类似的谜题吗?”
但棘手的是,机器人需要两样东西才能完美运作。首先,它需要一位图书管理员(检索策略),这位管理员要非常擅长为当前的问题找到正确的旧笔记。其次,它需要一位记录员(记忆库),这位记录员要擅长组织那些笔记,决定哪些笔记真正有用,并随着游戏难度增加而更新它们。长期以来,科学家们一直试图在保持“记录员”不变的情况下让“图书管理员”变得更聪明,或者在保持“图书管理员”不变的情况下让“记录员”变得更好。但如果“图书管理员”需要了解笔记是如何组织的才能找到它们,而“记录员”也需要知道“图书管理员”在寻找什么才能更好地组织它们呢?它们需要一起学习,在一个循环中进行。
这正是 CoEvo-Mem 所探讨的内容。作者提出了一个系统,其中“图书管理员”和“记录员”共同进化,不断地互相教导如何更好地完成工作。他们在七种不同类型的挑战性任务上测试了这个想法,范围涵盖了编写计算机代码、解决科学问题到控制计算机操作系统。结果表明,当这两个部分同步学习时,机器人解决长期复杂问题的能力显著优于它们分别学习的情况。
问题所在:破碎的反馈循环
想象一下,你正在为一场重要的历史考试复习。你有一叠闪卡(你的记忆)和一个学习指南(你的检索策略)。如果你的学习指南很糟糕,你可能会挑选错误的闪卡进行复习。但如果你的闪卡杂乱无章,即使是一个好的学习指南也会难以找到正确的那一张。
在 AI 智能体领域,现有的方法通常只修复问题的一侧而忽略另一侧。有些方法试图让 AI 更好地请求记忆(检索),而另一些方法则试图让 AI 更好地存储和组织记忆(演化)。本文的作者认为这种分离是错误的。他们指出了一个被忽视的“基本反馈循环”:
- 检索决定了什么被使用: 如果 AI 选择了错误的记忆,那么这些记忆就无法获得帮助(或造成干扰)任务的“功劳”。
- 记忆更新改变了未来: 如果 AI 根据发生的情况更新其记忆,那么这些记忆的组织方式就会发生变化,这使得下次查找它们变得更容易或更难。
如果你只在不让记忆改变的情况下优化检索方法,或者反之亦然,你就会错过让他们共同进步的机会。这就像是在琴弦不断改变粗细的同时试图为吉他调音;除非你同时调整两者,否则无法获得完美的音色。
解决方案:CoEvo-Mem
作者构建了一个名为 CoEvo-Mem(协同进化记忆)的框架。你可以把它看作是两个舞伴之间的舞蹈:路由(Router)(图书管理员)和记忆库(Memory Bank)(记录员)。
以下是这场舞蹈的运作方式:
1. 被冻结的大脑与智能路由
AI 的主“大脑”(大语言模型)保持冻结状态——它不会学习任何新知识。相反,系统使用一个微小的、轻量级的“路由”来决定如何寻求帮助。
- 当一个问题进来时,冻结的大脑会建议几种重写问题的方式(有些侧重于语义,有些侧重于特定的关键词)。
- 路由随后会学习根据 AI 答对或答错的结果来微调这些建议。这就像是一位教练在根据比赛结果低声耳语:“下次试着这样问。”
2. 作为生命地图的记忆库
记忆不仅仅是一份笔记列表;它们是一个关系图(Relational Graph)。想象一张地图,每个记忆都是一座城市,而连接它们的道路显示了它们之间的关系。
- 稠密道路连接含义相同的记忆(语义)。
- 稀疏道路连接共享特定单词或名称的记忆(词汇)。
- 时间道路连接按顺序发生的记忆(时间)。
当 AI 完成一项任务时,它不仅仅是保存答案。它还会更新它所访问的“城市”的“价值”。如果一个记忆帮助了 AI 获胜,那座城市就会获得更高的分数。如果它提供了一点帮助,分数就会小幅上升。至关重要的是,这种“功劳”不仅停留在那个单一的记忆上;它会沿着道路传播到相邻的城市,帮助整个“社区”变得更聪明。
3. 交替进行的舞蹈(秘诀所在)
你可能会想:“为什么不把路由和记忆同时更新呢?”作者发现,这样做会导致混乱。如果两者同时改变,就像是在尝试学习骑自行车的同时,自行车也在改变形状。系统会变得混乱且不稳定。
相反,CoEvo-Mem 使用了一个交替调度方案:
- 阶段 1: 记忆库被冻结(锁定不动)。路由练习使用这张固定的地图来寻找最佳记忆。
- 阶段 2: 路由被冻结(锁定不动)。记忆库根据路由刚刚找到的内容来更新其组织结构和数值。
- 它们轮流切换。这使得每个伙伴都能在对方处于静止状态时,从对方的当前状态中学习。
他们的发现
团队在七个非常不同的挑战上测试了 CoEvo-Mem:
- 操作系统交互: 控制计算机执行任务。
- 代码生成: 编写可运行的计算机程序。
- 多模态推理: 解决涉及文本和图像的谜题。
- 科学问题: 回答关于物理、化学和生物的难题。
- 函数调用: 教导 AI 正确使用工具和 API。
- 长期对话: 记住长篇聊天中的细节。
在所有这些测试中,CoEvo-Mem 的表现都优于现有的最佳方法。
- 在 GPQA Diamond(困难科学问题)上,它比最强的基准线提高了 7.50 个百分点。
- 在 LiveCodeBench(编程)上,它提高了 3.81 个百分点。
- 在 长期对话记忆 (LoCoMo) 上,它达到了 81.71 的得分,领先第二名近 5 个点。
作者还进行了“消融实验”(即移除系统部分组件的实验),以证明其有效性的原因。
- 当他们移除查询重写(改变提问方式的部分)时,性能显著下降。
- 当他们移除记忆演化(更新图谱和数值的部分)时,性能也下降了,尤其是在编程和科学等复杂任务中。
- 当他们尝试同时更新路由和记忆(而不是交替进行)时,系统的表现比交替方法更差。
总结
该论文表明,对于 AI 智能体要真正掌握长期任务,我们不能仅仅构建一个更好的搜索引擎或数据库。我们必须构建一个让搜索引擎和数据库能够相互适应的系统。通过让“图书管理员”和“记录员”在对方保持静止时轮流学习,CoEvo-Mem 创建了一个稳定的、不断改进的循环,帮助 AI 智能体更好地记忆、更清晰地思考并解决更难的问题。
作者谨慎地指出,虽然这些在七个基准测试中的结果非常强劲,但这是一种针对协同进化的特定框架。他们并不声称解决了 AI 的所有问题,但他们展示了这种将检索与记忆相链接的特定方式,是构建能够随时间学习和适应的智能体的一个强有力的进步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。