← 最新论文
💬 NLP

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory

本文介绍了 Evo-Memory,这是一个全面的流式基准测试与框架,旨在评估并增强大语言模型智能体在持续动态任务环境中的自我演进记忆能力,其特色在于提出了将推理、行动与记忆更新相融合的 ReMem 流程,以实现持续改进。

原作者: Tianxin Wei, Noveen Sachdeva, Benjamin Coleman, Zhankui He, Yuanchen Bei, Xuying Ning, Mengting Ai, Yunzhe Li, Jingrui He, Ed H. Chi, Chi Wang, Shuo Chen, Fernando Pereira, Wang-Cheng Kang, Derek Zhiy
发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianxin Wei, Noveen Sachdeva, Benjamin Coleman, Zhankui He, Yuanchen Bei, Xuying Ning, Mengting Ai, Yunzhe Li, Jingrui He, Ed H. Chi, Chi Wang, Shuo Chen, Fernando Pereira, Wang-Cheng Kang, Derek Zhiyuan Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢的助手,它能解决复杂的谜题、编写代码,或在虚拟房屋中导航。目前,大多数这类 AI 助手都像是患有失忆症的天才。它们在当下极其聪明,但一旦对话结束或任务完成,就会忘记刚刚学到的一切。如果你第二天让它们解决类似的问题,它们必须从头开始,重犯同样的错误,重新发现同样的解决方案。

论文《Evo-Memory》提出了一种解决之道,即赋予这些助手一种随时间演化的、鲜活的生命记忆

以下是用简单类比对论文核心思想的拆解:

1. 问题所在:“金鱼”与“学徒”

目前,大多数 AI 记忆的工作方式如同图书馆档案。如果你问一个问题,AI 会查找它之前存储的特定事实(例如“法国的首都是什么?”),然后将其复述出来。这被称为对话回忆

但作者认为这还不够。真正的智能需要经验复用

  • 金鱼:记得发生了什么(例如“我试着开门,但门是锁着的”)。
  • 学徒:记得下次该如何处理(例如“下次看到锁着的门,我应该先检查是否有钥匙,或者先试试门把手”)。

论文指出,当前的 AI 系统仍被困在“金鱼”状态。它们记得事实,却无法从过去的失败和成功中习得策略

2. 解决方案:一本“自我演化”的笔记本

作者引入了Evo-Memory,这是一种测试和构建像学徒一样行动的 AI 代理的新方法。

想象一个 AI 代理有一本笔记本。

  • 旧方法:每次任务结束后,AI 只是把整个对话粘贴进笔记本。笔记本变得巨大、杂乱且难以阅读。
  • Evo-Memory 方法:每次任务结束后,AI 会做三件事:
    1. 思考:“我刚才做了什么?成功了吗?”
    2. 行动:完成当前任务。
    3. 提炼:“好的,那个解决方案奏效了。我将在笔记本中写下一条简短清晰的规则,说明我如何解决了这个问题,并丢弃那些无关紧要的杂乱部分。”

随着时间的推移,这本笔记本不仅变得更大,而且变得更聪明、更有条理。它将原始经验转化为可复用的策略。

3. 测试:“流式”考试

为了证明这行之有效,研究人员创建了一个名为Evo-Memory的新基准测试。

将其想象成一场马拉松,而非短跑。

  • 旧测试:你给 AI 一道数学题,然后是一道新题,再是一道。它们互不相关。AI 只是逐一解决它们。
  • Evo-Memory 测试:你给 AI 一个连续的任务流,就像一个难度不断增加的视频游戏关卡。
    • 任务 1:解一个简单的方程。
    • 任务 2:使用相同的逻辑解一个稍难的方程。
    • 任务 3:导航机器人找到番茄,然后将其放入微波炉。
    • 任务 4:导航机器人找到杯子,然后将其放在柜台上。

该测试检查:AI 是否因为从任务 3 中学习了知识,而在任务 4 中变得更快、更好? 如果 AI 真正在“演化”,它应该利用其记忆来跳过步骤,随着任务流的持续更高效地解决问题。

4. 结果:"ReMem"代理

论文测试了许多不同类型的记忆系统。他们发现:

  • 静态记忆:仅存储过往对话的代理(如标准聊天机器人)随时间推移几乎没有改进。它们不断重犯同样的错误。
  • "ReMem"代理:这是论文提出的新方法。它主动思考其记忆。它会问:“这条旧记忆有用吗?我应该删除糟糕的部分吗?我如何利用它来解决新问题?”

类比

  • 旧代理:就像一个学生参加了一次考试,得了低分,然后立即忘记了这次考试,带着同样的困惑参加下一次考试。
  • ReMem:就像一个学生参加了一次考试,复习了错误,写了一份包含正确公式的“作弊小抄”,并利用这份小抄在下次考试中取得优异成绩。

5. 主要发现

  • 从失败中学习:表现最好的代理不仅记住了成功,还从失败中学习。如果一个代理尝试开门但门是锁着的,"ReMem"代理会更新其记忆,记住“先检查钥匙”,而不仅仅是记住“我试着开了门”。
  • 效率:拥有这种演化记忆的代理解决问题所需的步骤更少。它们没有浪费时间重复发明轮子。
  • 普适性:无论 AI 是在做数学题、编写代码,还是在虚拟房屋中导航,这种改进都发生了。

总结

论文认为,为了让 AI 在现实世界(任务连续且复杂)中真正发挥作用,它们需要的不仅仅是一个存储事实的硬盘。它们需要一个动态记忆系统,不断审查、组织并升级其自身知识,将“发生了什么”转化为“下次如何做得更好”。

他们构建了一个新测试(Evo-Memory)来衡量这一点,并表明他们的新方法(ReMem)是首个成功让 AI 代理在工作过程中学习和改进的方法,而不是仅仅等待人类稍后对其进行重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →