SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents
SWE-MeM 是一个训练框架,它通过灵活的工具和记忆感知 GRPO(Memory-aware GRPO),为软件工程智能体提供自适应、按需的内存管理能力,使其能够动态优化上下文使用,并在长周期编码任务中实现比现有静态方法更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是使用简单语言和创意类比对 SWE-MeM 论文进行的解释。
问题所在:“信息过载”引发的交通拥堵
想象你是一名受雇于修复一个庞大且复杂建筑(代码仓库)中某个漏洞(Bug)的优秀软件侦探(AI 智能体)。你开始进行调查,但随着工作的进行,你为自己走的每一步都留下了笔记、照片和录音。
- 问题在于: 在现实世界中,这些“笔记”(对话历史)会不断堆积。最终,这堆东西会变得如此巨大,以至于堵住了门口。你的侦探大脑(AI 模型)同时能观察事物的空间是有限的(即“上下文窗口”)。如果这堆东西变得太大,你要么看不见新的线索,要么会被过多的无关细节淹没,从而忘记了你原本要解决的问题。
- 旧的方法: 以前的方法试图通过僵化的方式来解决这个问题。它们就像一个刻板的图书管理员,会对你说:“每当你写满 100 页时,我会自动扔掉前 50 页,并用一段通用的摘要来替换它们。” 这很糟糕,因为有时候前 50 页包含了你唯一需要的关键线索,而有时候最后 50 页仅仅是你对天气的抱怨(这些是可以安全丢弃的)。
解决方案:SWE-MeM(聪明的私人助理)
作者创建了 SWE-MeM,一种全新的训练框架,旨在教会 AI 智能体成为它自己的聪明私人助理。它不再是一个刻板的图书管理员,而是学会了主动管理自己的记忆。
以下是它的工作原理,分为三个简单的部分:
1. 灵活的工具(决定“何时”以及“什么”)
SWE-MeM 给智能体提供了一个名为 compress(压缩)的特殊工具。智能体会学习在调用它之前问自己三个问题:
- 何时? 我现在需要清理一下吗?(我的桌面是不是变得太乱了?)
- 什么? 我的哪些笔记是垃圾?(这是一段冗长的失败测试尝试,还是一个关键的代码片段?)
- 如何? 我该如何总结这段内容?(我是只保留结论,还是保留具体的错误信息?)
类比: 想象你在写日记。一个僵化的系统会在你写新的一页时删除第一页。而 SWE-MeM 就像一个聪明的编辑,他会看你的日记并说:“嘿,你连续三天只是盯着白墙发呆(价值较低)。让我们把那三天总结为‘第 3 天:停滞不前’。但你在第 5 天发现了破裂的水管(价值较高),让我们把这个细节原封不动地保留下来。”
2. 训练方法(在实践中学习)
你如何教会一个 AI 变得如此聪明?你不能只是告诉它,它必须通过练习。作者使用了三步走的训练过程:
- 合成轨迹(模拟演练): 他们创建了数千个虚构的“侦探案件”。他们使用一个超级聪明的 AI 来充当裁判,决定侦探在何时应该清理其笔记。他们构建了一个数据集,让智能体练习在正确的时间压缩正确的内容。
- 课程学习(学校教育): 他们分阶段教授智能体。首先,他们教授基础知识:“这是如何写摘要的。”一旦掌握了这一点,他们就会进入高级班:“现在,学习在空间耗尽之前进行总结,而不仅仅是在被迫执行时才总结。”这就像是在旅行前教学生如何收拾行李,而不是等到行李快要爆开时才动手。
- 记忆感知 GRPO(奖励机制): 这是最技术性的部分,但你可以把它想象成一个视频游戏评分系统。
- 在常规训练中,只有当 AI 在最后成功修复了 Bug 时,它才会获得一个“胜利”点数。
- 在 SWE-MeM 中,系统会观察整个过程。如果 AI 在中间做出了一个优秀的压缩决策,并在随后帮助解决了问题,它会获得额外加分。如果它压缩了重要的内容导致陷入困境,它则会受到惩罚。这教会了 AI:良好的记忆管理是赢得游戏的一部分。
3. 结果(赢得比赛)
作者在 SWE-Bench Verified 上测试了 SWE-MeM,这是一个要求 AI 智能体必须修复真实世界软件漏洞的严苛基准测试。
- 得分: 一个规模较小的模型(40 亿参数)解决了 43.4% 的问题。一个规模较大的模型(300 亿参数)则解决了 60.2% 的问题。
- 效率: 它不仅解决了更多问题,而且使用的 Token(单词/字符)更少,采取的步骤也比其他方法更少。
- 对比: 它击败了所有之前的“刻板图书管理员”式的方法。它证明了,让智能体自己决定何时清理记忆,比强制按计划清理要有效得多。
总结
SWE-MeM 就像是将一名侦探从“在桌面堆满时才手忙脚乱撕碎纸张的人”,升级为“知道哪些线索该保留、哪些该总结、以及何时整理桌面,从而在不耗尽空间的情况下高效解决案件的人”。它教会了 AI 变得积极主动、灵活且高效,从而能以更少的精力实现更好的代码修复。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。