← 最新论文
🤖 AI

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

本文介绍了 AFTER,一个用于评估大语言模型(LLM)智能体在多种企业任务中程序性记忆的全面基准测试,证明了精炼的技能能显著提升性能并实现有效的跨模型和跨角色迁移,同时强调了不同技能之间存在着不同程度的泛化性。

原作者: Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为一个繁忙的办公室招聘一名新员工。你有两种培训方式:

  1. “空白模板”法(The "Blank Slate" Approach): 你只把任务交给他们,然后寄希望于他们能利用自身的通用智能去自行摸索解决。
  2. “程序记忆”法(The "Procedural Memory" Approach): 你给他们一份特定的、可复用的“小抄”或“标准作业程序”(SOP),这些内容是基于过去如何解决类似任务的经验总结而成的。

这篇题为**《管理 LLM 智能体的程序记忆》(Managing Procedural Memory in LLM Agents)**的论文,旨在测试这些“小抄”对于 AI 员工到底有多有效,并研究如何让它们变得更好。

以下是研究结果的拆解,使用了简单的类比:

1. 问题所在:“过度专业化的实习生”

作者注意到,尽管 AI 智能体正变得越来越聪明,但在处理重复性办公任务(如处理文档、管理数据库或编写代码)时,它们往往表现挣扎。

他们发现了一个棘手的问题:如果你针对一组非常具体的任务对 AI 进行训练(例如“如何处理这家特定公司的账单”),AI 会成为该项工作的专家,但一旦你要求它做稍微不同的工作,或者在另一个部门工作时,它就会彻底失败。

  • 类比: 想象一位厨师,他只学会了在特定的厨房和特定的烤箱里制作完美的披萨。如果你把这位厨师移到一个拥有不同烤箱的新厨房,他可能会把披萨烤焦,因为他记住了特定烤箱的特性,而不是学会了“制作披萨”这项通用技能。这被称为过拟合(Overfitting)

2. 解决方案:AFTER 基准测试

为了解决这个问题,研究人员构建了一个巨大的测试场,名为 AFTER

  • 它是什么: 一个包含 382 项现实办公任务的集合(例如数据工程师修复流水线,或项目经理总结报告)。
  • 转折点: 他们不仅测试了 AI 能否完成任务,还测试了 AI 能否将从一种情境中习得的“技能”应用到另一种不同的情境中(不同的角色、不同类型的任务,甚至是不同的 AI 模型)。

3. 核心发现:哪些有效,哪些无效

A. “小抄”确实有帮助(但并非总是如此)

当研究人员给 AI 智能体这些程序性的“小抄”(技能)时,AI 完成工作的能力提升了。

  • 结果: 平均而言,加入这些技能后,AI 的成功率提高了约 2.8 个百分点
  • “精炼”技巧: 如果他们拿出一份基础的小抄,并让 AI 通过观察一次自己的错误来进行改进,成功率就会再跳升 5.2 个百分点。这就像是在实习生的第一天结束后,给他进行了一次快速的“工作回顾”,以修正他的笔记。

B. “多样化经验”的秘密

这是最重要的发现。研究人员问道:这份小抄应该来自哪里?

  • 场景 A: 小抄是基于 AI 自身的过往尝试编写的(狭隘经验)。
  • 场景 B: 小抄是通过结合来自许多不同 AI 模型的尝试编写而成的(多样化经验)。

胜出者: 场景 B。

  • 类比: 如果你想学习开车,阅读一本由 100 位不同驾驶员编写的手册(有人开得快,有人开得慢,有人在雨天开,有人在雪地开)会比仅仅背诵一位朋友去杂货店的具体路线要好得多。
  • 数据: 基于“多样化”经验(多种不同 AI 模型)构建的技能在测试新模型时达到了 73.1% 的准确率。而仅由单一模型构建的技能准确率仅为 36–59%。令人惊讶的是,即使是“较弱”的 AI 模型,在混合在一起时也能提供有用的教训!

C. “角色陷阱”

研究发现,技能可能会变得过于针对特定的职位。

  • 类比:项目经理习得的“文档处理”技能(用于使用 PDF 总结会议)对于数据科学家来说是没用的(数据科学家使用 PDF 来提取原始数据)。如果你把项目经理的小抄交给数据科学家,数据科学家的表现实际上会比没有小抄时还要差。
  • 教训: 你不能直接将一项技能从一个部门“复制粘贴”到另一个部门。语境(Context)至关重要。

D. 节省成本(Token)

最后,使用这些进化的“小抄”可以节省成本。

  • 结果: 因为 AI 已经通过小抄知道了“如何”执行任务,它不需要像以前那样费力“思考”或提出许多问题。这减少了高达 62% 的计算资源(Token)消耗。这就像是走了一条捷径,节省了油费。

总结

论文得出结论:AI 智能体的未来不仅仅在于让它们变得更“聪明”。其核心在于教会它们构建可复用、可适应的技能

  • 不要仅仅死记硬背一条特定的路径(这会导致在新环境下失败)。
  • 向广泛多样的经验学习(不同的模型、不同的角色)。
  • 小心不要混淆不同职业角色的技能,因为它们可能会产生冲突。

目标是从仅仅靠“猜测”的 AI,转向拥有一个可靠、不断进化的、能在现实世界中运行的“操作指南库”的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →