← 最新论文
💻 computer science

AutoMem: A Text-Gradient Recursive Self-Improvement Framework for Automated Memory Architectures Search

该论文提出了 AutoMem,一种文本梯度递归自我改进框架,通过将经验引导的搜索与失败引导的模块诊断相结合,自动发现任务自适应记忆架构,在提升准确率-效率权衡的同时,一致性地优于人工设计的基准模型。

原作者: Lin Du, Jie Zhou, Yuxuan Cai, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Wei Li, Liang He

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Lin Du, Jie Zhou, Yuxuan Cai, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Wei Li, Liang He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人工智能已经达到了一个阶段,大型语言模型可以作为智能体(agents)发挥作用,能够进行规划、使用工具并浏览网页以解决复杂问题。为了有效地实现这一点,这些智能体需要一种记忆事物的方式,就像人类依赖长期记忆来回想起过去的教训、事实和策略一样。然而,为机器构建这种记忆并不像添加一个笔记本那么简单。它涉及一系列决策:哪些信息应该被记录下来,如何存储,智能体在需要时如何找到它,以及如何移除陈旧或无用的条目。多年来,研究人员一直通过手工构建这些记忆系统,为每项任务选择一种特定的设计并始终如一地使用。但正如木匠不会用同一种工具应对所有工作一样,“一刀切”的记忆系统在任务发生变化时往往会失效。

来自华东师范大学和上海人工智能实验室的研究团队通过将记忆视为一个针对特定工作需要去解决的谜题,而非一个固定的发明,解决了这一问题。他们构建了一个名为 AUTOMEM 的系统,该系统可以自动为给定的任务搜索最佳的记忆设计。该系统不再由人类工程师去猜测哪种存储和检索方法的组合效果最好,而是测试数千种不同的配置,从错误中学习,并不断优化其选择,直到找到一个性能超越即使是最优秀的专家设计的系统。其结果是一种能够适应问题特定需求的记忆架构,无论是在浏览网站、解决多步推理挑战,还是在深入挖掘搜索结果方面。

研究人员首先将智能体记忆的概念分解为四个不同的部分,类似于图书馆的组织方式。首先是编码器(encoder),它决定哪些信息值得保存。第二是存储器(store),它决定如何保存这些信息,例如存放在简单的列表、复杂的连接网络或结构化数据库中。第三是检索器(retvier),它是当智能体需要时寻找正确信息的机制。最后是管理器(manager),它处理记忆的生命周期,删除旧的或冲突的数据,以保持系统的效率。通过将这四个部分的各种选项进行混合与匹配,研究人员创造了一个极其广阔的可能记忆设计空间。他们的初步实验揭示了一个关键的事实:没有一种设计能适用于所有情况。擅长解决数学问题的记忆系统在浏览网站时可能会表现得很糟糕,而且对于一个计算机模型而言最佳的组合,对另一个模型而言可能效果很差。

为了在如此广阔的可能性空间中导航而不浪费时间和计算能力,团队开发了一种从失败中学习的方法。当系统尝试一种记忆设计而智能体未能解决任务时,系统并不仅仅是丢弃这次尝试。相反,它表现得像一名细心的调查员,分析故障究竟发生在何处。是因为智能体从未记录下正确的线索吗?是因为信息以一种无法被找到的格式存储了吗?是因为它提取了错误的记忆吗?还是因为它保留了太多过时的信息?系统会精准定位导致错误的记忆过程中的特定环节,并将这种技术性故障转化为通俗易懂的指令。它会告诉搜索过程:“问题出在数据存储方式上;下次请尝试不同的格式。”

这种诊断与调整的过程在一个循环中进行。系统根据从以往失败中学习到的经验提出新的记忆设计,进行测试,然后再次分析结果。仅通过几次自我改进的轮次,系统就能收敛到一个高效的架构。在测试中,研究人员使用了三个不同的具有挑战性的基准测试:一组复杂的推理问题、一系列深度的网页导航任务,以及一系列困难的搜索查询。他们使用两个不同的强大计算机模型作为智能体运行了这些测试。在每种情况下,系统发现的记忆架构都优于人类设计的最佳替代方案。在推理基准测试中,与最强的固定记忆系统相比,该系统将准确率提高了近四个百分点。在网页导航任务中,准确率也提高了近四个点,而在深度搜索挑战中,它提升了一个完整的百分点。

除了更准确之外,该系统还证明了自己更加高效。它发现的记忆设计通常需要更少的计算资源来运行。例如,在推理基准测试中,该系统在实现更高准确率的同时,使用了显著更少的 token(衡量文本处理计算成本的指标)。这表明该系统不仅找到了更努力工作的办法,还找到了更聪明工作的办法。它发现,对于某些任务,最好的方法是将信息存储在将相关事实链接在一起的类图结构中;而对于其他任务,简单的结构化列表则更为有效。对于网页导航,它发现文本与结构化数据的结合效果最好;而对于深度搜索,它则倾向于一个能够轻松重新排列过去解决方案以找到最相关方案的系统。

研究人员还测试了他们的方法是真的在学习,还是仅仅运气好。他们将这种引导式搜索与仅仅随机挑选记忆设计的方法进行了对比。随机方法偶尔能找到一个好的设计,但它并不稳定,并且经常浪费资源去测试那些显然很差的设计。相比之下,引导式系统通过每一轮测试稳步提升,找到解决方案的时间和计算成本都仅为随机方法的一半。这证实了系统通过诊断失败并将失败转化为具体指令的能力是其成功的关键。如果没有这个反馈循环,系统会难以提升,经常陷入成本高昂却无效的设计中。

研究结论指出,人工智能智能体的未来不在于构建一个单一、完美的记忆系统,而在于创建能够根据手头任务调整其记忆的系统。研究人员发现,最佳的记忆设计高度依赖于智能体正在进行的具体工作性质及其运行的计算机模型。一个在某种类型问题上对某个智能体有效的设计,对另一个智能体来说可能是一种阻碍。通过自动化这些设计的搜索过程,该团队展示了构建不仅更聪明、而且更高效的智能体是可能的。这项工作表明,随着人工智能越来越多地融入复杂的现实世界任务,动态调整智能体如何记忆和使用信息的能力,将与智能体本身的智能水平同样重要。该系统并非取代人类的智慧,而是扩展了人类的智慧,让计算机能够以一种人类无法通过手动设计来完成的复杂方式,找到适合工作的正确工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →