← 最新论文
💻 computer science

MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory

MESA 是一个任务自适应框架,它通过动态选择并融合与特定查询相关的互补记忆结构子集,为长程智能体提供支持,在显著提升 AMA-Bench 性能的同时,通过避免固定上下文方法的噪声,实现了多样化证据的组合与高效利用。

原作者: Beidi Zhao, Yaoqi Chen, Yuru Feng, Menghao Li, Qianxi Zhang, Baotong Lu, Jianan Lu, Zhirui Wang, Xinjiang Wang, Shusen Xu, Zengzhong Li, Xiaoxiao Li, Qi Chen

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Beidi Zhao, Yaoqi Chen, Yuru Feng, Menghao Li, Qianxi Zhang, Baotong Lu, Jianan Lu, Zhirui Wang, Xinjiang Wang, Shusen Xu, Zengzhong Li, Xiaoxiao Li, Qi Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解一个持续数日谜团的侦探。你有一个巨大的笔记本,记录了你所做的每一件事、看到的每一件事、思考的每一件事以及说过的每一句话。有些页面只是对一天的简要总结,有些页面是每一步行踪的原始列表,还有些是关于你与谁交谈过的地图,以及你搜索过的关键词列表。如果你试图阅读整个笔记本来回答一个简单的问题,比如“我是什么时候丢钥匙的?”,你的大脑会被过量的信息淹没。但如果你只读其中一页,你可能会错过隐藏在另一个章节中的关键线索。这就是现代“AI智能体”(AI agents)面临的挑战——这些程序是作为数字助手运行的计算机程序。它们需要记住长链条式的事件来解决复杂问题,但它们经常会在自己的记忆中迷失方向。科学家们一直在研究组织这些记忆的最佳方式:是让AI阅读全部内容?还是让它只选择一种类型的笔记?或者是有更聪明的方法?

这篇论文介绍了一个名为 MESA(用于长程智能体的多结构证据选择系统,Multi-structure Evidence Selection for long-horizon Agent)的巧妙新系统,它就像是这些AI侦探的超级聪明图书管理员。MESA 不会强迫 AI 阅读其整个笔记本,也不会盲目猜测哪一页是最好的,而是学习为每个特定问题挑选出完美的组合。想象一下一位厨师,他不会只是随手抓起第一个香料罐,也不会把整个香料架都倒进锅里。相反,他会品尝菜肴,意识到它需要一点盐和一撮胡椒粉,然后精准地抓取那两个罐子。研究人员在名为 AMA-Bench 的基准测试上测试了它,这个测试就像是一个衡量 AI 在长时间跨度内记忆和推理能力的巨大测试场。他们发现 MESA 比以往的方法能更好地回答问题。事实上,它的正确率提高了 8.5%,而且在阅读过程中使用的单词(或“token”)减少了 41%。这表明,通过选择性的组合不同的记忆视图,比单纯阅读全部内容或只选其一,才是解决长期谜题的关键。

问题所在:噪音过多,信号不足

想象你在玩一款视频游戏,你需要通过记住 50 步之前做过的事情来解开一个谜题。你的角色一直在四处奔跑、战斗、与 NPC 交谈并收集物品。如果有人问你:“为什么门锁上了?”答案可能埋藏在 40 步前的一个微小细节中,比如你掉落的一把特定的钥匙。

在 AI 的世界里,这些“步骤”被称为轨迹(trajectories)。它们是行动、观察和想法组成的漫长且混乱的链条。问题在于,这些链条可能长达数百步。如果你将整个链条输入给 AI,成本会很高且会让它感到困惑。如果你尝试对其进行总结,你可能会丢失那个至关重要的微小细节。

科学家们曾尝试通过将记忆组织成不同的“结构”或格式来解决这个问题,就像把杂乱的房间整理进不同的收纳箱一样:

  • 摘要(Summaries): 就像日记条目,提供了当天的“大意”,但跳过了细节。
  • 时间存储(Temporal Stores): 就像时间线或日历,按严格的顺序保存事件。
  • 知识图谱(Knowledge Graphs): 就像人与物之间的连接网络,展示它们是如何关联的。
  • 向量数据库(Vector Databases): 就像搜索引擎,根据“感觉”或含义来寻找事物,即使词汇不同也能找到。
  • 原始痕迹(Raw Traces): 就像监控录像,显示了每一个动作,但充满了噪音且难以扫描。

核心问题是:AI 应该打开哪个收纳箱?

旧方法:要么太多,要么太少

在 MESA 出现之前,AI 处理此类问题主要有两种方式:

  1. “阅读全部”法: AI 会同时打开所有的收纳箱,并将所有的笔记全部倾倒进大脑里。这就像是为了找寻早餐吃了什么,而去同时翻阅你的整本日记、日历、地图和监控录像。信息量太大,重要的线索会淹没在噪音中。
  2. “只选其一”法: AI 会尝试猜测哪一个收纳箱是最好的,并且只阅读那一个。这就像是决定只看你的日历来确定早餐吃了什么。你可能会错过你在日记中记录关于这件事的内容。

研究人员发现,这两种极端情况都效果不佳。有时你需要时间线;有时你需要地图;而通常情况下,你需要两者的结合。但“最佳组合”会根据问题而变化。一个关于“先发生了什么”的问题需要时间线,而一个关于“谁和谁交谈过”的问题则需要地图。

解决方案:MESA,自适应图书管理员

MESA 是一个学习成为动态图书管理员的系统。它不会只选一个箱子,也不会打开所有箱子。相反,它会观察问题并判断:“啊,这个问题需要一点时间线和一点地图,但我可以跳过原始视频录像。”

以下是它的工作原理(简易版):

  1. 图书馆: 首先,AI 根据其历史记录构建五种不同类型的记忆结构(摘要、时间线、地图、搜索和原始视频)。这些都是预先创建好的,保持不变。
  2. 选择器: 当问题到来时,系统中的一个特殊的“选择器”部分(由 MESA 进行训练)会决定使用哪些结构。它就像一个聪明的助手,观察问题并挑选合适的工具。
  3. 学习: 最难的部分在于教导这个选择器。系统并没有一个老师告诉它针对每个问题该选哪个箱子。相反,它通过最终结果进行学习:“AI 是否得到了正确答案?”如果答案错误,系统就会调整其选择策略。它使用了一种被称为 UCB(置信上限) 的巧妙数学技巧,来平衡“尝试新组合”(探索)与“坚持已有经验”(利用)之间的关系。

研究发现

研究人员在包含大量长期复杂任务的数据集 AMA-Bench 上测试了 MESA,并将其与现有的最佳方法进行了对比。

  • 更高的准确率: MESA 的正确率为 65.1%,比之前的最佳系统(AMA-Agent)高出了 8.5%
  • 更智能的效率: 尽管 MESA 更准确,但它实际使用的记忆单词量(tokens)反而减少了 41%。这意味着它不仅仅是在读得更多,而是在读得更好。
  • 没有单一的赢家: 研究证实,不存在“一劳永逸”的记忆结构。记忆类型的最佳组合取决于具体的任务和具体的问题。

这为什么重要

这篇论文表明,AI 记忆的未来不在于构建越来越大的图书馆,也不在于仅仅选择一种类型的笔记。其核心在于灵活性。就像人类侦探知道要查阅日历看日期、查阅地图看位置、查阅日记看感受一样,AI 也需要知道如何混合并匹配其不同的记忆视图来解决问题。

MESA 展示了通过教导 AI 变得具有选择性和自适应性,我们可以在不改变其思维方式或存储方式的情况下,使其变得更聪明、更高效。这是向着“不仅拥有大量数据,而且知道在最关键时刻如何精准找到所需数据”的 AI 迈出的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →