MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory
MESA 是一个任务自适应框架,它通过动态选择并融合与特定查询相关的互补记忆结构子集,为长程智能体提供支持,在显著提升 AMA-Bench 性能的同时,通过避免固定上下文方法的噪声,实现了多样化证据的组合与高效利用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解一个持续数日谜团的侦探。你有一个巨大的笔记本,记录了你所做的每一件事、看到的每一件事、思考的每一件事以及说过的每一句话。有些页面只是对一天的简要总结,有些页面是每一步行踪的原始列表,还有些是关于你与谁交谈过的地图,以及你搜索过的关键词列表。如果你试图阅读整个笔记本来回答一个简单的问题,比如“我是什么时候丢钥匙的?”,你的大脑会被过量的信息淹没。但如果你只读其中一页,你可能会错过隐藏在另一个章节中的关键线索。这就是现代“AI智能体”(AI agents)面临的挑战——这些程序是作为数字助手运行的计算机程序。它们需要记住长链条式的事件来解决复杂问题,但它们经常会在自己的记忆中迷失方向。科学家们一直在研究组织这些记忆的最佳方式:是让AI阅读全部内容?还是让它只选择一种类型的笔记?或者是有更聪明的方法?
这篇论文介绍了一个名为 MESA(用于长程智能体的多结构证据选择系统,Multi-structure Evidence Selection for long-horizon Agent)的巧妙新系统,它就像是这些AI侦探的超级聪明图书管理员。MESA 不会强迫 AI 阅读其整个笔记本,也不会盲目猜测哪一页是最好的,而是学习为每个特定问题挑选出完美的组合。想象一下一位厨师,他不会只是随手抓起第一个香料罐,也不会把整个香料架都倒进锅里。相反,他会品尝菜肴,意识到它需要一点盐和一撮胡椒粉,然后精准地抓取那两个罐子。研究人员在名为 AMA-Bench 的基准测试上测试了它,这个测试就像是一个衡量 AI 在长时间跨度内记忆和推理能力的巨大测试场。他们发现 MESA 比以往的方法能更好地回答问题。事实上,它的正确率提高了 8.5%,而且在阅读过程中使用的单词(或“token”)减少了 41%。这表明,通过选择性的组合不同的记忆视图,比单纯阅读全部内容或只选其一,才是解决长期谜题的关键。
问题所在:噪音过多,信号不足
想象你在玩一款视频游戏,你需要通过记住 50 步之前做过的事情来解开一个谜题。你的角色一直在四处奔跑、战斗、与 NPC 交谈并收集物品。如果有人问你:“为什么门锁上了?”答案可能埋藏在 40 步前的一个微小细节中,比如你掉落的一把特定的钥匙。
在 AI 的世界里,这些“步骤”被称为轨迹(trajectories)。它们是行动、观察和想法组成的漫长且混乱的链条。问题在于,这些链条可能长达数百步。如果你将整个链条输入给 AI,成本会很高且会让它感到困惑。如果你尝试对其进行总结,你可能会丢失那个至关重要的微小细节。
科学家们曾尝试通过将记忆组织成不同的“结构”或格式来解决这个问题,就像把杂乱的房间整理进不同的收纳箱一样:
- 摘要(Summaries): 就像日记条目,提供了当天的“大意”,但跳过了细节。
- 时间存储(Temporal Stores): 就像时间线或日历,按严格的顺序保存事件。
- 知识图谱(Knowledge Graphs): 就像人与物之间的连接网络,展示它们是如何关联的。
- 向量数据库(Vector Databases): 就像搜索引擎,根据“感觉”或含义来寻找事物,即使词汇不同也能找到。
- 原始痕迹(Raw Traces): 就像监控录像,显示了每一个动作,但充满了噪音且难以扫描。
核心问题是:AI 应该打开哪个收纳箱?
旧方法:要么太多,要么太少
在 MESA 出现之前,AI 处理此类问题主要有两种方式:
- “阅读全部”法: AI 会同时打开所有的收纳箱,并将所有的笔记全部倾倒进大脑里。这就像是为了找寻早餐吃了什么,而去同时翻阅你的整本日记、日历、地图和监控录像。信息量太大,重要的线索会淹没在噪音中。
- “只选其一”法: AI 会尝试猜测哪一个收纳箱是最好的,并且只阅读那一个。这就像是决定只看你的日历来确定早餐吃了什么。你可能会错过你在日记中记录关于这件事的内容。
研究人员发现,这两种极端情况都效果不佳。有时你需要时间线;有时你需要地图;而通常情况下,你需要两者的结合。但“最佳组合”会根据问题而变化。一个关于“先发生了什么”的问题需要时间线,而一个关于“谁和谁交谈过”的问题则需要地图。
解决方案:MESA,自适应图书管理员
MESA 是一个学习成为动态图书管理员的系统。它不会只选一个箱子,也不会打开所有箱子。相反,它会观察问题并判断:“啊,这个问题需要一点时间线和一点地图,但我可以跳过原始视频录像。”
以下是它的工作原理(简易版):
- 图书馆: 首先,AI 根据其历史记录构建五种不同类型的记忆结构(摘要、时间线、地图、搜索和原始视频)。这些都是预先创建好的,保持不变。
- 选择器: 当问题到来时,系统中的一个特殊的“选择器”部分(由 MESA 进行训练)会决定使用哪些结构。它就像一个聪明的助手,观察问题并挑选合适的工具。
- 学习: 最难的部分在于教导这个选择器。系统并没有一个老师告诉它针对每个问题该选哪个箱子。相反,它通过最终结果进行学习:“AI 是否得到了正确答案?”如果答案错误,系统就会调整其选择策略。它使用了一种被称为 UCB(置信上限) 的巧妙数学技巧,来平衡“尝试新组合”(探索)与“坚持已有经验”(利用)之间的关系。
研究发现
研究人员在包含大量长期复杂任务的数据集 AMA-Bench 上测试了 MESA,并将其与现有的最佳方法进行了对比。
- 更高的准确率: MESA 的正确率为 65.1%,比之前的最佳系统(AMA-Agent)高出了 8.5%。
- 更智能的效率: 尽管 MESA 更准确,但它实际使用的记忆单词量(tokens)反而减少了 41%。这意味着它不仅仅是在读得更多,而是在读得更好。
- 没有单一的赢家: 研究证实,不存在“一劳永逸”的记忆结构。记忆类型的最佳组合取决于具体的任务和具体的问题。
这为什么重要
这篇论文表明,AI 记忆的未来不在于构建越来越大的图书馆,也不在于仅仅选择一种类型的笔记。其核心在于灵活性。就像人类侦探知道要查阅日历看日期、查阅地图看位置、查阅日记看感受一样,AI 也需要知道如何混合并匹配其不同的记忆视图来解决问题。
MESA 展示了通过教导 AI 变得具有选择性和自适应性,我们可以在不改变其思维方式或存储方式的情况下,使其变得更聪明、更高效。这是向着“不仅拥有大量数据,而且知道在最关键时刻如何精准找到所需数据”的 AI 迈出的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。