← 最新论文
💬 NLP

Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

本文对三种智能体记忆系统与标准策略的推理成本和准确性进行了基准测试,结果表明,成本是由内部系统行为而非仅由对话长度驱动的,且在不同的骨干网络和系统之间存在显著差异,并涉及一种没有任何单一方案能同时优化成本与准确性的权衡关系。

原作者: Natchanon Pollertlam, Witchayut Kornsuwannawit

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Natchanon Pollertlam, Witchayut Kornsuwannawit

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一个非常聪明但有点健忘的机器人朋友聊天。你们已经聊了好几周,分享了许多故事、计划和秘密。现在,你想问:“还记得三周前我们聊到的那家披萨店吗?”如果这个机器人没有记忆,那么每次你提问时,你都必须把从第一天开始的整个友谊故事重新讲一遍。这就像为了问一个简单的问题,就必须背着一个装满了你们所有对话内容的沉重背包。这样做虽然行得通,但很快就会变得既笨重、缓慢且昂贵。

为了解决这个问题,工程师们为这些机器人构建了“记忆系统”。与其背着整个大背包,不如让机器人把微小的笔记、事实或摘要记录在一个特殊的笔记本里。当你提问时,它只需翻到正确的一页并阅读笔记即可。这听起来很完美:更轻、更快、更便宜。但问题在于:编写笔记、整理笔记以及寻找正确页面也是需要工作的。核心问题在于:使用笔记本是否真的能让机器人省钱,还是说管理笔记本的成本实际上让整个过程比背着沉重的背包更贵?这篇论文正是深入探讨了这个谜团,通过衡量这些记忆技巧的真实世界价格标签,来观察它们是否真的物有所值。


伟大的记忆成本对决

在这项研究中,研究人员进行了一场大规模的竞赛,以观察维持一个聊天机器人的记忆到底需要多少成本。他们不仅仅是靠猜测,而是针对三种不同的“记忆系统”(可以理解为组织那个笔记本的三种不同方式)进行了受控实验:Mem0HindsightMastra Observational Memory

为了确保测试公平,他们将这些记忆系统与两种极端策略进行了对比:

  1. “滚动窗口”(廉价基准): 这就像只记得你最后说的 10 件事。它非常便宜,但会忘记其他一切。
  2. “全文本记录”(昂贵基准): 这是“沉重背包”法。每次你提问时,机器人都会重新阅读你们从第一个字开始的所有对话历史。

他们让这些系统经历了长达 400 轮(即 400 次来回对话)的对话,并通过 665 个特定问题 来测试机器人是否真的记住了正确的内容。他们还测试了两种不同的“大脑”(骨干模型),以观察机器人的大脑类型是否会改变成本。

大惊喜:你无法预测价格标签

第一个重大发现是,你不能仅仅通过观察对话的长度或消息的大小来预测成本。研究人员尝试建立一个简单的数学公式,根据对话长度和消息大小来预测成本。

  • 对于“全文本记录”和“滚动窗口”策略,数学计算非常完美。如果你知道发送了多少个词,你就确切知道要花多少钱。
  • 对于“记忆系统”,数学计算却惨败了。该公式预测的误差高达 18% 到 69%

为什么会这样?因为记忆系统的成本不仅仅取决于你说了多少话,还在于你在说话的同时,系统在内部做了什么。有时系统决定写一段长摘要,有时只是抓取一个简短的事实。有时它会重新组织整个笔记本。这些内部决策是由对话的内容驱动的,而不是仅仅由长度驱动。这就像试图仅通过查看地图来预测一次公路旅行的成本,却不知道司机是会停下来吃一顿丰盛的午餐,还是只抓起一个能量棒。这种“午餐”(内部处理)的变化范围极大,使得总账单变得难以预测。

“盈亏平衡点”:什么时候笔记本才真正划算?

研究人员提出了一个关键问题:在什么情况下,使用记忆系统会比重新阅读整个历史记录更便宜?

答案是:这完全取决于系统和机器人的大脑。

  • Mastra Observational Memory 是速度型选手。在某些情况下,它从第一轮(第 0 轮)开始就比“全文本记录”法更便宜。
  • Mem0 需要更长的时间,通常在 第 82 轮 左右达到盈亏平衡,但前提是消息长度相对较长。
  • Hindsight 是最慢的。在许多情况下,即使在 400 轮 之后,它也没有变得比“全文本记录”法更便宜。事实上,在某些设置下,直到测试结束它仍然更贵。

这意味着,如果对话很短,使用复杂的记忆系统可能比直接重新发送整个聊天记录还要。你必须进行一定时长的交流(即“盈亏平衡点”),记忆系统才会开始为你节省资金。

准确度 vs. 成本:没有免费的午餐

研究还检查了这些记忆系统回答问题的能力。结果显示出广泛的表现差异:

  • 准确度21% 到 54% 之间波动。
  • Mem0 的准确度波动最大,在某些机器人大脑上表现出色,而在另一些则表现糟糕。
  • Hindsight 通常是最准确的(经常高于 50%),但它也是运行成本最高的。
  • Mastra 是一个表现居中的选手,但如果考虑到它给出的正确答案数量,它通常是最具成本效益的。

研究人员发现,机器人的“大脑”(骨干模型)的选择与选择记忆系统同样重要。在一个机器人大脑上很便宜的记忆系统,在另一个大脑上可能会变得很贵。

最终结论

论文得出结论,并没有唯一的“最佳”记忆系统。

  • 如果你想要在特定机器人大脑上获得每个正确答案的最低成本,那么在 gpt-oss-20b 大脑上的 Mastra 是赢家(在 100 轮时,每个正确答案的成本约为 $0.028)。
  • 如果你使用的是不同的机器人大脑(Gemma 4 26B A4B),Mem0 则成为了最便宜的选择。
  • Hindsight 虽然准确,但除非对话非常长,否则通常太贵而不值得使用。

主要的启示是,你不能仅仅因为一个记忆系统听起来很酷就去选择它。你必须结合你的具体情况来看:对话会有多长?消息有多大?以及你正在使用哪种机器人大脑?只有这样,你才能知道记忆系统是在帮你省钱,还是在增加你的账单。记忆系统的“全量回忆”是有代价的,而这个代价远比单纯计算你输入的文字数量要复杂得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →