← 最新论文
🤖 AI

MEMAUDIT: An Exact Package-Oracle Evaluation Protocol for Budgeted Long-Term LLM Memory Writing

本文介绍了 MEMAUDIT,这是一种精确的包级预言机评估协议,通过将记忆选择转化为一个可由精确求解器处理的有限且可审计的优化问题,从而在存储预算约束下隔离并认证大语言模型长期记忆写入的质量,进而将表征质量与下游检索及推理效果解耦。

原作者: Nishant Bhargava, Rodrigo Sobral Barrento

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Nishant Bhargava, Rodrigo Sobral Barrento

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,正在调查一起跨越数月的谜案。你有一个笔记本,但它很小。你无法记下你看到、听到或做的每一件事。你必须决定:我记下什么,又该如何记录? 我是复制整段对话?还是只写“客户喜欢披萨”?或者写“客户改主意想吃寿司了”?

如果你记错了,或者记录方式占用太多空间,你可能会在后续破案时失败。但如果你失败了,你怎么知道为什么?是你忘了线索?还是你记下了线索,却用了一种无人能懂的密码?又或者你记下了正确的线索,但后来阅读笔记本的侦探 simply 没理解它?

本文介绍了一种测试记忆系统的新方法,称为MEMAUDIT。它就像一位严格而公正的裁判,只关注你记录笔记的环节,而忽略之后发生的一切。

问题:记忆的“黑箱”

通常,当我们测试 AI 的记忆时,会在最后向 AI 提问,看它是否能给出正确答案。问题在于,这是一个“黑箱”。如果 AI 答错了,我们不知道是因为:

  1. 它没有保存正确的记忆。
  2. 它保存了记忆,但格式太大或太杂乱。
  3. 它保存了记忆,但“搜索引擎”找不到它。
  4. 它找到了记忆,但“思考大脑”忽略了它。

本文主张,我们需要停止猜测,转而专门测量记录阶段

解决方案:"MEMAUDIT 套件”

作者创建了一个受控实验,称为MEMAUDIT 套件。将其想象为一个具有固定规则的模拟游戏

  1. 故事(体验流):你获得一个特定且冻结的事件故事(例如:“用户说他们喜欢素食,后来又说现在改为 pescatarian(鱼素者)”)。
  2. 选项(候选记忆):对于每个事件,你都会得到一份可能的记录方式列表:
    • 原始片段:复制整句话(昂贵,占用大量空间)。
    • 事实:仅写“喜欢素食”(便宜,但可能过时)。
    • 更新:“改为 pescatarian"(中等成本,非常有用)。
    • 墓碑:“旧的素食事实现已无效”(对于避免错误至关重要)。
  3. 预算:你对可用空间有严格限制(就像一个小背包)。
  4. 目标:你必须选择最佳的笔记组合以装入背包,以便当稍后有人提问时,答案能得到你所写内容的支持。

“神谕”与评分

本文使用一台超级智能计算机(“神谕”)来完美解决这个谜题。它计算出在特定背包和特定故事事件下,你能获得的绝对最佳分数

然后,它测试不同的 AI 记忆系统,看它们能多接近这个完美分数。

  • 分数:如果完美分数是 100,而 AI 得了 80 分,我们就确切知道它保留了多少“语义价值”(有用的真相)。
  • 神奇之处:由于规则是冻结的,如果 AI 得分低,我们就确切知道它失败在记录环节,而非搜索或思考环节。

关键发现(“啊哈!”时刻)

本文在多种记忆系统上测试了该方法,并发现了一些有趣的现象:

  • “密度陷阱”:一些系统试图通过为每个单词选择“最便宜”的笔记来实现高效。本文表明这是一个陷阱。系统可能会选择一个便宜的笔记,却遗漏了最重要的细节(例如用户改变主意的事实),从而导致低分。
  • “墓碑”的重要性:在事实发生变化的故事中(如从素食到 pescatarian 的例子),表现最好的记忆系统是那些写下“这个旧事实已失效”(即墓碑)的系统。只写“事实”而忘记将旧事实标记为无效的系统会在测试中失败。
  • 现实世界系统:他们测试了真实的记忆工具(如 Mem0、Letta 和 A-Mem)。
    • 有些系统在寻找要记录的良好信息方面表现出色(高“提取”分数),但在背包满时选择保留什么方面表现不佳(低“选择”分数)。
    • 另一些系统记录的笔记太长太乱,导致无法在有限的预算内容纳最重要的事实。

为何这很重要

将 MEMAUDIT 想象为一家工厂的质量控制检查员

  • 以前,我们只检查最终产品(答案)是否行驶良好。
  • 现在,MEMAUDIT 打开引擎盖,检查引擎装配线(记忆记录)。

它告诉工程师:“你们的引擎没问题,但你们的工人把错误的零件放进了盒子”,或者“你们的工人挑选了很好的零件,但包装得太松散”。

通过将“记录”问题与“搜索”和“思考”问题分离开来,该协议帮助开发者修复其 AI 中确切出错的部件,而不是仅仅猜测。它将模糊的"AI 不擅长记忆”转化为具体的"AI 不擅长在预算限制下决定保留哪些记忆”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →