Less Context, More Accuracy: A Bi-Temporal Memory Engine for LLM Agents Where a Lean Retrieved Context Beats the Full History
本文介绍了 Engram,这是一个开源的双时态(bi-temporal)记忆引擎,它通过将无损写入路径与一种混合读取策略相结合,从双时态知识图中组装出紧凑且带有溯源标签的上下文,从而在准确率和效率上均超越了全上下文基准模型,在 LongMemEval_S 上取得了 83.6% 的评分,同时使用的 Token 数量显著减少。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于论文《更少上下文,更高准确度:面向 LLM 智能体的双时态记忆引擎》的通俗易懂的解释。
核心问题:“过重的背包”
想象你正在试图破解一个谜团,但你的侦探搭档(AI)背着一个每当你说话就会变重的背包。
- 旧方法: 为了记住三天前的一个线索,你把整个背包都倒在了桌子上。里面装满了所有东西:周二的天气预报、上周去过的餐厅菜单,以及你真正需要的那个线索。
- 结果: 侦探被这些垃圾(干扰项)搞得晕头转向。他们花了太多时间在翻找垃圾中,结果错过了线索,或者被噪音搞糊涂了。此外,背着这个沉重的背包既慢又贵。
解决方案:Engram(“聪明的图书管理员”)
作者构建了一个名为 Engram 的新系统。Engram 不会把整个背包都倒出来,而是像一位超级聪明的图书管理员,维护着一个完美且有条理的档案库。当你提问时,图书管理员不会把整座图书馆都搬给你,而是只带给你你需要的特定页面,并附上一张清晰的便签,注明这些页面是何时编写的。
它是如何工作的,分为三个简单的部分:
1. 两步写作过程(系统-1 与 系统-2)
Engram 以两种不同的方式记录记忆,就像人类的大脑一样:
- 快速写入(系统-1): 当你聊天时,Engram 会立即保存一份原始的、无损的对话副本(就像监控摄像头的录像)。这在毫秒内即可完成,不会拖慢你的速度。
- 慢速思考(系统-2): 稍后,当系统处于闲置状态时,它会阅读这些录像,并将它们转化为原子事实(简单的陈述,例如“X 在 Y 工作”)。它会构建一个这些事实的时间线。
- 神奇的技巧: 如果一个事实发生了变化(例如,“X 在 Y 工作”变成了“X 在 Z 工作”),Engram 不会删除旧的事实。它会将旧事实标记为“已过期”,并将新事实与旧事实链接起来。这创建了一个“更替链”(supersession chain)。你总是可以回溯查看:“哦,在下午 2:00,我们认为 X 在 Y 工作,但在下午 3:00,我们将其更新为 Z。”
2. “截至某时”过滤器(时间旅行)
因为 Engram 保留了事实何时成立的时间线,所以它可以根据你提问时的时间点来回答问题。
- 类比: 如果你问“X 在哪里工作?”,Engram 知道要检查时间线。如果你是在询问关于上个月的情况,它会显示旧的工作;如果你是在询问关于今天的情况,它会显示新的工作。它不会因为矛盾而感到困惑,因为它清楚地知道每个版本在何时是有效的。
3. 混合读取(两全其美)
当你提出问题时,Engram 不仅仅是靠猜测。它使用一种“混合”搜索方式:
- 它寻找事实(干净、有条理的笔记)。
- 它同时也会抓取原始片段(原始对话片段),以确保不会丢失微小的细节。
- 它将两者混合在一起,过滤掉垃圾信息,并递给侦探一叠精简且完美的资料(约 9,600 字),而不是整个图书馆(79,000 字)。
结果:少即是多
作者在名为 LongMemEvalS 的 500 道题目的考试中测试了该系统。
- 全上下文团队: 尝试通过每次阅读整个历史记录来回答问题。他们的正确率为 73.2%。
- Engram 团队: 使用那叠经过筛选的精简资料进行回答。他们的正确率为 83.6%。
令人惊讶的是: 通过丢弃 87% 的文本(即干扰项),Engram 实际上变得更准确了。完整历史记录中的噪音实际上损害了 AI 的表现。
为什么这很重要(根据论文所述)
- 准确度高于成本: 通常,人们试图通过减少内存使用来节省成本。Engram 证明了,使用更少的内存实际上可以让 AI 更聪明,因为它阻止了 AI 被分心。
- 没有“虚假数字”: 作者对诚实性要求非常严格。他们构建了一个公开、可复现的测试工具(“测试框架”),以便任何人都可以运行测试并看到相同的结果。他们修复了其他研究人员可能无意中获得的“不公平优势”(例如,让 AI 在完整的历史记录中直接看到答案)。
- 隐私与控制: 由于系统保留了清晰的“什么被相信以及何时被相信”的痕迹,因此如果用户要求被遗忘,删除特定记忆也会变得更容易。它也可以在本地运行,这意味着你的数据不必离开你的电脑。
总结
Engram 表明,对于 AI 智能体而言,记忆的质量比数量更重要。与其强迫 AI 阅读其完整的人生故事来回答一个简单的问题,不如使用一个具备时间感知能力、能检索相关且经过验证的事实的智能系统,这样可以更快、更便宜、更准确地解决问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。