← 最新论文
🤖 AI

Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents

本文介绍了 OSL-MR,这是一个新颖的框架,它将长程语言智能体的记忆留存问题建模为一个受限随机优化问题,旨在严格的可观测性约束下学习查询条件的证据价值,并证明了其在 LOCOMO 和 LongMemEval 等基准测试上优于现有的启发式和基于近时性的方法的性能。

原作者: Qingcan Kang, Liu Mingyang, Shixiong Kai, Kaichao Liang, Tao Zhong, Mingxuan Yuan

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Qingcan Kang, Liu Mingyang, Shixiong Kai, Kaichao Liang, Tao Zhong, Mingxuan Yuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图破解一个大型、跨度数日的谜案的侦探。你的笔记本空间有限,必须记录线索、证人陈述和事实。每当你写下新内容时,你可能不得不擦掉旧的内容。如果你擦错了东西,以后可能会错过关键线索。如果你保留了太多垃圾信息,你的笔记本就会写满,导致你无法记下新的重要内容。

这正是 OSL-MR 为 AI 智能体(能够像人类一样交谈和思考的计算机程序)在进行长对话时所解决的问题。

以下是使用简单类比对该论文思想的拆解:

1. 问题所在:“信息过多”的困境

目前的 AI 智能体就像是试图在笔记本里记录所有内容的侦探,或者它们只保留最近的笔记并丢弃其余部分。

  • 问题在于: 如果对话非常长,笔记本(称为“上下文窗口”)就会耗尽空间。
  • 错误做法: 旧的方法根据简单的规则来决定保留什么,比如“保留最新的笔记”或“保留现在听起来最重要的笔记”。但这就像一名侦探因为某条笔记是昨天写的就保留了关于天气的记录,却因为某条笔记是三天前写的就扔掉了关于嫌疑人不在场证明的记录。那条旧笔记可能毫无用处,但那个旧的不在场证明可能是以后破案的关键。

2. 解决方案:一位“聪明的预算管理者”

作者创建了一个名为 OSL-MR 的新系统。你可以把它想象成你侦探笔记本的超级聪明预算管理者。

OSL-MR 不仅仅是靠猜测,它将记忆留存视为一个数学谜题。它会问:“如果我现在保留这条笔记,它会对以后破解谜案有帮助吗?如果我把它扔掉,我以后找回它的代价会有多大?”

它考虑了三种主要成本:

  • “遗漏”惩罚: 如果我扔掉了一条线索,而后来无法找到它,我就无法破案。
  • “重新获取”成本: 如果我把它扔掉了,但以后又需要它,我就必须花费时间和精力重新去寻找它。
  • “陈旧”风险: 如果我保留了一条过时的笔记(比如一张已经发生变化的城市旧地图),它可能会误导我。

3. “没有水晶球”原则(可观测性)

这是论文中最重要的部分。

  • 陷阱: 在一个完美的世界上,侦探可以看向水晶球,准确预见到明天需要哪些线索。但在现实世界中,你无法预知未来。
  • 规则: OSL-MR 系统旨在确保 AI 永远不会利用“未来知识”来做决策。它只使用它现在能看到的东西(当前的提问、记忆的年龄以及主题)。
  • 为什么这很重要: 许多其他 AI 系统通过使用“金标准标签”(预先知道答案)来进行训练,这实际上是在“作弊”。OSL-MR 严格区分了“我们现在知道什么”和“我们在事后知道什么”。这确保了 AI 在现实生活中确实是可以使用的,因为它并没有水晶球。

4. 它如何学习:“学徒与大师”

既然 AI 看不到未来,它又是如何学会做出正确选择的呢?论文使用了两步训练过程:

  • 第一步:“混合评分”启发式算法(学徒)
    在 AI 拥有任何经验之前,它使用一个简单的、安全的规则手册(“混合评分”)。这就像是一名初级侦探,根据一份清单来记录笔记:“它够新吗?它相关吗?它太大了吗?”这确保了即使在零数据的情况下,系统也能立即投入使用。它会记录每一次交互以供学习。

  • 第二步:“证据学习器”(大师)
    一旦系统收集了足够的真实对话日志,它就会训练一个更聪明的模型。这个模型会观察这些日志并学习:“嘿,在这种特定情况下,保留那条旧笔记实际上在后来帮助解决了问题。”

    • 它直接从金标准证据(正确答案)中学习,以理解究竟什么才是真正重要的。
    • 至关重要的是,在现实世界中做决策时,它仍然只使用“学徒”的那些安全输入(不含未来知识)。

5. 结果:更好的记忆,更少的浪费

作者在两个大型数据集(LoCoMo 和 LongMemEval)上测试了这些方法,在这些数据集中,AI 智能体必须处理长且复杂的对话。

  • 胜出者: OSL-MR 一贯优于其他方法(如“近期性”或“生成式智能体”)。
  • “紧缩预算”测试: 当笔记本空间非常小时(预算很紧),OSL-MR 的表现最为出色。当其他方法用无用的垃圾填满笔记本时,OSL-MR 则仔细挑选了最有价值的线索。
  • 精确率 vs. 召回率: 它不仅仅是保留了更多的东西,它保留的是正确的东西。它在知道该保留什么以获得正确答案方面表现得更好,同时不会在无关细节上浪费空间。

总结

OSL-MR 是一种让 AI 管理其记忆的新方式。它阻止了 AI 进行猜测或利用未来知识来“作弊”。相反,它教会 AI 扮演一名聪明的资源管理者:它通过过去的经验学习哪些线索才是真正有价值的,从而确保当 AI 面对有限的空间时,它能用最有价值的信息来填充空间,以解决眼前的难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →