← 最新论文
🤖 AI

QUMem: Personalized Memory for Query-Conditioned User-State Inference in LLM Agents

QUMem 是一个结构化记忆框架,它通过将交互历史分割为语义片段,将其分解为可独立检索的记忆类型,并采用多智能体检索过程来推断在时间与上下文层面均有效的用户状态,从而增强了大语言模型智能体的个性化能力,并在个性化基准测试中实现了最先进的性能。

原作者: Heng Wang, Yifei Li, Lingling Zhang, Pengyu Li, Xinyu Che, Xinyu Zhang, Zesheng Yang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Heng Wang, Yifei Li, Lingling Zhang, Pengyu Li, Xinyu Che, Xinyu Zhang, Zesheng Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,新一代计算机程序已经涌现,它们不仅能回答问题,还能作为持久的助手,记住过去的对话并随着时间的推移调整自身行为。这些被称为“智能体”的系统依赖于一种形式的数字记忆来有效运作。正如人类助手会记得客户喜欢的咖啡口味,或记得上周项目截止日期被更改了一样,这些智能体需要从长期的交互历史中存储和检索信息。然而,人类的记忆并非一个简单的档案柜,将每一次对话都存储为一个单一且不可更改的块。相反,我们自然地将事实与感受区分开来,将暂时的情绪与持久的偏好区分开来,并理解对话的语境会随着时间的流逝而改变。为了让人工智能真正理解一个人,它必须也能做到这一点:在数年的对话中进行筛选,从噪音中分离出相关的细节,并重构出一个关于用户当下真实面貌的清晰图景。

长期以来,研究人员一直试图通过构建更好的方式来存储和搜索这些数字对话来解决这一问题。主流的方法是将记忆视为一个图书馆,用户的查询充当搜索词,从而提取出最相似的文本块。虽然这对于简单问题行之有效,但在处理复杂情况时却显得力不从心。如果用户在几周内改变了对某个话题的看法,或者单次对话中既包含了一个转瞬即逝的抱怨,又包含了一条他们希望遵循的永久性规则,标准系统往往会感到困惑。它们可能会将无关的事件混在一起,或者无法理解过去的一个决定如何与当前的请求相联系。其结果是,助手记住了文字却忽略了含义,无法分辨什么是临时偏好,什么是核心价值观。

西安交通大学的一个研究小组提出了一种处理这一挑战的新方法,引入了一个名为 QUMem 的系统。该系统并非仅仅搜索相似的文本,而是旨在理解对话的结构以及信息在其中的特定角色。研究人员认为,要构建一个真正个性化的助手,计算机首先必须根据对话的自然流向,将原始的交互历史组织成有意义的故事,即“情节”(episodes)。随后,它将这些故事分解为三种截然不同的信息类型:关于发生了什么的具体事实、用户陈述的特定偏好或规则,以及可以应用于新情境的更广泛的洞察或原则。通过分离这些元素,系统可以在保留事件完整语境的同时,仍能让助手仅提取出当前时刻所需的特定细节。

其核心创新在于系统处理新请求的方式。QUMem 并没有让计算机去猜测要寻找什么,而是使用了一个三步推理过程。首先,一个智能体分析用户的当前问题,以确定为了妥善回答该问题究竟需要哪些信息。它会自问:这项任务需要的是一个具体事实、一个过去的偏好,还是一条通用规则?接着,第二个智能体负责规划搜索,指导系统去特定的“书架”中寻找该类型的信息,而不是在整个历史记录中进行全盘搜索。最后,第三个智能体将检索到的证据碎片编织在一起,构成一幅关于用户当前状态的连贯图景。这幅最终的图景不仅仅是一份旧记忆清单;它是一种综合性的理解,反映了用户在这一特定时刻的状态,并考虑了他们的偏好是如何演变的,以及哪些规则仍然适用。

为了测试这种方法,研究人员使用两个旨在衡量 AI 在记忆和适应用户方面表现的基准测试,将该系统与几种现有方法进行了对比。在一项测试中,系统必须回答关于用户在长对话中不断变化的偏好的问题。新方法表现优异,显著超越了其他方法,在 PersonaMem 基准测试中达到了最先进的性能水平。在使用 GPT-4o-mini 模型时,QUMem 将整体准确率提升至 61.02%;在使用 Gemini-3.5-flash 时,准确率达到 70.58%,而紧随其后的系统分别约为 53% 和 63%。当任务要求助手追踪偏好如何随时间变化,或将过去的教训应用于一个完全不同的新场景时,这种进步更为显著。在第二项涉及移动助手根据用户习惯执行任务的测试中,该系统再次取得了最高的成功率,证明了这种结构化思考记忆的方式有助于计算机更好地采取行动,而不只是给出更好的答案。

研究人员还发现,该系统的构建方式使其更加高效。旧方法通常无论新消息是否重要,都会在每次收到新消息时触发沉重的计算过程。而新系统会等待一个话题自然结束时才组织记忆,并且使用固定且少量的步骤来对信息进行分类。这意味着它在构建记忆时消耗的计算资源更少,使其能够在不减慢速度的情况下处理长期的历史记录。这项研究表明,实现长期个性化的关键不在于存储更多的数据,而在于以尊重事实、偏好与教训之间差异的方式来组织数据。通过将用户的历史视为一系列结构化的、演进的故事,而非平铺的文字列表,该系统能够推断出对所服务对象更清晰、更准确的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →