Goal-Oriented Reasoning for RAG-based Memory in Conversational Agentic LLM Systems
本文介绍了 Goal-Mem,这是一种面向目标推理的基于检索增强生成(RAG)的智能体记忆框架,它通过将用户目标分解为原子子目标以实现针对性检索,并用自然语言逻辑对这一过程进行形式化,从而在多跳推理和隐式推理任务上超越了现有方法,提升了长程对话性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在与一位非常聪明但记性很差的朋友交谈,他的地下室里藏着一座巨大且积满灰尘的图书馆。这座图书馆收录了你们曾经进行过的每一次对话。当你问一个简单的问题,比如“我早餐吃了什么?”,他能迅速找到答案。
但当你问一个棘手的多步骤问题,比如“根据我上周光顾的那家咖啡馆,我今天该尝试什么饮品?”时,会发生什么呢?
问题所在:“关键词搜索”陷阱
大多数现有的 AI 助手就像标准的图书馆搜索引擎。你输入问题,系统便会寻找包含与你问题相似词汇的书籍(记忆)。
- 缺陷: 如果你询问的是“上周”光顾的咖啡馆的饮品,系统可能会找到关于“咖啡”或“咖啡馆”的通用记忆。它忽略了具体的关联:是哪家咖啡馆?何时去的?在那里点了什么?
- 结果: AI 会感到困惑,抓取无关的事实,并可能编造一个听起来不错但并非真实的回答。这就像试图通过只寻找与嫌疑人衬衫颜色相同的线索来破案,而忽略了真正的证据。
解决方案:GOAL-MEM(侦探式方法)
这篇论文介绍了GOAL-MEM,一种 AI 利用记忆的新方式。GOAL-MEM 不再仅仅搜索关键词,而是像一位侦探从犯罪现场(你的问题)逆向推导那样运作。
以下是其工作原理,使用一个简单的类比:
1. 目标:“是谁干的?”
当你提出问题时,GOAL-MEM 将其视为一个待解决的目标。它不只是寻找答案,而是将目标分解为更小的、可验证的部分,称为子目标。
- 示例: 如果你问:“我上周光顾的那家咖啡馆,我该尝试什么饮品?”
- GOAL-MEM 将其分解:
- 我上周去了哪家咖啡馆?(子目标 A)
- 那家咖啡馆的菜单上有哪些饮品?(子目标 B)
- 我喜欢那些饮品的口味吗?(子目标 C)
2. 搜寻:针对性检索
AI 不会把整本图书馆的书都摊在你面前,而是前往图书馆,仅索取能回答子目标 A 的那本特定书籍。
- 它找到了记忆:“你上周二去了 Momoco 咖啡馆。”
- 现在它知道变量“咖啡馆”已填充。它接着转向子目标 B。
3. “逆向链式”魔法
这是关键所在。如果 AI 无法立即找到子目标的答案,它不会猜测。它会问:“在回答这个问题之前,我需要知道什么?”
- 场景: AI 找到了一条关于"Momoco 咖啡馆”的记忆,但不知道你是否上周去过那里。
- 行动: 它逆向推导。它创建一个更简单的新问题:“爱丽丝上周去过咖啡馆吗?”它专门针对这一点搜索记忆。
- 一旦找到“是的,爱丽丝上周二去了 Momoco",它便串联起线索,继续向前寻找饮品。
4. “事实核查”(可验证的统一)
在给出答案之前,AI 会进行严格的事实核查。它使用一种特殊的逻辑系统(称为自然语言逻辑)来确保:
- 它找到的事实确实符合问题的要求(例如,该饮品是否真的在那家特定的咖啡馆?)。
- 这些事实之间没有相互矛盾。
- 它没有仅仅找到一个“氛围匹配”(例如,当你询问“咖啡”时,仅仅因为“茶”和“咖啡”都是饮品,就找到了一条关于“茶”的记忆)。
如果事实无法完美吻合,AI 会承认“我不知道”,而不是编造内容。
为何更优(结果)
作者使用两个充满棘手多步骤问题的困难数据集(LoCoMo 和 LongMemEval),将这种方法与其他八种记忆系统进行了测试。
- 类比: 想象一场比赛,一名选手(旧 AI)试图通过猜测路径来冲刺,而另一名选手(GOAL-MEM)则在每个转弯处停下来查看地图。
- 结果: GOAL-MEM consistently 获胜,特别是在多跳问题(需要串联事实的问题)上。
- 在简单问题上,它的表现与其他系统相当。
- 在需要逻辑的复杂问题上(例如“詹姆斯在四月的锦标赛中玩了什么游戏?”),GOAL-MEM 的准确率显著更高。它不会在无关的记忆中迷失方向。
总结
GOAL-MEM 就像是将 AI 从关键词搜索引擎升级为逻辑侦探。它不再只是抓取任何看起来与你的问题相似的记忆,而是:
- 将你的问题分解为小的逻辑步骤。
- 搜寻特定事实以填充这些步骤。
- 双重核查这些事实是否确实证明了答案。
- 只有在证据确凿时才给出答案。
这使得 AI 在处理长对话时表现更佳,在这些对话中,你需要记住几天或几周前的细节来回答今天的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。