When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs Rivals Structured Memory
本文介绍了 ReFind,一种通过对未经修改的原始聊天日志进行迭代词法检索,从而在对话记忆任务上达到最先进准确度的智能体控制搜索系统,证明了对于精确的基于证据的提问而言,复杂的语义记忆结构往往是不必要的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一场庞大且无止境的聊天记录中寻找一段特定的对话。你记得对方提到过关于“披萨”和“周二”的内容,但你并不确定具体是什么时候,或者是谁说的。在人工智能的世界里,这就是“记忆问题”。当 AI 智能体(能够聊天、编写代码或解决问题的智能计算机程序)与我们进行长时间交流时,它们会感到不堪重负。它们无法同时记住其“大脑”中的所有内容。
为了解决这个问题,当今大多数 AI 系统都试图成为一名超级组织有序的图书管理员。在你提出问题之前,它们会提取所有这些杂乱的聊天日志,阅读它们,并将它们改写成整洁的摘要、绘制复杂的连接图谱,或者构建精巧的 3D 事实结构。这样做是希望以后能更容易地找到答案。但这种方法有一个陷阱:为了构建这些精巧的结构,AI 必须在它还不知道你即将问什么之前,就预先猜测什么是重要的。如果它在总结过程中丢弃了一个微小的细节,那个细节可能就永远消失了。
这引出了一个大问题:我们真的需要这些精巧的、预建的图书馆吗?还是说,AI 只需要一种更好的方式来直接搜索原始的、杂乱的聊天日志即可?这是一个新研究所探讨的谜题。它在询问:AI 是否可以通过像一个好奇的人在聊天应用中翻阅记录那样进行搜索,从而在寻找答案时表现得同样聪明,而不仅仅是依赖于一个预处理过的记忆库?
论文:《ReFind》——那个只会“打开聊天应用”的 AI
这项研究背后的研究人员,由 Ruizhe Li 及其同事领导,决定测试一个激进的想法:如果 AI 完全不构建任何特殊的记忆结构会怎样?
ReFind 系统并没有将聊天历史改写为摘要或图谱,而是将聊天日志保持原样。它将对话历史视为一份未经编辑的原始日记。当 AI 需要回答问题时,它不会去查阅预先做好的索引,而是“打开聊天应用”并开始搜索,就像人类那样。
它是如何工作的:侦探的工具箱
论文指出,人类其实非常擅长寻找旧消息。我们通常不会在搜索栏输入一个完美的句子然后得到答案。相反,我们会结合使用多种技巧:
- 我们使用关键词搜索: “披萨”。
- 我们观察邻近信息: 如果我们找到了关于披萨的消息,我们会阅读该消息前后几条消息,以获取完整的上下文。
- 我们记得时间: “那是上个月的事。”
- 我们跳过已看内容: “我已经检查过那段对话了,让我们看看别处吧。”
ReFind 复制了这些人类的技巧。它使用一个简单、快速的搜索工具(称为 BM25,即仅查找匹配词汇),但将其封装在一个智能的“循环”中,让 AI 智能体能够控制搜索过程。
- 循环(The Loop): AI 提出一个问题,查看结果,如果它不确定,它会改变搜索词并再次尝试。
- 控制功能(The Controls): 它使用了四种特殊的“聊天原生”工具:
- 上下文扩展(Context Expansion): 如果它找到了匹配项,它会抓取周围的消息,以便 AI 理解笑话或语境。
- 会话感知(Session Awareness): 它知道如果一段对话中的一条消息具有相关性,那么整个对话可能都很重要,因此它会提升整个聊天会话的排名。
- 时间旅行(Time Travel): 它可以过滤结果,使其仅查看特定日期范围内的消息。
- 跳过已见(Skip the Seen): 它会记住自己已经检查过哪些对话,以免浪费时间重复阅读同一个聊天。
结果:原始力量 vs. 精巧结构
研究人员让 ReFind 与那些构建复杂记忆结构(如图谱和树状结构)的“精巧”系统进行了对比测试。他们使用了一个包含约 2,800 个问题 的大规模数据集,涵盖了诸如“谁说了什么?”(单跳)、“事件 A 如何导致事件 B?”(多跳)以及“这个事实的最新版本是什么?”(事实追踪)等内容。
以下是他们的发现:
- ReFind 赢了。 它在所有测试中的平均准确率达到了最高的 58.2%。
- 最强的“精巧”系统名为 HippoRAG 2(使用复杂的图谱),以 53.2% 位居第二。
- 即使是一个没有智能循环的简单一次性搜索(称为 BM25-RAG),得分也仅为 48.8%。
这表明,“精巧”的结构实际上并没有承担最核心的任务。真正的“秘方”在于赋予 AI 对搜索过程的控制权。AI 不需要一张预建的地图;它只需要驾驶汽车、观察道路并决定何时左转或右转的能力。
“骨干”测试
为了确保这不仅仅是针对特定 AI 模型的偶然现象,研究人员使用更强大的 AI(GPT-5-mini)在更长的对话(有些超过 50 万字)上再次进行了测试。
- ReFind 在较短的长对话中得分 93.2%,在超大规模对话中得分 89.3%。
- 它以显著优势击败了包括拥有复杂图谱和树状结构的系统在内的所有其他系统。
该研究排除了哪些可能性
论文非常谨慎地说明了哪些做法是无效的。他们运行了几项“消融测试”(通过移除系统的部分组件来观察变化):
- 不仅仅是循环: 如果你允许 AI 进行多次搜索,但移除了“聊天原生”控制功能(如跳过已见会话或扩展上下文),得分会显著下降。AI 需要的是专门为聊天设计的工具,而不仅仅是一个通用的搜索循环。
- 不仅仅是“精巧”的数学: 他们尝试使用复杂的“稠密”搜索方法(即试图理解单词的“含义”而非仅仅匹配单词),发现简单的单词匹配(BM25)实际上更好或至少持平。AI 重新构思自身问题的方式比搜索引擎的类型更为重要。
- 不仅仅是模型规模: 该系统即使在使用较小、较便宜的 AI 模型(GPT-4o-mini)时也能表现良好,这证明了搜索的方法本身才是关键,而不是拥有一个超级强大的大脑。
核心启示
作者得出结论:对于在聊天日志中寻找精确事实而言,结构被高估了。我们不需要在提问之前,花费时间和计算资源将原始对话转化为复杂的图谱。相反,我们应该保持原始数据的安全与未修改状态,并让 AI 智能体扮演一名聪明的、充满好奇心的侦探,实时进行搜索、扩展和过滤历史记录。
简而言之,这篇论文表明,对于 AI 而言,最好的记忆不是一本预先写好的百科全书,而是一份未经编辑的原始日记,以及一个懂得如何阅读它的聪明智能体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。