← 最新论文
💬 NLP

AgentIR: A Workload-Adaptive Cascade Retrieval Substrate for Long-Term Conversational Memory

AgentIR 提出了一种面向长期对话记忆的负载自适应级联检索基底,该基底基于置信度阈值动态跳过昂贵的稠密检索,并利用时间分区索引,在各类基准测试中保持或提升检索准确率的同时,实现低于 10 毫秒的延迟和高达 132 倍的加速。

原作者: Aojie Yuan, Haiyue Zhang, Shahin Nazarian

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Aojie Yuan, Haiyue Zhang, Shahin Nazarian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是《AgentIR》论文的通俗解读,采用类比方式呈现。

宏观图景:AI 代理的智能图书管理员

想象你拥有一个非常聪明的 AI 助手(即“代理”),它为你服务数月甚至数年。随着时间的推移,这个代理积累了海量的对话记录、工具使用日志和计划——相当于数百万页的笔记。

每当代理采取行动解决问题时,它都必须翻阅这本“日记”以寻找正确信息。如果代理需要执行 20 个步骤,它就必须连续搜索这本日记 20 次。如果每次搜索哪怕只多花几分之一秒,对人类用户而言,整个对话就会显得“卡顿”或缓慢。

问题出在哪里?我们通常用来搜索图书馆的工具(如标准搜索引擎)是为搜索整个互联网而设计的,而非用于搜索一本单一且不断增长的日记,其中最重要的笔记往往就是刚刚写下的那些。

AgentIR 是一款专为这些 AI 代理打造的全新、专用搜索引擎。它速度更快、更懂得如何搜索,并且能够扩展规模而不会导致速度下降。


1. “时间旅行”书架(时间分区)

问题所在: 想象一个图书馆,书籍每秒都在增加。如果你要借一本书,标准图书管理员可能不得不从最旧的书开始,一本接一本地检查书架,直到找到最新的书。随着图书馆藏书量增长到数百万本,这种搜索会变得越来越慢。

AgentIR 的解决方案: AgentIR 以不同的方式组织图书馆。它不是将所有书排成一行,而是根据书籍撰写的时间将它们分放在不同的书架上。

  • 类比: 这就像一个“时间旅行”图书馆。最新的书籍被放在最前方一个特殊且易于取用的书架上,而较旧的书则被推到更靠后的位置。
  • 工作原理: 由于 AI 代理通常需要最近对话中的信息(例如“我们刚才修复了什么?”),系统会首先只查看前方的书架。如果在那里找到了答案,它立即停止搜索,无需浪费时间检查后方积满灰尘的书架。
  • 结果: 即使图书馆规模扩大 1000 倍,搜索时间也几乎不会增加。这就像在干草堆里找针,但这根针始终位于最前 1% 的干草中。

2. “双工具”策略(混合搜索)

问题所在: 有时你需要按确切单词搜索(例如查找特定的错误代码),而有时你需要按含义搜索(例如查找关于“修复漏洞”的对话,即使其中并未出现“漏洞”这个词)。

  • 工具 A(BM25): 擅长精确单词匹配,速度极快。
  • 工具 B(稠密/向量): 擅长理解含义,但速度慢且计算量大。

AgentIR 的解决方案: AgentIR 不会强迫你对每个问题都同时使用这两种工具。它就像一个聪明的交通指挥员。

  • 类比: 想象你在商店里寻找特定物品。
    • 如果你问:“红色的锤子在哪里?”,系统知道只需查看“锤子”过道(工具 A)。它会跳过昂贵且缓慢的“含义”扫描仪。
    • 如果你问:“那个能修好吱吱作响的门的工具在哪里?”,系统知道需要动用“含义”扫描仪(工具 B)来理解这个概念。
  • 级联机制: 系统首先尝试快速工具。如果快速工具非常有把握找到了答案,它就在此停止。如果它不确定,然后才会调用那个缓慢、沉重的工具。这节省了巨大的时间。

3. “变形”策略(工作负载自适应)

问题所在: 不同类型的问题需要不同的搜索策略。

  • 在一个数据集(LongMemEval)上,混合单词匹配和含义匹配效果最好。
  • 在另一个数据集(LoCoMo)上,仅使用单词匹配实际上更好且更快。
  • 旧系统强迫你选择一种策略并永远坚持使用它。

AgentIR 的解决方案: AgentIR 是一只“变色龙”。它拥有一个微小、快速的分类器(决策者),该分类器会审视你的问题并判断:“啊,这是一个‘时间’类问题,让我们使用策略 A",或者“这是一个‘事实’类问题,让我们使用策略 B"。

  • 结果: 它自动进行自我调整。在一次测试中,它跳过了慢速工具 63% 的时间;在另一次测试中,由于快速工具表现完美,它 100% 地跳过了慢速工具。它能够适应手头的工作,而无需重新训练。

4. “超高速”引擎(GPU 与 CPU 优化)

问题所在: 在标准计算机芯片(CPU)上执行这些搜索很快,但在功能强大的图形处理卡(GPU)上执行通常很棘手,因为数学运算无法完美对齐。此外,标准搜索引擎通常存在隐藏缺陷,当你试图加速它们时,会导致准确性略微下降。

AgentIR 的解决方案:

  • 引擎: 他们构建了一个定制引擎,可在 CPU 和 GPU 上完美运行。
  • “漏洞修复”: 作者发现了三个细微的“漏洞”,这些漏洞常出现在人们试图加速搜索引擎时(例如数值归一化错误或忘记清除内存)。这些漏洞会使搜索结果变差 6 到 8 倍,而无人察觉。AgentIR 修复了这些问题,确保超快速的 GPU 版本能提供与较慢的 CPU 版本完全相同的正确答案。
  • 结果: 在特定任务上,他们的速度比标准系统快高达132 倍,同时保持准确性完全一致。

结果总结

  • 速度: 它能处理数百万条记录,对于近期数据,响应时间仍低于 100 微秒(即 1/10,000 秒)。
  • 效率: 它可以在单台计算机上同时为 8 个不同的 AI 代理提供服务,而不会导致速度下降。
  • 准确性: 在找到正确答案方面,它匹配甚至超越了现有的最佳搜索引擎(如 Lucene),但速度快得多。
  • 成本: 由于它如此快速高效,其成本仅为商业云搜索服务收费的一小部分。

简而言之: AgentIR 是一款专用的高速搜索引擎,它知道何时查看最近的笔记,何时使用简单的单词匹配,以及何时完全跳过繁重的计算,从而确保即使 AI 代理的记忆变得巨大,它们依然能保持快速和响应灵敏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →