技术摘要:RECON —— 面向长上下文组合推理的智能体记忆基准测试
问题陈述
基于大语言模型(LLM)的智能体正越来越多地被部署在对高风险工作流(如编程、临床、法律、金融)有要求的场景中,这些场景要求它们必须能够保留、访问并对跨越长上下文和多次交互所积累的信息进行推理。目前的记忆架构(例如 Mem0、Zep、MemGPT)和检索增强生成(RAG)系统主要将记忆建模为一种状态机,即追踪事实当前的值。然而,在现实场景中,事实不仅仅是累积,它们还会通过显式的依赖结构相互作用、冲突并使彼此失效。
现有的基准测试(例如 RULER、LongBench、LoCoMo)评估的是智能体是否能检索分散的事实,或者是否能检测到事实是否发生了变化。但它们未能评估此类变化的后果:即智能体能否追踪哪些下游结论受到了失效的影响,哪些结论通过独立支持得以存续,以及替代的时间线将如何展开。在评估关于演进中的长上下文叙事(其结论的有效性取决于复杂的溯源图而非静态事实列表)的组合推理能力方面,存在着关键的空白。
方法论:RECON 基准测试
作者引入了 RECON(Reasoning over Extended Contexts with Obfuscated Narratives,基于模糊叙事的扩展上下文推理),这是一个旨在评估智能体在长上下文(50k–100k token)下执行六项记忆密集型任务的基准测试。
1. 确定性生成流水线
为了确保地面真值(ground-truth)的可靠性,RECON 采用了完全确定性的生成流水线,其中 LLM 仅被限制进行表面实现(叙述),而绝不会影响因果结构、溯源或答案键。
- 蓝图合成(Blueprint Synthesis): 一个带种子的生产引擎通过类型化终端(角色、证据)和生产规则生成案例蓝图,确保在得出结论之前满足逻辑前提。
- 骨架扩展(Skeleton Expansion): 蓝图扩展为一个包含时间戳事件、因果依赖、失效、来源冲突和并行时间流(例如监控、交易)的结构化骨架。
- 溯源 DAG(Provenance DAG): 从生成契约中诱导出全局有向无环图(DAG)。节点代表事件/证据,边编码了因果、修订和失效关系。该 DAG 作为权威的地面真值。
- 任务合成(Task Synthesis): 问题根据 DAG 进行算法化生成。例如,“级联传播”类问题通过选择一个失效节点并计算可达性,以确定哪些结论会崩塌。
- 叙事实现(Narrative Realization): LLM 将结构化骨架转换为自然语言形式的案例文件(警察报告、临床日志、财务审计),同时严格遵循骨架中不可变的客观事实。
2. 任务类别
RECON 涵盖了三个领域(刑事、医疗、金融)的 24 个案例文件和 1,604 个问题,分为六个任务:
- 链条重建(Chain Reconstruction): 在文档中定位并按因果顺序排列 5–15 个分散的证据跳跃。
- 级联传播(Cascade Propagation): 在特定证据失效后,确定哪些结论会破裂,以及哪些结论通过独立支持得以存续。
- 来源冲突解决(Source Conflict Resolution): 利用独立的佐证证据对矛盾的陈述进行裁决。
- 反事实推理(Counterfactual Reasoning): 确定在替代时间线下(例如,如果某个事件发生得更早),下游事件会如何变化。
- 时间约束满足(Temporal Constraint Satisfaction): 将并行数据流与特定的时间窗口进行交叉比对。
- 时间事实检索(Temporal Fact Retrieval): 用于时间排序和状态查询的基准任务。
3. 评估设置
该基准测试评估了三类系统以及一个 Oracle(先知)天花板:
- 长上下文(Long-Context): 处理 100k token 完整案例文件的模型。
- RAG: 包括密集检索、混合检索和重排序的变体。
- 记忆智能体(Memory Agents): 如 Mem0、Mem0-Graph、Supermemory 和 Hindsight 等系统。
- Oracle(先知): 接收结构化的地面真值 DAG 而非叙事文本,提供检索完美的上限。
评分涉及严格的准确率指标,包括对多选题错误提交的惩罚以及弃权选项。污染过滤器会移除可以通过既有 LLM 知识回答的问题。
关键结果
评估揭示了所有当前架构存在的重大局限性:
- 整体性能: 没有非 Oracle 系统超过 25% 的准确率。表现最好的非 Oracle 系统(Gemini-2.5-Pro)仅达到 22.4% 的准确率,而 Oracle(具备完美检索能力)达到了 54.6%。这表明,即使拥有完美的依赖图访问权限,推理仍然是一个显著的瓶颈。
- 特定任务性能:
- 级联传播: 记忆系统在此任务表现出色,Supermemory 达到了 0.708 的得分,几乎是表现最好的长上下文模型的两倍。这表明当依赖结构较为简单时,记忆架构在追踪状态变化方面是有效的。
- 反事实推理: 这是最难的任务。即使是 Oracle 也仅达到了 0.483,这表明链式推理是主要的瓶颈,而非检索。
- 链条重建与来源冲突: 长上下文模型在这些任务中领先,但性能依然较低。RAG 和记忆系统表现挣扎,可能是由于在压缩或检索过程中丢失了事实间的边。
- 检索 vs. 推理:
- 检索是必要但不充分的。在“全覆盖”场景下(即正确证据已被检索),系统仍有约 80% 的概率回答错误。
- Oracle 与 LLM 之间的差距在需要多跳推理的任务(链条重建、来源冲突)中最大,这表明无法组合检索到的事实是主要的失败模式。
- Token 效率: 基于检索的方法(RAG、记忆)比长上下文模型具有 8–20 倍的 Token 效率,但通常是以牺牲复杂推理任务的性能为代价。
意义与主张
论文声称 RECON 代表了我们应如何评估智能体记忆的转变方式:
- 从状态机到溯源图: 该基准测试认为,记忆应被建模为由推导历史组成的图(其中失效通过依赖关系传播),而非简单的当前事实值的状态机。
- 组合推理是瓶颈: 结果证明,当前的智能体不仅失败于寻找信息,更失败于组合信息。Oracle(完美检索)与 LLM 性能之间的巨大差距凸显出,追踪因果链和处理失效的能力是当前架构的一个根本性限制。
- 确定性地面真值: 通过将因果结构生成与 LLM 叙事解耦,RECON 提供了一个严谨、可复现的基准,避免了完全由 LLM 生成的合成数据集中所常见的幻觉问题。
作者总结道,检索和推理仍然是开放性的挑战。即使拥有完美的上下文,智能体也难以在处理事实相互作用且相互矛盾的长文档时,保持连贯且演进的理解。发布该基准测试、生成器及评估工具,旨在为开发能够在长上下文中进行鲁棒、组合推理的智能体提供支持。