← 最新论文
🤖 AI

RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts

本文介绍了 RECON,这是一个包含涵盖刑事、医疗和金融领域 24 个长文本案例文件的创新基准,旨在评估当前基于大语言模型(LLM)的智能体在执行复杂组合推理任务(如多跳证据重构、冲突解决和反事实分析)方面的局限性,而在这些任务中,即使是最强的系统也仅达到了 22.4% 的准确率。

原作者: Mihir Shriniwas Arya

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Mihir Shriniwas Arya

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图破解一个谜团,但线索并不只是散落在房间各处,而是被埋藏在一座规模如小城市般的图书馆里。这就是**大语言模型(LLMs)*的世界——它们是聊天机器人和数字助手背后超级聪明的计算机大脑。这些模型非常擅长阅读和交谈,但它们有一个棘手的弱点:记忆。请不要仅仅将记忆视为存储事实的硬盘,而要将其视为一名侦探的能力——不仅要记住发生了什么*,还要记住一个事件是如何导致另一个事件发生的。如果一名证人改变了说法,或者一项实验室检测被证明是伪造的,一名优秀的侦探知道哪些旧的结论现在已经失效,而哪些结论依然成立。研究人员提出的重大问题是:这些人工智能侦探真的能够追踪这些复杂且不断变化的叙事过程吗?还是说它们只会感到困惑并胡编乱造?

于是,RECON诞生了。这是一个全新的“压力测试”,旨在观察AI智能体是否能够处理那些事实不断变化、相互矛盾,并像波浪一样在叙事中层层传递的长篇复杂故事。研究人员构建了24份庞大的案卷——有些长达10万字——涵盖了刑事调查、医学谜团和金融欺诈。这些不仅仅是枯燥的数据列表;它们是动态的故事,其中第1天发现的线索可能会在第5天被证明是伪造的,从而迫使AI去弄清楚它之前的哪些猜测是错误的。这项测试检查了六项特定的技能,例如连接由15个线索组成的链条、推测如果某个关键事件发生在不同时间会发生什么,或者当两个人的说法不一致时,判断哪位证人在撒谎。

这项实验的结果是对AI界的一次现实审视。即使是最聪明的AI系统在测试中也表现得异常吃力。表现最好的非专业化AI答对题目的比例还不到23%。为了让你更有概念,如果让你作为一个人类,在面对完整文本的情况下解决这些谜题,你的表现会好得多。研究发现,问题不仅仅在于AI找不到书中的正确页面(检索问题),真正的瓶颈在于推理。即便是在给AI提供了“作弊条”(一份关于所有事实及其关联性的完美、结构化的地图)之后,它的正确率也仅为**55%**左右。这表明,虽然AI在阅读长篇著作方面正在进步,但它仍未掌握在底层事实发生变化时进行逻辑串联的艺术。研究人员得出结论:如果AI想要在现实世界的职业中真正成为可靠的智能体,它需要变得更擅长理解事实之间的相互依赖关系,而不仅仅是记住它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →