← 最新论文
🤖 machine learning

Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration

本文通过引入两个全文科学记忆基准测试 PAIM 和 PTr,旨在证明如果不控制检索预算和协议,记忆排行榜往往具有误导性,并最终认为科学记忆应当被评估为受预算限制且具备模态感知能力的上下文恢复,而非不受约束的架构性能。

原作者: Maksim Sheverev, David Finkelstein, Sergey Nikolenko

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Maksim Sheverev, David Finkelstein, Sergey Nikolenko

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图破解一个巨大且复杂的谜团。你拥有一个超级聪明的侦探(一个人工智能),他能在瞬间读完一座图书馆规模的书籍。但问题在于,如果同时把数百万页的文本塞到他面前,即使是最聪明的侦探也会感到困惑。他们可能会错过隐藏在中间的关键线索,或者因为过于不知所措而开始瞎猜。这就是“长上下文”(long-context)AI 的问题。为了解决这个问题,科学家们正在为这些侦探构建“记忆”——即数字文件柜,用于存储事实、故事和证据,以便在需要时仅提取所需内容。

长期以来,人们一直认为最好的记忆就是能够抓取最多页面的文本。这就像是一场比赛,获胜者是那个能阅读最大一叠纸张的侦探。但这篇论文提出了一个更好的问题:是阅读一座纸张组成的汪洋大海更好,还是只阅读那几页真正能破案的正确页面更好?研究人员认为,对于科学研究而言,记忆不仅仅是存储事实;它关乎“上下文恢复”(context restoration)。它是重建回答特定问题所需的精确且相互关联的证据网络的能力,而不至于迷失在噪音之中。他们想知道:如果我们给每一位侦探提供完全相同数量的纸张去阅读,谁能真正更好地破解谜团?

这篇论文的作者 Maksim Sheverev、David Finkelstein 和 Sergey Nikolenko 决定不再靠猜测,而是开始测量。他们利用数千篇关于人工智能和计算机科学的真实科学论文,建立了两个大规模的真实世界测试实验室。他们创造了一种全新的游戏方式,叫做“预算化上下文恢复”(budgeted context restoration)。想象一下,给每位侦探一个只能装下 3 万个字符文本的背包。无论他们的记忆系统有多好,他们都不能携带超过这个容量的内容。然后,他们测试了八种不同类型的“记忆系统”——有些只是抓取文本块,有些构建复杂的知识图谱,还有些试图将一切总结成微小的笔记。

以下是他们的发现,这完全颠覆了以往的排行榜。

首先,他们发现之前的竞赛“赢家”往往是通过背着巨大的背包来“作弊”的。有一个名为 Graphiti 的系统曾以压倒性优势获胜,但那是因为它被允许在每个问题中携带 260 万个字符的文本——大约相当于一本小说的长度!当研究人员强制要求 Graphiti 使用与其他人一样的仅有 3 万字符的小背包时,它不仅输了,而且跌落到了列表的最底端。这种“胜利”并不是因为该系统更聪明,而是因为它拥有更多的燃料。

其次,他们发现记忆的类型并不如寻找信息的工具重要。在其中一个测试集(称为 PTr,其中充满了像“Kimi Linear”或“Ring-flash”这样的特定名称)上,最好的策略并不是一种花哨的新架构,而是简单地混合两种搜索方法:一种寻找意义(稠密检索/dense),另一种寻找精确词汇(稀疏检索/BM25)。当我们将这种“词汇搜索”工具添加到其他系统中时,它们的得分都大幅提升,并且排名前三的系统最终处于并驾齐驱的状态,在十分制的量表中差距不到一分。这表明,对于科学问题而言,拥有合适的搜索引擎比拥有一个华丽的文件柜更为重要。

第三,他们证明了他们评分方式的公平性和可靠性。他们使用了一个超级聪明的 AI 来评判答案,但他们担心 AI 可能会产生偏见。因此,他们让三个不同的 AI 对相同的答案进行评分,甚至引入了 112 名志愿者进行侧向对比。他们发现,只有当分数差异明显时,AI 评委与人类的一致性才达到 77%。如果两个答案非常接近(差距在 1 分以内),即使是 AI 也无法分辨它们。这意味着在未来,我们不应该对微小的分数差异感到兴奋,因为这些差异很可能只是噪音。

该论文介绍了一个名为“Theoria”的新系统,它试图将科学论文组织成证据层、相关思想社区以及高层理论。虽然 Theoria 的表现非常出色且具有竞争力,但它并没有奇迹般地赢得整个比赛。研究人员认为,Theoria 的真正力量可能在于它如何处理随时间推移的长期研究项目,而不仅仅是回答单个测试问题。

最后,作者们认为,我们不应该把 AI 记忆视为一个“高分即获胜”的电子游戏排行榜。相反,我们应该把它视为一项受控的科学实验,其中我们控制着预算。他们证明了,如果你不控制 AI 被允许阅读的文本量,你测量的就不是智能,而仅仅是在测量谁的背包更大。通过标准化规则,他们揭示了只要给予正确的工具去寻找“大海捞针”中的那根针,简单的办法往往能取得同样好的效果。他们已经向公众发布了所有数据、代码和测试题目,邀请所有人尝试挑战他们的结果,但必须是在这些新的、公平的规则之下。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →