← 最新论文
🤖 AI

Generating Leakage-Free Benchmarks for Robust RAG Evaluation

本文介绍了 SeedRG,这是一种半合成基准生成流程,它通过从种子数据中提取推理图并生成新颖且结构相似的示例(这些示例无法通过大语言模型的参数记忆来回答),从而缓解检索增强生成(RAG)评估中的知识泄露和基准老化问题。

原作者: Jiayi Liu, Jiaxing Zhang, Bowen Jin, Jennifer Neville

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiayi Liu, Jiaxing Zhang, Bowen Jin, Jennifer Neville

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,试图评估学生使用图书馆的能力。你给他们一个问题和一摞书,你想看看他们能否在书中找到答案。

但问题在于:这位学生早在几年前阅读这些书时,就已经记住了大多数问题的答案。当你问“谁写了《傲慢与偏见》?”时,他们不需要查看你给的那摞书;他们直接就能回忆起来。

这正是论文《为鲁棒性 RAG 评估生成无泄露基准》所探讨的内容。该论文指出,我们目前用来测试人工智能系统(特别是那些使用外部数据“图书馆”的系统,称为 RAG)的问题过于简单,因为人工智能已经从其内部记忆中知道了答案。

以下是该论文故事的拆解,使用简单的类比:

1. 问题:“作弊”的考试

作者发现,用于评估人工智能的流行测试正在“泄露”信息。

  • 类比:想象你给学生一场数学考试,而答案就写在他们的手背上。即使你告诉他们“必须使用计算器来解题”,他们也只是看一眼手背。你无法判断他们的计算器是好是坏,因为他们实际上并没有使用它。
  • 现实:在人工智能领域,“手”是人工智能的内部记忆(参数化知识),“计算器”是检索系统(RAG)。由于人工智能已经知道测试问题中的事实,检索系统变得多余。这使得我们无法判断哪个人工智能系统实际上更擅长查找信息。
  • “老化”问题:论文指出,这种情况随着时间的推移会变得更糟。随着人工智能模型在旧的测试问题上重新训练,它们会“记住”这些测试。测试变得毫无用处,就像一名保安记住了小偷的脸,却仍然因为知道小偷的名字而放他们进来。

2. 解决方案:SeedRG(“疯狂填词”机器)

为了解决这个问题,作者创建了一个名为 SeedRG 的新工具。与其仅仅要求人工智能“编造新问题”(这往往导致人工智能意外使用它已知的知识),SeedRG 采用了一种巧妙且结构化的方法。

  • 类比:想象“疯狂填词”(Mad Libs)游戏。你有一个故事,其中名词、动词和地点留有空白。
    • 旧方法:从头开始写一个新故事。(人工智能可能会意外地写到“纽约”或“爱因斯坦”,因为它非常熟悉这些词。)
    • SeedRG 方法:取一个现有的故事。识别其中的“槽位”(例如,一个特定的城市、一位特定的科学家)。然后,用人工智能从未听说过的全新、生僻的名字替换这些槽位(例如,将“纽约”替换为"Zog-42",将“爱因斯坦”替换为“格洛普博士”)。
  • 工作原理
    1. 映射逻辑:它绘制一张图(“推理图”),展示原始问题如何连接事实。
    2. 替换部分:它将具体名称替换为新名称,但保持逻辑图完全不变。
    3. 双重检查:它进行测试,确保人工智能无法在不提供文本的情况下回答新问题。如果人工智能猜出了答案,该问题就会被丢弃并重新生成。

3. 结果:终于看到了差异

当作者将新的"SeedRG"基准与旧基准进行测试时,结果非常显著。

  • 旧测试:所有不同的人工智能系统看起来都一样。它们都得了高分,因为它们只是在复述已知的内容。这就像一场比赛,所有人都站在原地,但终点线被移到了他们站立的位置。
  • SeedRG 测试:由于问题使用了新的、未知的知识,人工智能必须使用检索系统(“图书馆”)。突然间,差异显现出来。有些系统非常擅长找到正确的书;而另一些则糟糕透顶。
    • 隐喻:这就像终于给学生出了一份他们尚未学习过的科目的试卷。现在你实际上可以看到谁擅长查阅资料,谁只是在猜测。

4. 为什么“地图”很重要

该论文还发现了关于问题难度的有趣之处。

  • 发现:问题的难度不仅仅取决于词语,还取决于事实之间连接的结构(即“推理图”)。
  • 类比:如果你有一张包含 3 个站点的地图,这很容易;如果你有一张包含 10 个站点的地图,这就很难。SeedRG 确保在替换名称时,保持地图的形状完全相同。这证明了难度来自于你必须走过的路径,而不是路标上的名字。

总结

该论文指出:“目前的测试之所以失效,是因为人工智能系统利用自己的记忆在作弊。我们构建了一个新工具 SeedRG,它通过替换名称但保持逻辑不变,创造出全新的、无法被记忆的问题。这迫使人工智能真正使用其搜索工具,从而让我们终于能够看清哪些系统真正擅长查找信息。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →