← 最新论文
💬 NLP

LakeQA: An Exploratory QA Benchmark over a Million-Scale Data Lake

该论文介绍了 LakeQA,这是一个基于 9.5 TB 异构数据构建的综合基准测试,它通过将文档检索与复杂的多跳推理相结合,挑战大语言模型执行以搜索为核心的问答任务,并揭示了即使在顶尖模型中也存在的显著性能差距。

原作者: Haonan Wang, Jiaxiang Liu, Yurong Liu, Austin Senna Wijaya, Tianle Zhou, Eden Wu, Yijia Chen, Wanting You, Reya Vir, Daniela Pinto, Grace Fan, Yusen Zhang, Juliana Freire, Eugene Wu

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Haonan Wang, Jiaxiang Liu, Yurong Liu, Austin Senna Wijaya, Tianle Zhou, Eden Wu, Yijia Chen, Wanting You, Reya Vir, Daniela Pinto, Grace Fan, Yusen Zhang, Juliana Freire, Eugene Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图破解一个非常特定谜题的侦探。在大多数侦探故事(或标准的 AI 测试)中,作者会递给你一叠文件并说:“答案就在这三页纸里。”你的任务仅仅是阅读它们并找到线索。

LAKEQA 是另一种不同的测试。在这里,作者给了你一个问题,但没有提供任何文件。相反,你被丢进了一个规模如小城市般庞大且混乱的仓库,里面装满了 4000 万份不同的文档。有些是整齐有序的电子表格,有些是杂乱的 PDF,有些是旧的文本文件,还有一些是政府报告。

你的任务是通过搜索这些文件并连接其中的点滴信息来解决问题。

以下是该论文内容的详细拆解,使用了简单的类比:

1. 问题所在:“大海捞针”实际上是“在无数个干草堆组成的群山中捞针”

目前的 AI 模型(大语言模型)非常擅长阅读一本书并回答关于它的问题。但在现实世界中,数据并不是整齐包装好的。它们散落在数百万个文件中,分布在“数据湖”中。

  • 旧方式: AI 被给了一本书,并被问到:“汽车是什么颜色的?”AI 阅读书本并给出答案。
  • LAKEQA 的方式: AI 被问到:“寻找纽约市哪所小学在 2008 年至 2011 年期间班级规模较小且暴力事件最少?”
    • AI 不知道哪个文件包含学校名称。
    • 它不知道哪个文件包含班级规模。
    • 它不知道哪个文件包含犯罪报告。
    • 它必须搜索正确的文件夹,下载它们,阅读它们,然后整合所有这些信息来解开谜题。

2. 基准测试:一场“多跳式”寻宝游戏

论文介绍了一个名为 LAKEQA 的新测试,旨在测试 AI 在这种特定类型的侦探工作方面的表现。

把 LAKEQA 中的任务想象成一场有 8 个线索寻宝游戏

  • 线索 1: 你需要找到一个社区。(你在维基百科中进行搜索)
  • 线索 2: 该社区紧邻另一个社区。(你在地图数据库中进行搜索)
  • 线索 3: 你需要在这两个社区中寻找学校。(你在政府名单中进行搜索)
  • 线索 4: 你需要根据班级规模对这些学校进行筛选。(你打开了一个电子表格)
  • 线索 5: 你需要检查剩余学校的犯罪统计数据。(你打开了另一份报告)
  • ……以此类推。

如果 AI 在线索 2 处卡住了,它就永远无法解决线索 8。论文将这种现象称为**“多跳推理”(Multi-hop reasoning)**。AI 必须迈出一步,找到一个新的信息点,并利用该信息来决定下一步该去哪里寻找。

3. 规模:一座“巴别图书馆”

该论文使用了一个庞大的数据集构建了这个测试:

  • 9.5 TB 的数据(想象一个拥有数百万本书籍的图书馆)。
  • 4000 万份文档(混合了像 Excel 表格这样的结构化数据和像文本文章这样的非结构化数据)。
  • 来源: 维基百科(用于通用知识)和 Data.gov(用于真实的、杂乱的政府数据)。

这很重要,因为之前的测试仅使用小型、干净的文本集合。LAKEQA 迫使 AI 去应对现实世界的“混乱”。

4. 结果:AI 迷路了

研究人员在这一挑战中测试了七种目前最智能的 AI 模型(包括 GPT-5.2 和 Claude)。

  • 得分: 最优秀的 AI 也仅能答对约 18% 到 33% 的问题。
  • 主要失败原因: AI 的失败并非因为它无法阅读或推理。它失败是因为它找不到正确的文件
    • 类比: 想象一位才华横溢的侦探,他可以破解任何罪案,但他在一个巨大的仓库里被蒙上了眼睛。他找不到证据,因为他不知道该看哪个货架。
  • “长链”问题: 随着步骤(跳数)的增加,AI 的表现急剧下降。它需要执行的步骤越多,迷路或忘记之前线索的可能性就越大。

5. 结论:搜索是瓶颈

论文得出结论,虽然 AI 在“思考”(推理)方面变得越来越强,但在庞大、无序的数据湖中进行“寻找”(搜索与发现)时,它仍然表现得很糟糕。

  • 目前的 AI: “我可以完美地读完一本书,但如果把这本书藏在 4000 万本书堆里,我就找不到了。”
  • 目标: 我们需要的不只是聪明的阅读者,更是专家级的探索者,他们能够穿梭于庞大、混乱的数据仓库,找到解决问题所需的特定证据。

简而言之,LAKEQA 是一项压力测试,它表明即使当前的 AI 拥有理解“针”的智能,但在面对巨大的、混乱的干草堆时,它们在寻找那根“针”时依然表现得很差。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →