LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes
本文介绍了 LakeQuest,这是一个包含近 10,000 个问答对、涵盖三个不同领域的经人工验证的基准测试,旨在评估并揭示当前检索增强型和智能体系统在针对现实且异构的数据湖进行端到端问答时的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜题的侦探,但你手里拿到的不是一本整洁、单一的笔记本,而是一个巨大的、混乱的仓库。在仓库里,有数百万张零散的纸张、写了一半的账本、便利贴和破碎的档案柜,所有这些都混杂在一起。有些线索是用纯英文写的,有些是复杂的电子表格,还有些仅仅是写在信封背面的模糊笔记。这正是现实世界中**数据湖(Data Lake)**的样子。
长期以来,旨在回答问题的计算机程序(比如一个超级聪明的侦探)都是在干净、有序的图书馆中接受训练的,那里的每一本书都各就其位。它们在那些整洁的房间里寻找答案时表现出色。但当你把它们扔进一家真实公司的混乱仓库时,它们往往会迷失方向、感到困惑或胡编乱造。
于是,研究人员创建了一个名为 LAKEQUEST 的全新“训练场”,用来测试这些侦探程序究竟能在多大程度上驾驭这种混乱。他们构建了一个巨大的模拟环境,其中包含 9,846 个特定的问题以及回答这些问题所需的精确线索,这些内容分布在三种截然不同的混乱仓库中:
- AI/ML 仓库: 堆满了数百万份“模型卡”(类似于计算机程序的简历)和数据集说明。
- 银行仓库: 充满了交易账本、客户档案以及关于谁可以转账的严格规则手册。
- 药物仓库: 混合了科学研究论文和关于药物的结构化表格。
重大发现:找到线索并不等于解开谜题
研究人员发现的最重要的一点是,仅仅因为侦探找到了那张正确的纸张,并不意味着他们就能解开谜题。
在测试中,他们观察了程序尝试回答问题的过程。他们衡量了两个指标:
- 检索(Retrieval): 程序是否找到了正确的文档?
- 推理(Reasoning): 程序是否真的阅读了这些文档并将碎片信息正确地组合在一起?
这里有一个转折:这些程序在寻找正确文档方面表现得相当不错(有时甚至能找到含有相同答案的不同文档),但它们在正确阅读文档方面经常失败。
- 在 AI 仓库中: 程序很难找到它们需要的特定文件(对于某些问题,找到正确文件的概率仅为 9%)。然而,一旦它们找到了正确的文件,它们能正确回答问题的概率为 35%。这表明主要问题在于如何在草堆中寻找那根针。
- 在银行仓库中: 程序实际上非常擅长寻找规则手册和交易清单(找到规则的概率在 85–94% 之间)。但当涉及到将规则与特定交易结合起来做出决策时,它们却搞砸了。它们的准确率下降到了 60% 左右。这就像是找到了“禁止奔跑”的标牌和一张小孩在奔跑的照片,却没能意识到这个小孩违反了规则。
- 在药物仓库中: 程序几乎可以完美地找到文本段落(98%),但当它们需要将这些文本与复杂的化学数据表结合起来时,准确率骤降至 66%。它们能找到线索,但无法在文本和数字之间建立联系。
为什么这很重要(以及它不是什么)
研究人员明确排除了“更好的搜索”是解决问题的唯一途径这一观点。他们证明了,即使你给程序提供完美的线索(“黄金证据”),它们仍然在处理这些信息时感到吃力,尤其是在药物和银行仓库中。在药物测试中,即使拥有完美的线索,程序的正确率也仅为 62.5%。这意味着问题不仅仅是程序“看不见”,而是当线索杂乱且混合在一起时,它们不擅长思考。
他们还测试了“智能体(agentic)”系统——这类程序就像是小机器人,通过执行搜索、总结和规划等多个步骤来行动。虽然这些机器人更聪明,但它们也更慢,且消耗了更多的计算资源(Token)。例如,一个简单的“猜测”动作大约使用 0.06 个千个 Token,而通过搜索和规划进行思考的机器人则会消耗高达 1.27 个千个 Token。这就像是雇佣了一名侦探,为了确保万无一失,竟然用了一周时间去解决一个原本一小时就能破获的案件。
结论
这篇论文并不声称已经解决了这个问题。相反,它提供了一份关于当前“侦探”在哪里失败的严谨地图。它表明,我们不能仅仅依赖更好的搜索引擎;我们需要教会这些系统如何进行综合(synthesizing)——即如何将来自政策文件的规则、来自银行账本的数字以及来自研究论文的事实编织在一起,从而形成一个单一且真实的答案,而不至于胡编乱造。
研究人员构建了这个包含 9,846 个经由人工验证的问题的基准测试,以确保每一个测试案例都是公平的,并且“黄金线索”是真实的。他们发现,虽然现代 AI 在寻找事物方面正在变得更好,但在理解企业和科学家每天实际使用的那些混乱、现实的数据方面,仍然显得力不从心。未来的路径不仅仅是寻找更多的线索,而是学习如何同时解读所有的线索。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。