← 最新论文
🤖 AI

A Cost-Aware Agentic Architecture for NL-to-SQL over Nested Enterprise Schemas, with a New Benchmark

本文介绍了 DevRev NL2SQL 基准测试,其特点是包含 900 个具有嵌套结构的执行验证查询以及一个新的语义深度评分(Semantic Depth Score),同时还配备了一种成本感知型智能体架构,该架构在该基准测试上实现了 91.7% 的显著答案正确率,并在 Spider 2.0 上保持了竞争力。

原作者: Yoga Sri Varshan Varadharajan, Ajay Yadav, Ritesh Goru, Prateek Chaudhury, Constantine Caramanis, Prateek Jain, Divyateja Pasupuleti, Sunil Kumar Pandey

发布于 2026-09-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Yoga Sri Varshan Varadharajan, Ajay Yadav, Ritesh Goru, Prateek Chaudhury, Constantine Caramanis, Prateek Jain, Divyateja Pasupuleti, Sunil Kumar Pandey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你可以向计算机询问关于你业务的复杂问题,并收到用通俗易懂的语言表达的精准答案,而无需掌握数据库的“秘密语言”。多年来,研究人员一直致力于教计算机将人类的问题翻译成数据库指令,这一领域被称为“自然语言转 SQL”(natural-language-to-SQL)。早期的成功令人印象深刻,但这些成功依赖于使用简单的、扁平的数据列表进行测试,比如只有行和列的电子表格。然而在现实世界中,商业数据很少如此整齐。现代企业系统是围绕复杂的业务流程构建的,其中一个条目(例如一个客户支持工单)会被连接到其他条目的网络中,嵌套在列表之中,并埋藏在层层信息之下。这些结构通常被描述为“类图结构”(graph-like),这意味着它们更像是一张连接关系图,而非一个简单的表格。当研究人员试图将他们最好的工具应用于这些杂乱的现实世界数据时,系统往往会失败,无法在深层且纠缠的信息路径中进行导航。

一组研究人员现在通过构建一个新的测试场和一个旨在处理此类挑战的更智能的计算机系统,解决了这一特定难题。他们创建了一个名为 DevRev 的基准测试,其中包含基于实时业务数据库的 900 个真实世界问题。与之前的测试不同,这个数据库充满了深度嵌套的结构,即信息存储在包含其他列表的列表中,且项目之间的链接方式会根据上下文而变化。为了衡量系统理解这些问题的能力,该团队引入了一种新的评分方法,称为“语义深度得分”(Semantic Depth Score)。该得分不仅仅计算问题的长度,它衡量的是寻找答案所需的推理层数,例如需要比较不同的时间段、从旧值中计算新值,或者追踪不同类型业务对象之间的连接链。

研究人员发现,当时最先进的系统(它们在较简单的测试中表现出色)在面对这种新颖且复杂的数据时表现得非常吃力。这些系统通常尝试生成许多不同的可能答案,然后从中挑选出最好的一个,但它们无法正确导航嵌套列表,也无法理解链接不同类型业务记录的具体规则。它们在这个新基准上的成功率仅在三分之一左右徘徊,这意味着对于大多数问题,它们给出的答案都是错误的。研究人员认为,问题不仅在于缺乏练习,更在于这些系统的构建方式与数据的结构之间存在根本性的不匹配。这些系统试图将一种扁平、简单的方法强加于一个深层、多维的现实之上。

为了解决这个问题,该团队设计了一种新的计算机架构,其工作方式更像是一个细心的调查员,而非一个猜测者。它不再生成数十个可能的答案并寄希望于其中一个正确,而是遵循一条单一且专注的路径。它首先请求一个中央协调器查看数据库,以确定需要哪些特定的信息片段。如果系统因为找不到表或列而陷入困境,它不会仅仅进行猜测;它会返回,请求更多关于结构的信息,并利用新信息再次尝试。这个过程由一张详细的数据库地图引导,这张地图不仅包括列的名称,还包括数据在其中实际含义的描述。系统还会记录每一次错误日志,从每一次失败中学习,以避免重复同样的错误。它会在将结果发送给数据库之前检查自己的工作,确保逻辑严密,并且不会意外地制造出一个庞大且混乱的数据堆。

在针对这 900 个复杂问题的测试中,这个新系统实现了 91.7% 的成功率,相比之前的最佳尝试有了巨大的提升。它能够正确回答那些需要遵循多个步骤、计算衍生值以及在嵌套数据列表中进行导航的问题。研究人员还表明,这种方法效率更高,运行成本显著降低,因为它不会浪费资源去生成和测试数十个错误的答案。在另一个针对简单数据的规模化测试中,该系统的表现与领先的竞争对手一样出色,证明了其针对复杂数据设计的专门化并不会以牺牲处理标准数据的能力为代价。

这项研究表明,向计算机提问的未来不在于让它们更加努力地尝试或生成更多的选项,而在于赋予它们更好的工具,去理解它们所处理的数据结构。通过构建能够迭代探索数据库、从错误中学习并理解不同信息片段之间深层联系的系统,研究人员为实现可靠、智能的接口提供了路径,从而应对驱动现代业务的复杂且嵌套的数据。这项工作强调了,要让计算机真正理解我们的问题,它们必须首先理解数据所栖身的那个错综复杂、层次分明的世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →