Bounded Semantic Planning and Deterministic Compilation for Reliable Enterprise Text-to-SQL
本文介绍了语义路径编译(Semantic Path Compilation, SPC),这是一种确定性的多轮规划系统,它通过将语义解释与 SQL 构建分离,使在企业级文本转 SQL 任务中的可靠性和准确性显著高于直接生成的基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代商业世界中,数据往往被锁在庞大且复杂的数字仓库里。要提出一个简单的问题,比如“代理人二去年卖了多少份保单?”,需要穿越由定义公司运作方式的表、关系和规则构成的迷宫。多年来,研究人员一直试图教会计算机将这些自然语言问题直接转化为提取答案所需的特定代码。这就是“文本转 SQL”(text-to-SQL)的愿景:一种能够理解人类意图并编写正确指令以检索数据的机器。然而,一个重大问题仍然存在。当计算机自行编写这些指令时,它生成的代码往往虽然运行完美,却返回了错误的答案。它可能会连接错误的知识碎片,或者以错误的方式进行计数,从而产生一个看起来看似合理但本质上存在缺陷的结果。这在企业环境中是危险的,因为一个错误的数字可能会导致错误的商业决策。
一项新研究探索了解决这一可靠性问题的不同方法。研究人员并没有要求人工智能从头开始编写整个代码,而是构建了一个让 AI 扮演“向导”而非“建筑师”的角色。AI 的职责被限制在理解问题并从一组预先批准的有效路径和关系中进行选择。一旦 AI 完成选择,一个独立的、刚性的计算机程序就会接管。该程序负责将选择转化为最终代码,确保连接正确且计数规则被严格执行。研究人员使用一个复杂的保险数据集,将这种方法与传统的“全权编写”方法进行了对比测试。他们发现,引导式系统更加可靠,几乎每次都能产生正确答案,而传统系统则经常生成运行成功但结果错误的逻辑代码。
这项研究的核心在于改变了“不确定性”存在的位置。在标准系统中,人工智能模型必须决定一切:连接哪些表、如何链接它们以及如何聚合数值。由于这些模型是基于概率生成文本的,它们有时会选择一条技术上可行但在语义上错误的路径。这种被称为“语义路径编译”(Semantic Path Compilation)的新系统划定了一条严格的界限。人工智能被允许将问题中的词汇锚定到特定的业务概念上,并从人类策划的数据映射图中选择有限的选项。它不能发明新的连接,也不能编写代码片段。一旦 AI 做出选择,一个确定性的引擎就会接管。这个引擎是一段遵循固定规则的软件,负责将 AI 的选择转化为最终的数据库查询。它会检查错误,确保逻辑成立,并且只有在通过所有检查后才会发布代码。如果 AI 的选择不明确或违反了规则,系统会拒绝回答,而不是进行猜测。
为了测试这一点,研究人员使用了一个基于保险公司数据的基准测试,其中涉及许多复杂的逻辑关系,例如一个人可能扮演的不同角色(如投保人、代理人或核保员),以及这些角色如何与保单和理赔相关联。他们在同一组三十八个问题上运行了两个不同的系统。第一个系统是传统方法,即 AI 直接根据数据库结构生成代码。第二个系统是新的引导式方法。他们对每个问题运行了三次,以观察结果的一致性。传统系统仅在三十八个问题中的二十一个问题上实现了三次运行均获得正确答案。相比之下,引导式系统在三十-八个问题中的三十七个问题上都取得了成功。更重要的是,传统系统出现了二十九次代码运行成功但答案错误的情况。而引导式系统产生的此类错误为零。当它失败时,它只会拒绝给出答案,而不是提供一个误导性的数字。
研究还观察了当数据被轻微改动以暴露隐藏错误时会发生什么。在保险数据集中,某些问题要求在特定的细节层级进行计数。如果计算机错误地连接了表,可能会意外地使数字翻倍,从而产生过高的结果。研究人员创建了数据库的“反事实”(counterfactual)版本,使得这些乘法错误变得显而易见。他们发现,传统系统经常无法捕捉到这些错误,返回在原始数据上看起来正确但在修改后的数据上却是错误的膨胀数字。引导式系统由于被迫遵循语义映射的严格规则,避开了这些陷阱。即使在数据被用来欺骗不够细心的系统时,它也能始终如一地产生正确的计数。
研究人员谨慎地指出,他们的成功来自于整个系统的协同工作,而不仅仅是新的软件引擎。引导式系统可以访问一份详细的人类编写的业务规则图谱,而传统系统则没有。这意味着这种进步是结合了更好的知识与更严谨的过程。该研究并不声称这种新方法适用于所有可能的问题,也不声称它消除了所有的不确定性。人工智能仍然需要做出最初的选择,如果业务规则没有在映射图中得到妥善定义,系统将拒绝回答。然而,对于在保险领域中发现的这类特定类型的复杂、规则密集型问题,引导式 AI 与刚性编译器相结合,证明了是一种确保可靠性的强大方式。
研究结果表明,我们未来构建此类工具的方式可能会发生转变。与其寄希望于大型语言模型每次都能处理好复杂的逻辑,不如构建能够约束模型做出安全选择的系统,然后使用确定性软件来执行这些选择。这种方法是用一定的灵活性换取更高程度的信任。在一个数据驱动关键商业决策的世界里,能够说“我不知道”而不是“这是错误的答案”是一个显著的优势。研究表明,通过将逻辑和连接的重任从概率模型转移到基于规则的引擎,我们可以实现以前难以达到的稳定性。其结果是一个不仅聪明,而且可靠的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。