← 最新论文
💬 NLP

PRACTIQ: A Practical Conversational Text-to-SQL dataset with Ambiguous and Unanswerable Queries

本文介绍了 PRACTIQ,这是一个全新的对话式 Text-to-SQL 数据集,其特点是包含受真实世界交互启发而产生的歧义性和无法回答的查询,并通过基于大语言模型的基准测试表明,当前的先进系统在有效处理这些实际挑战方面仍面临困难。

原作者: Mingwen Dong, Nischal Ashok Kumar, Yiqun Hu, Anuj Chauhan, Chung-Wei Hang, Shuaichen Chang, Lin Pan, Wuwei Lan, Henghui Zhu, Jiarong Jiang, Patrick Ng, Zhiguo Wang

发布于 2026-01-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingwen Dong, Nischal Ashok Kumar, Yiqun Hu, Anuj Chauhan, Chung-Wei Hang, Shuaichen Chang, Lin Pan, Wuwei Lan, Henghui Zhu, Jiarong Jiang, Patrick Ng, Zhiguo Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向一位图书管理员询问一本特定的书。在大多数计算机科学测试所构想的完美世界里,你走上前说:“我想要作者 X 在 1990 年出版的那本书”,然后图书管理员会立刻把那本完全正确的书递给你。

但在现实世界中,情况要混乱得多。你可能会说:“我想要作者 X 的书”,但图书馆里有三本由该作者写的书,而你并没有说明是哪一本。或者,你可能会询问一本他们的馆藏中根本不存在的书。如果图书管理员只是瞎猜,或者在不解释原因的情况下直接说“我做不到”,你会感到很沮丧。

这篇名为 PRACTIQ 的论文,旨在教计算机(具体来说是那些将人类问题转化为数据库查询语句的 AI 系统)如何处理这些混乱的现实情况。

以下是他们工作的拆解,使用了简单的类比:

1. 问题所在:“过于完美”的图书管理员

现有的多数 AI 训练数据就像是一个所有请求都非常完美的图书馆。用户提出清晰的问题,答案也确实存在。

  • 现实情况: 现实中的用户会提出令人困惑的问题(歧义性 Ambiguous),或者询问不存在的事物(不可回答性 Unanswerable)。
  • 差距: 现有的 AI 系统擅长处理“完美”的问题,但当面对困惑或缺失的数据时,它们就会崩溃或给出荒谬的答案。它们还没有被训练去说:“等等,你是说这本书还是那本书?”或者“抱歉,我们没有这本书。”

2. 解决方案:构建一个“混乱”的图书馆 (PRACTIQ)

作者创建了一个名为 PRACTIQ 的新数据集。你可以把它看作是一本为新图书管理员编写的训练手册,其中充满了困难、令人困惑且无法完成的请求。

他们确定了 8 种特定的麻烦类型

  • 4 种困惑类型 (歧义性 Ambiguous):
    • 示例: 你询问一名访客的“年龄”。数据库中有“入境年龄”和“当前年龄”。你想要哪一个?
    • 示例: 你询问“年轻”的人。这指的是 18 岁以下?还是 21 岁以下?这个定义是模糊的。
  • 4 种不可能类型 (不可回答性 Unanswerable):
    • 示例: 你询问一位获胜者的“绰号”,但数据库中只有他们的法定姓名。信息根本不存在。
    • 示例: 你试图连接两个没有任何关联的数据列表(比如尝试将学生列表与图书馆书籍列表进行连接,但两者之间没有共同的 ID)。

3. 他们是如何制作数据的:“逆向工程”技巧

他们没有仅仅编写虚假的问题,而是使用了一个巧妙的三步流程来构建真实的对话:

  1. 第一阶段:破坏数据库: 他们拿取一个正常的、干净的数据库,并故意将其“破坏”或使其变得混乱。他们可能会删除一列,或者添加两个看起来一样但含义不同的列。
  2. 第二阶段:对话剧本: 他们要求 AI 编写一个剧本,其中:
    • 用户提出一个令人困惑的问题。
    • 助手(AI)意识到这种困惑并询问:“你是说 X 还是 Y?”
    • 用户进行澄清:“噢,我指的是 X。”
    • 助手给出正确的答案,并用通俗易懂的语言进行解释。
    • 特别转折: 有时,助手在寻求澄清之前,也会聪明地同时给出两个答案,以提供额外的帮助。
  3. 第三阶段:润色: 他们再次使用 AI 让对话听起来更自然,就像两个真人在交谈,而不是机器人在读剧本。

4. 测试:AI 能应对这种混乱吗?

作者使用这个新的“混乱”数据集测试了当今最智能的 AI 模型(如 Claude 3.5 和 Llama 3)。

结果:

  • AI 仍在挣扎。 即便是最优秀的模型,在处理这些困惑性问题时,正确率也仅为 70-77% 左右。
  • “完美”与“现实”的差距: 这些模型在处理“干净、完美”的问题时表现出色(正确率约为 79%),但当问题具有歧义或数据缺失时,它们的表现会显著下降。
  • 教训: 现在的 AI 就像是一个能考过教科书内容、但在老师提问刁钻问题时却不及格的学生。它们需要更多关于如何处理困惑和缺失信息的训练。

总结

这篇论文介绍了 PRACTIQ,这是一个旨在教 AI 如何处理现实世界中困惑情况的新数据集。它表明,虽然 AI 在将问题转化为数据库指令方面做得越来越好,但它仍然需要学习如何在问题含糊不清时礼貌地请求澄清,或者在答案不存在时承认事实,而不是仅仅进行猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →