← 最新论文
💬 NLP

Towards Detecting Inconsistencies in End-to-end Generated TODs

本文提出了一种通过将对话建模为约束满足问题(CSP)来自动检测端到端生成的任务型对话中不一致性的新方法,旨在识别幻觉并提出旨在符合领域知识的最小修正建议。

原作者: Tiziano Labruna, Giovanni Bonetta, Bernardo Magnini

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Tiziano Labruna, Giovanni Bonetta, Bernardo Magnini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在玩一场高风险的“猜餐厅”游戏,对手是一位超级聪明但有点丢三落四的 AI 大厨。这位大厨有一份秘密菜单(知识库),上面准确列出了哪些餐厅存在、它们供应什么食物以及价格如何。你的任务是点餐,而大厨的任务是倾听你的请求并告诉你有哪些选择。

在过去,大厨是一个遵循严格规则手册的机器人:“如果用户要求西班牙菜,检查列表。如果列表显示‘2’,就说‘2’。”但现在,我们升级了这位大厨,将其变成了生成式 AI(大语言模型)。这位新大厨极其富有创造力,可以像人类一样聊天,但它也有一个危险的习惯:它有时会“幻觉”。它可能会自信满满地告诉你这里有家西班牙餐厅,而你的秘密菜单上只列出了家;或者在你一直询问西班牙菜时,它却向你推荐了一家黎巴嫩餐厅。

这篇论文正是关于构建一个“事实检查员”来捕捉这些可能毁掉你晚餐的谎言。

问题所在:创意大厨的失误

作者发现,即使是最优秀的 AI 大厨也经常出错,其频率高得令人惊讶。在一项研究中,他们展示了顶尖的开源 AI 模型在生成的对话中,出错率高达 59%。如果 AI 说一家餐厅很便宜,而实际上它很贵,或者凭空捏造了一个不存在的地方,整个对话就会失败。

论文反对那种认为我们可以仅仅依靠 AI “知道”事实的想法。相反,他们提议我们需要将对话视为一个逻辑谜题。

解决方案:“逻辑谜题”侦探

作者的核心思想是将对话不仅仅视为聊天,而是一个约束满足问题 (Constraint Satisfaction Problem, CSP)

把 CSP 想象成一场数独游戏。

  • 变量 (Variables): 这些是对话中的具体细节,比如“多少家餐厅?”或“什么类型的食物?”
  • 约束 (Constraints): 这些是规则。例如,“提到的餐厅数量必须与秘密菜单上的数量一致”,或者“在整个聊天过程中,食物类型必须保持一致”。
  • 求解器 (Solver): 这是一个专门的计算机程序(CSP 求解器),充当一名超级快速的侦探。它试图填补对话中的空白,以查看它们是否符合规则。

以下是他们的“侦探流水线”的工作步骤:

  1. 识别变量: 首先,系统扫描聊天内容并高亮显示重要的部分(如“西班牙”或“三”)。
  2. 设定规则: 它根据秘密菜单和对话逻辑编写规则(例如,“如果你之前说了‘西班牙’,除非有充分理由,否则之后不能切换到‘黎巴嫩’”)。
  3. 运行求解器: 侦探尝试寻找一个有效的解。它会问:“是否存在任何一种方式,能够填补这些空白,使其既符合秘密菜单又符合对话流?”
  4. 判定: 如果 AI 的聊天内容符合一个有效的解,那么它是连贯的。如果 AI 的聊天内容不符合任何有效的解,侦探就会将其标记为不连贯,甚至会建议完成修复所需的最小改动(比如将“三”改为“二”)。

研究发现(数据)

作者在 108 对对话数据集上测试了这个“逻辑谜题”侦探。他们将该方法与其他几种方法进行了比较:

  • 随机猜测: 如果你像抛硬币一样随机猜测“连贯”或“不连贯”,你的正确率是 50.0%
  • 完美人工标注: 如果他们使用完美的、预先标记的数据来喂给侦探,它的正确率达到了 91.6%。这证明了当数据干净时,逻辑谜题的思想是非常有效的。
  • 现实世界测试 (GPT-4o): 当他们使用现代 AI (GPT-4o) 来自动寻找变量,然后运行侦探程序时,系统的准确率达到了 75.9%

这表明,虽然 AI 目前在发现自身错误方面还不完美,但 CSP 方法是捕捉这些错误的有力工具。

测试 AI 的“记忆力”

作者还进行了另一项实验,观察 AI 模型在被要求重写对话时能否遵循规则。他们提取一段对话,抹去具体的细节(如餐厅名称),然后要求 AI 使用秘密菜单将它们填回去。

结果让 AI 显得有些逊色:

  • 即使是最聪明的模型(GPT-4o 和 GPT-o1),也只能在 14% 的情况下实现整个对话的正确(全局一致性准确率)。
  • 然而,它们在单个细节上的正确率约为 41-42%(变量一致性准确率)。

这表明,虽然 AI 在遵循规则方面正在进步,但它仍然难以保持整个故事的连贯性。论文发现,最难遵守的规则是 C6:匹配菜单中物品的精确数量。如果菜单上有两家西班牙餐厅,AI 经常会猜成三家或者说“很多”,从而在数学检查上失败。

本论文排除的情况

作者谨慎地指出,这种方法不是什么能自动将 AI 糟糕的句子改写成完美、流畅英语的魔杖。系统可以指出错误并建议修复方案(如“将‘三’改为‘二’”),但它不会自动为你生成新的、流畅的句子。那是未来工作的内容。

它也不是一种无需设置就能完美适用于任何对话的方法。系统需要知道特定领域内的“槽位”(如食物、价格、区域)以及特定的菜单。它不是一个通用的“常识”检查器;它是一个针对特定主题的特定事实检查器。

核心结论

论文得出结论,将对话一致性视为逻辑谜题是捕捉 AI 幻觉的一种强大方法。它表明,虽然大语言模型在听起来像人方面做得很好,但在坚持事实方面仍然很不靠谱。通过使用 CSP 求解器,我们可以自动捕捉大约 75.9% 的不一致情况。

作者承认,他们的结果是基于受控实验和特定数据集的,因此我们还不知道这在复杂、不可预测的现实世界中表现如何。但就目前而言,这是确保我们的 AI 大厨不会为我们提供虚构餐食的坚实一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →