← 最新论文
💬 NLP

DECK: A Consistency x Confidence Taxonomy of LLM Hallucinations

本文引入了 DECK,一种全新的 2x2 分类法,该分类法基于样本间一致性和标记级置信度的检测特征对大语言模型(LLM)幻觉进行分类,揭示了特定的错误类型(漂移、根深蒂固、虚构、纠缠)需要不同的检测方法,并暴露了一个普遍的盲点,即在知识缺口输入下,那些具有高置信度且可重复的编造内容,对于目前的输出级不确定性量化方法而言仍是无法检测的。

原作者: Mohit Singh Chauhan

发布于 2026-06-02✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohit Singh Chauhan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、自信的机器人来回答问题。有时,这个机器人会编造事实。我们将这些错误称为“幻觉”(hallucinations)。

长期以来,研究人员一直试图根据错误的内容来对这些错误进行分类(例如,“它弄错了事实”或“它的推理能力很差”)。但本文的作者 Mohit Singh Chauhan 表示,这就像是根据“撞到了树”还是“撞到了墙”来对车祸进行分类。这只能告诉你发生了什么,但并没有告诉你如何能在车祸发生前抓住司机

本文引入了一种新的错误分类方法,称为 DECK。DECK 不关注错误的内容,而是观察错误留下的信号。它在问:“哪种类型的检测器能发现这个错误?”

两个检测器(两个轴)

为了构建这个系统,作者使用了两个简单的“传感器”来监视机器人:

  1. 一致性传感器(“重复”测试): 如果你问机器人同一个问题 10 次,它每次都会给出相同的答案吗?
    • 高一致性: 它重复相同的答案。
    • 低一致性: 它每次给出的答案都不一样。
  2. 置信度传感器(“确定性”测试): 机器人的语气听起来有多确定?它是以 100% 的确定性说话,还是显得有些犹豫?
    • 高置信度: “我 100% 确定。”
    • 低置信度: “我可能觉得……”

DECK 分类法(四个方框)

通过交叉这两个传感器,作者创建了一个 2x2 的网格,其中包含四种类型的错误。他们还给它们起了朗朗上口的名字:

1. 漂移 (Drift) —— “迷茫的漂流者”

  • 表现形式: 机器人很自信,但每次询问时都会给出不同的错误答案
  • 类比: 想象一个导游,声音很大且非常自信,但每当你问“博物馆在哪里?”时,他指的方向都不一样。他很自信,但他正在“漂移”。
  • 谁能发现它? 黑盒检测器(一种检查答案是否相互匹配的检测器)会发现这一点,因为答案并不一致。

2. 固着 (Entrenched) —— “倔强的骡子”

  • 表现形式: 机器人很自信,并且每次都给出完全相同的错误答案
  • 类比: 这就像一个背错了答案表的学生。如果你问他“2+2 等于几?”,无论你问多少次,他都会自信地回答“5”。他陷入了错误的认知中,无法自拔。
  • 谁能发现它? 这是最难的一种。一致性检测器会认为它是正确的,因为它表现得很一致!只有裁判(第二个了解事实的独立 AI)才能发现它。

3. 虚构 (Confabulation) —— “犹豫的编造者”

  • 表现形式: 机器人很不确定,并且每次给出的错误答案都不一样
  • 类比: 机器人承认:“我不知道,但我猜是……或者也许是另外这个猜测?”它在编造事实,但它知道自己在瞎猜。
  • 谁能发现它? 所有人都能发现。因为它既缺乏信心又不一致,所以所有的检测器都会将其标记为“有风险”。

4. 纠结 (Knotted) —— “卡住的灌木丛”

  • 表现形式: 机器人很不确定(低置信度),但每次都给出完全相同的错误答案
  • 类比: 想象一个害怕出错的机器人,它不断重复说:“我不确定,但我大概觉得是 X”,而且它每次都说“大概是 X”。它被“纠结”在了一个安全、重复但错误的正向模式中。
  • 谁能发现它? 白盒检测器(一种查看机器人内部数学逻辑的检测器)会发现这一点,因为机器人的内部数学逻辑显示它其实并不确定,尽管答案是重复的。

重大发现:“普遍盲点”

研究人员发现了一个可怕的情况,即所有检测器同时失效。

他们在针对那些没有人能回答的问题(例如“一个不存在的国家的首都是哪里?”)上测试了机器人。

  • 机器人没有说“我不知道”。
  • 相反,它们自信地编造了一个虚假答案,并每次都重复它。

这制造了一个完美的陷阱:

  • 一致性传感器看到它们在重复答案,所以认为:“太棒了,它很一致!”
  • 置信度传感器看到它们听起来很确定,所以认为:“太棒了,它很有信心!”
  • 裁判也失败了,因为裁判也不知道那个问题的答案(因为那个国家并不存在)。

作者称之为**“普遍盲点” (Universal Blind Spot)**。当机器人对于它一无所知的事情自信地重复谎言时,目前的任何检测器都无法捕捉到它。

解决方案

论文建议,与其试图建立一个更好的检测器来捕捉这些特定的谎言,不如建立一个**“拒绝信封” (Refusal Envelope)**。这就像是一个俱乐部的保安。如果问题涉及机器人不应该知道的内容(知识空白),保安应该在机器人尝试编造答案之前,阻止它回答并说:“我无法回答这个问题。”

总结

这篇论文不仅仅是在说“AI 会犯错”。它是在说:“AI 以四种特定的模式犯错。有些模式容易被发现,有些很难,而有一种特定的模式(对于未知事物自信地重复谎言)目前是用现有工具无法捕捉的。我们需要在机器人尝试回答这些问题之前,就阻止它回答。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →