← 最新论文
💬 NLP

Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering

本文认为,当前大语言模型的不确定性量化方法从根本上存在缺陷,因为它们仅通过无监督聚类来衡量内部生成的一致性,而非外部事实的正确性,从而制造出一种无法识别自信幻觉的虚假安全感。

原作者: Tiejin Chen, Longchao Da, Xiaoou Liu, Hua Wei

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Tiejin Chen, Longchao Da, Xiaoou Liu, Hua Wei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对该论文的解读。

核心理念:“回声室”问题

想象一下,你试图核实一条谣言是否真实。你问一群朋友:“这条谣言是真的吗?”他们异口同声地大喊:“是的!”你可能会想:“哇,他们都同意,所以这一定是真的!”

本文认为,当前用于检测 AI 是否自信或困惑的方法,恰恰在做同样的事情。 它们让 AI 以不同方式重复自己,检查答案听起来是否一致(内部一致性),并假设如果答案一致,它们就一定是正确的。

作者声称这是一种范畴错误。他们指出,这些方法实际上并没有衡量“真理”;它们只是在聚类(分组)听起来相似的答案。如果 AI 自信地犯了错,并且五次重复了同样的错误,系统会想:“太棒了!高置信度!”而它本该尖叫:“危险!幻觉!”

三大主要问题(“病理”)

该论文指出了这种“聚类”方法失效的三种具体方式:

1. “旋钮敏感”陷阱(超参数敏感性)

  • 类比: 想象一个金属探测器,只有当你以非常特定的角度拿着它并以特定速度行走时,它才会发出哔哔声。如果你倾斜一度或快走一步,它就会停止工作。
  • 现实: 当前的 AI 安全检查对微小的设置(例如允许 AI 有多“随机”)极其敏感。如果研究人员微调这些设置,安全评分会发生剧烈变化。这使得这些工具在现实世界中无法被信任,因为我们不知道哪个“旋钮设置”才是正确的。

2. “回声室”陷阱(内部评估)

  • 类比: 想象一个学生写了一篇假的历史论文。如果他把同一个假故事连续写三遍,他可能会感到非常自信。但如果你问老师,老师会说:“虽然内容一致,但这仍然是谎言。”
  • 现实: 当前方法假设如果 AI 是一致的,它就是正确的。但 AI 模型经常陷入“自信的幻觉”——它们一遍又一遍地重复同一个谎言。安全检查看到了重复,认为“高置信度”,从而批准了这个谎言。它将稳定性(说同样的话)与真理混淆了。

3. “橡皮尺”陷阱(缺乏真实基准)

  • 类比: 想象试图用橡皮筋作为尺子来测量桌子的长度。如果橡皮筋被拉伸,你的测量结果就会改变。更糟糕的是,如果你用另一根橡皮筋来检查第一根,你只是在比较两个有弹性的东西。
  • 现实: 要判断 AI 是否不确定,我们需要知道“正确答案”。但对于开放式问题,通常没有单一的“正确答案”可供核对。因此,研究人员使用其他 AI 模型来检查第一个 AI。这是循环论证:用橡皮筋测量另一根橡皮筋。本文认为,这制造了一种虚假的安全感,因为没有坚实的“真实基准”来锚定测量结果。

proposed 解决方案:新路线图

作者建议我们停止试图修复“聚类”方法,转而建立一个真正对照现实进行检查的系统。他们提出了一个三步计划:

1. 测试最坏情况,而非平均水平

  • 类比: 不要只在风平浪静的一天测试降落伞。要在狂风呼啸、降落伞缠绕时进行测试。
  • 计划: 停止根据 AI 在“简单”问题上的表现来评判其安全性。相反,专门针对它最有可能自信犯错的时刻进行压力测试。如果安全系统未能捕捉到自信的谎言,即使它在 99% 的简单问题上有效,它也失败了。

2. 将不确定性植入 AI 的 DNA

  • 类比: 不要等汽车已经超速后,再问它“你确定能开这么快吗?”,而是将速度表硬连线到引擎中,在驾驶员开得太快之前就发出警告。
  • 计划: 不要只在 AI 完成输出后分析其结果。训练 AI 本身,让它知道何时不确定。教它说“我不确定”或“这只是猜测”,而不是仅仅自信地猜测。

3. 使用“原子事实”检查

  • 类比: 不要问朋友“整个故事是真的吗?”,而是将故事分解为微小的事实:“这件事发生在周二吗?”“那个人戴红帽子了吗?”将每个微小事实与图书馆或数据库进行核对。
  • 计划: 不要让 AI 自我评判。将其答案分解为微小的、不可分割的事实,并将这些具体事实与现实世界的数据库、代码执行或搜索引擎进行核对。这将 AI 的置信度锚定在客观现实中,而不仅仅是它自己的内部感受。

结论

该论文总结道,我们目前正使用无监督聚类(对相似答案进行分组)来试图解决一个需要监督验证(对照真理进行检查)的问题。

只要我们要依赖仅检查 AI 是否“与自身一致”的方法,我们就将对自信的幻觉视而不见。为了让 AI 在法律和医疗等高利害领域安全可用,我们必须停止信任 AI 的内部回声室,转而将其置信度锚定在客观的外部现实中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →