← 最新论文
💬 NLP

Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification in Large Language Models

该论文提出了“聚类自评估”(Clustered Self-Assessment),这是一种简单且高效的方法,通过将采样的生成内容聚类为语义选项以进行自评估,从而提升了大型语言模型的不确定性量化能力,且即使在仅进行极少量额外采样的情况下,也能持续优于现有的基准方法。

原作者: Qi Cao, Takeshi Kojima, Andrew Gambardella, Helinyi Peng, Yutaka Matsuo, Yusuke Iwasawa

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Qi Cao, Takeshi Kojima, Andrew Gambardella, Helinyi Peng, Yutaka Matsuo, Yusuke Iwasawa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在向一位非常聪明、博学的朋友(一个大语言模型,或称 LLM)提问。他们瞬间给出回答,语法完美,语气极其自信。但问题在于,有时候他们会错得理直气壮。他们可能会告诉你埃菲尔铁塔在柏林,听起来就像告诉你在巴黎一样笃定。

问题是,你无法判断他们是在陈述事实,还是仅仅在进行一种听起来很有道理的“幻觉”式谎言。

这篇论文介绍了一个简单的技巧,叫做聚类自我评估(Clustered Self-Assessment),旨在帮助你判断该在多大程度上信任你的 AI 朋友给出的答案。

问题所在:“自信的骗子”

目前的 AI 模型擅长交谈,但不擅长承认自己不知道某些事情。如果你问它们:“你有多确定?”它们通常会说:“100% 确定!”即便它们其实错了。其他方法试图通过观察如果问同一个问题十次,AI 会给出多少种不同的答案来猜测其置信度,但这些方法往往难以理解,且未能有效地利用 AI 自身的“大脑”。

解决方案:“多选题测试”

作者提出了一个巧妙的两步游戏,让 AI 检查自己的工作。

第一步:“头脑风暴”环节
首先,你多次询问 AI 同一个问题(只需多问几次即可)。

  • 类比: 想象你连续五次问你的朋友:“埃菲尔铁塔在哪里?”他们可能会回答“巴黎”、“法国巴黎”、“法国首都”、“柏林”和“罗马”。

第二步:“分组”游戏
接下来,你将这些答案进行分组,把意思相同的答案归为一类。

  • 类比: 你意识到“巴黎”、“法国巴黎”和“法国首都”表达的是同一件事。于是你把它们放进一个堆里。“柏林”和“罗马”则不同,所以它们各占一个堆。现在你有了三个截然不同的组:巴黎组、柏林组和罗马组。

第三步:“问答秀”
现在,你把这个过程反转过来,把问题抛回给 AI。你向它展示原始问题,但这次你给它一份多选题,选项就是你刚刚创建的那些组。

  • 问题: “埃菲尔铁塔在哪里?”
  • 选项:
    • A) 巴黎组
    • B) 柏林组
    • C) 罗马组
    • D) 以上皆非

第四步:“置信度评分”
最后,你要求 AI 选出一个答案。奇迹发生在这里:我们观察 AI 为它选择的选项所分配的数学概率

  • 如果 AI 选择了“A”(巴黎)并给出了 95% 的概率,这意味着它在说:“我非常有信心这个组是正确的。”
  • 如果它选择了“A”,但只给了 40% 的概率(并且在 A、B、C 之间犹豫不决),这意味着它在说:“我不太确定哪个组才是正确的。”

为什么这很重要

论文声称这种方法之所以胜出,主要有三个原因:

  1. 快速且廉价: 你不需要询问 AI 16 次才能得到好的结果。只需额外采样两次(即多问两次问题)就足以获得优于那些询问 16 次的方法的结果。这就像是在喝杯咖啡的间隙就能得到一个好答案,而不是要吃顿长午餐。
  2. 易于理解: 它不会给你一个像“熵:0.84”这样令人困惑的数学分数,而是给你一个简单的百分比(例如“85% 置信度”)。这是一个普通人类可以实际使用的指标,用来决定是否应该相信这个答案。
  3. 效果更好: 当研究人员在不同的 AI 模型和不同类型的问题(从百科知识到新闻摘要)上测试该方法时,该方法在预测 AI 置信度方面始终比所有其他流行方法更准确。

局限性(不足之处)

作者诚实地指出了其中的缺陷:

  • “黑盒”问题: 要实现这一点,你需要看到 AI 的内部数学逻辑(其“logits”)。如果你使用的是闭源 AI(例如你无法看到其内部运作机制的付费 API),则无法使用此方法。
  • “裁判”成本: 为了在第二步中对答案进行分组,该方法使用了一个单独的、较小的 AI 模型来充当裁判。这增加了一点额外的计算工作量。
  • 缺乏“校准”步骤: 该方法直接使用 AI 给出的原始数值。虽然这些数值表现良好,但作者承认,如果增加一个最终的“微调”步骤,可能会使其更加完美。

总结

简而言之,这篇论文建议,与其去猜测 AI 有多确定,不如让 AI 根据其之前的回答进行一场多选题测试。通过观察 AI 选择某个选项的强度,我们得到了一个清晰、简单且高度准确的“置信度计”,它能告诉我们何时该信任 AI,以及何时该去核实它的工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →