Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification in Large Language Models
该论文提出了“聚类自评估”(Clustered Self-Assessment),这是一种简单且高效的方法,通过将采样的生成内容聚类为语义选项以进行自评估,从而提升了大型语言模型的不确定性量化能力,且即使在仅进行极少量额外采样的情况下,也能持续优于现有的基准方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在向一位非常聪明、博学的朋友(一个大语言模型,或称 LLM)提问。他们瞬间给出回答,语法完美,语气极其自信。但问题在于,有时候他们会错得理直气壮。他们可能会告诉你埃菲尔铁塔在柏林,听起来就像告诉你在巴黎一样笃定。
问题是,你无法判断他们是在陈述事实,还是仅仅在进行一种听起来很有道理的“幻觉”式谎言。
这篇论文介绍了一个简单的技巧,叫做聚类自我评估(Clustered Self-Assessment),旨在帮助你判断该在多大程度上信任你的 AI 朋友给出的答案。
问题所在:“自信的骗子”
目前的 AI 模型擅长交谈,但不擅长承认自己不知道某些事情。如果你问它们:“你有多确定?”它们通常会说:“100% 确定!”即便它们其实错了。其他方法试图通过观察如果问同一个问题十次,AI 会给出多少种不同的答案来猜测其置信度,但这些方法往往难以理解,且未能有效地利用 AI 自身的“大脑”。
解决方案:“多选题测试”
作者提出了一个巧妙的两步游戏,让 AI 检查自己的工作。
第一步:“头脑风暴”环节
首先,你多次询问 AI 同一个问题(只需多问几次即可)。
- 类比: 想象你连续五次问你的朋友:“埃菲尔铁塔在哪里?”他们可能会回答“巴黎”、“法国巴黎”、“法国首都”、“柏林”和“罗马”。
第二步:“分组”游戏
接下来,你将这些答案进行分组,把意思相同的答案归为一类。
- 类比: 你意识到“巴黎”、“法国巴黎”和“法国首都”表达的是同一件事。于是你把它们放进一个堆里。“柏林”和“罗马”则不同,所以它们各占一个堆。现在你有了三个截然不同的组:巴黎组、柏林组和罗马组。
第三步:“问答秀”
现在,你把这个过程反转过来,把问题抛回给 AI。你向它展示原始问题,但这次你给它一份多选题,选项就是你刚刚创建的那些组。
- 问题: “埃菲尔铁塔在哪里?”
- 选项:
- A) 巴黎组
- B) 柏林组
- C) 罗马组
- D) 以上皆非
第四步:“置信度评分”
最后,你要求 AI 选出一个答案。奇迹发生在这里:我们观察 AI 为它选择的选项所分配的数学概率。
- 如果 AI 选择了“A”(巴黎)并给出了 95% 的概率,这意味着它在说:“我非常有信心这个组是正确的。”
- 如果它选择了“A”,但只给了 40% 的概率(并且在 A、B、C 之间犹豫不决),这意味着它在说:“我不太确定哪个组才是正确的。”
为什么这很重要
论文声称这种方法之所以胜出,主要有三个原因:
- 快速且廉价: 你不需要询问 AI 16 次才能得到好的结果。只需额外采样两次(即多问两次问题)就足以获得优于那些询问 16 次的方法的结果。这就像是在喝杯咖啡的间隙就能得到一个好答案,而不是要吃顿长午餐。
- 易于理解: 它不会给你一个像“熵:0.84”这样令人困惑的数学分数,而是给你一个简单的百分比(例如“85% 置信度”)。这是一个普通人类可以实际使用的指标,用来决定是否应该相信这个答案。
- 效果更好: 当研究人员在不同的 AI 模型和不同类型的问题(从百科知识到新闻摘要)上测试该方法时,该方法在预测 AI 置信度方面始终比所有其他流行方法更准确。
局限性(不足之处)
作者诚实地指出了其中的缺陷:
- “黑盒”问题: 要实现这一点,你需要看到 AI 的内部数学逻辑(其“logits”)。如果你使用的是闭源 AI(例如你无法看到其内部运作机制的付费 API),则无法使用此方法。
- “裁判”成本: 为了在第二步中对答案进行分组,该方法使用了一个单独的、较小的 AI 模型来充当裁判。这增加了一点额外的计算工作量。
- 缺乏“校准”步骤: 该方法直接使用 AI 给出的原始数值。虽然这些数值表现良好,但作者承认,如果增加一个最终的“微调”步骤,可能会使其更加完美。
总结
简而言之,这篇论文建议,与其去猜测 AI 有多确定,不如让 AI 根据其之前的回答进行一场多选题测试。通过观察 AI 选择某个选项的强度,我们得到了一个清晰、简单且高度准确的“置信度计”,它能告诉我们何时该信任 AI,以及何时该去核实它的工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。