A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering
本文介绍了 Sem-ECE,这是一个新颖的框架,它通过采样模型输出并将其分组为语义类别来评估开放性问题回答中的校准性,从而提供一种无偏且稳健的指标,该指标优于现有的语言化和基于采样的方法,特别是在内部模型概率不可用的情况下。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在聘请一支专家团队来回答高难度的冷知识问题。你不仅想知道他们回答了什么,还想知道他们对答案有多大的把握。如果一位专家说:“我有 90% 的把握首都就是巴黎”,你希望知道他们是否真的在 90% 的情况下都是正确的。这种置信度与准确率之间的对齐被称为校准。
在人工智能(大语言模型)的世界里,这很棘手。当模型给出简短的选择题答案时,我们可以轻松验证其数学逻辑。但当它撰写长篇开放式文章或创意故事时,检查其置信度就像试图测量云的温度一样困难。
本文介绍了一种测量这种“温度”的新方法,称为Sem-ECE。以下是其工作原理,通过简单的类比进行拆解。
问题所在:“过度自信的学生”
目前检查 AI 置信度的方法存在缺陷:
- 直接询问 AI:如果你问 AI“你有多大的把握?”,它往往会撒谎或猜测,通常表现得比实际更自信。这就像一个学生举手大喊“我有 100% 的把握!”,即使他只是在瞎猜。
- 查看代码(Logits):有时,我们可以窥探 AI 的“大脑”以查看其内部数学运算。但大多数商业 AI 服务(如医生或律师使用的服务)不允许我们查看这些内容。这就像试图通过观察魔术师的手来判断其戏法,但他们却戴着手套。
- 重复提问:如果你向 AI 提出同一个问题 50 次,它可能会给出 50 个略有不同的答案。如果其中 49 个回答是“巴黎”,1 个是“伦敦”,我们可能会猜测它对“巴黎”很有把握。但现有的执行方法杂乱无章,且依赖于僵硬的规则,一旦 AI 用不同的词语表达相同的意思,这些规则就会失效。
解决方案:"Sem-ECE"框架
作者提出了一种名为Sem-ECE(语义采样期望校准误差)的新方法。你可以将其想象为一个品尝测试小组。
与其只问 AI 一次,不如问它50 次。
- 采样:你得到 50 个不同的答案。
- 分组(语义聚类):你不仅仅统计完全匹配的字词。你使用一位聪明的裁判(另一个 AI)将含义相同的答案归为一组。
- 示例:“首都是巴黎”、“是巴黎”和“法国巴黎”都会被归入同一个“巴黎”桶中。
- 频率:如果 50 个答案中有 40 个最终落入“巴黎”桶,那么 AI 的置信度就是 80%。
两种新的估计器:“同一样本”与“保留样本”
本文介绍了两种计算置信度的具体方法,将它们比作两种不同的考试评分方式。
1. Sem1-ECE:“同一样本”分数(有偏见的裁判)
这种方法从 50 个样本中选出最受欢迎的回答,并使用相同的 50 个样本来计算置信度。
- 缺陷:这就像一位老师利用参加考试的同一批学生来确定及格线。因为老师是从该特定群体中选出“优胜者”的,他们很可能会高估该优胜者的水平。在统计学中,这被称为**“赢家诅咒”**。AI 看起来比实际更自信,因为它是在用自己用来选择答案的同一组数据来评判自己。
2. Sem2-ECE:“保留样本”分数(公平的裁判)
这种方法将 50 个样本分为两组:
- A 组(25 个样本):用于选出“优胜”答案。
- B 组(25 个样本):仅用于统计该优胜答案出现的频率。
- 优势:这就像一位老师从班级前半部分选出最佳文章,然后利用班级后半部分作为参考来给这篇特定文章评分。因为 B 组没有参与选出优胜者,所以置信度分数更公平、更准确。它避免了“赢家诅咒”。
重大发现:简单问题与困难问题
本文从数学上证明了:
- 在简单问题上:两种方法达成一致。AI 非常确定,“赢家诅咒”的影响不大。
- 在困难问题上:两种方法出现分歧。“同一样本”方法(Sem1)保持过度乐观,而“保留样本”方法(Sem2)则正确地降低了置信度分数。
- 差距作为诊断工具:两个分数之间的差异充当了难度计。如果两个分数相差甚远,说明问题很难,AI 正在挣扎。如果它们很接近,说明问题很简单。
结果:他们的发现
作者在三个困难的问题集(从简单事实到专家级科学)上,对五个主要 AI 模型(如 GPT-4、Claude、Gemini)进行了测试。
- Sem2-ECE 胜出:在几乎所有情况下,“保留样本”方法(Sem2)比直接询问 AI 或使用“同一样本”方法,都能更准确地描绘 AI 的真实可靠性。
- 无需“手套”即可工作:即使你看不到 AI 的内部数学运算(logits),这种方法也有效。你只需要向它提问并阅读答案即可。
- 它能捕捉过度自信:研究表明,当模型出错时,它们往往认为自己是对的。Sem-ECE 通过显示 AI 的“置信度”(它重复某个答案的频率)与其实际“准确率”(该答案正确的频率)不匹配,从而揭露了这一点。
总结
想象你是一名驾驶飞机的飞行员。你需要知道你的导航系统是否可靠。
- 旧方法:询问系统“你确定吗?”(它回答“确定!”但可能是错的)。
- 新方法(Sem-ECE):让系统绘制 50 次航线。将相似的路径归为一组。如果 40 条路径向左,10 条向右,你知道它有 80% 的把握。但为了真正放心,你会将这 40 条路径与一组全新的 25 次模拟(Sem2)进行比对,以确保系统不是在自欺欺人。
本文提供了为 AI 执行这一操作的工具包,确保当模型声称自己有信心时,它确实如此。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。